Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Op deze pagina wordt prioriteit betalen per token voor Foundation Model-API's met betalen per token beschreven, inclusief hoe het zich gedraagt en hoe prioriteitsaanvragen worden verzonden.
Wat is betalen per token met prioriteit?
Prioriteit betalen per token, ook wel prioriteitsmodus genoemd, is een pay-per-token-mogelijkheid voor latentiegevoelige, realtime toepassingen. Wanneer u een aanvraag verzendt met de service_tier parameter die is ingesteld op"priority", geeft Azure Databricks de aanvraag toe vóór standaard best-effort betalen per tokenverkeer op hetzelfde model. Hierdoor blijft de beschikbaarheid consistenter tijdens perioden van hoog verkeer.
Prioriteitsbetaling per token kan per aanvraag worden ingeschakeld, zodat u aanvragen met prioriteit en standaardanvragen naar hetzelfde model kunt verzenden. Hiervoor is geen capaciteitstoezegging vereist en wordt gefactureerd tegen een hoger tarief per token dan standaard aanvragen voor betalen per token.
Databricks raadt prioriteitsmodus aan wanneer:
- U heeft consistentere prestaties en beschikbaarheid nodig dan bij het standaard betalen-per-token-model, maar bent nog niet klaar om u vast te leggen op toegewezen capaciteit.
- Voor uw productietoepassingen is een hogere beschikbaarheid vereist.
Ondersteunde modellen
De volgende modellen met betalen per token ondersteunen de prioriteitsmodus. Als u een prioriteitsaanvraag wilt verzenden, gebruikt u de eindpuntnaam van het model met de service_tier parameter ingesteld op "priority".
Important
Betalen per token met prioriteit is beschikbaar voor OpenAI- en Google Gemini-modellen via ADI Services, geleverd door Databricks. Zie ADI Services voor toegang tot deze partnermodellen in uw Azure Databricks-omgeving.
Opensource-modellen
| Provider | Model | Eindpuntnaam | Aantekeningen |
|---|---|---|---|
| Alibaba Cloud | Qwen3.5 122B A10B | databricks-qwen35-122b-a10b |
|
Hoe betaling per token met prioriteit zich gedraagt
Houd rekening met het volgende gedrag voordat u betalen per token met prioriteit gebruikt:
- Consistente prestaties en beschikbaarheid. Betalen per token met prioriteit is ontworpen om de beschikbaarheid consistent te houden onder belasting. Het garandeert geen specifieke doelstelling voor de tijd tot het eerste token of voor de end-to-end-latentie. Prioriteitsaanvragen zijn gericht op een hogere beschikbaarheid dan standaard aanvragen voor betalen per token. Azure Databricks definieert beschikbaarheid in een laag als het aantal geslaagde aanvragen gedeeld door het totale aantal toegelaten aanvragen in die laag.
- Capaciteit op basis van best effort. De prioriteitsmodus reserveert geen capaciteit en er is geen capaciteitstoezegging.
- Terugval naar standaard betalen per token. Als de prioriteitscapaciteit volledig is benut, worden aanvragen verwerkt tegen de standaard beschikbaarheid op basis van betalen per token en gefactureerd tegen de standaardtarieven op basis van betalen per token.
- Premie per token. Prioriteitsaanvragen worden gefactureerd met een hoger tarief per token dan standaard aanvragen voor betalen per token.
Prioriteitsbetaling per token vergeleken met ingerichte doorvoercapaciteit
Prioriteitsbetaling per token en geprovisioneerde doorvoer zijn beide gericht op productieworkloads, maar ze brengen verschillende afwegingen met zich mee:
| Consideratie | Prioriteit bij betalen per token | Toegewezen doorvoer |
|---|---|---|
| Capacity | Op basis van beschikbare capaciteit, gedeeld. | Toegewezen, gereserveerde capaciteit. |
| Toewijding | None. Meld u aan per aanvraag. | Hiervoor is een ingericht eindpunt vereist. |
| Availability | Consistenter dan standaard betalen per token onder belasting. | Voorspelbaar, op basis van gereserveerde capaciteit. |
| Billing | Per token, tegen een hoger tarief dan het standaardtarief per token. | Op basis van toegewezen modeleenheden. |
Een prioriteitsaanvraag verzenden
Als u de prioriteitsmodus wilt gebruiken, stelt u de service_tier parameter "priority" in op per aanvraag. In het volgende voorbeeld wordt de OpenAI-client gebruikt:
from databricks_openai import DatabricksOpenAI
client = DatabricksOpenAI()
response = client.chat.completions.create(
model="databricks-model-name",
messages=[
{
"role": "user",
"content": "What is a mixture of experts model?",
}
],
max_tokens=256,
service_tier="priority",
)
Zie naslaginformatie over de REST API van het Foundation-model voor parametersyntaxis en Foundation-modellen gebruiken voor meer queryopties.
Capaciteitslimieten
Elk cluster ondersteunt een maximumaantal tokens per minuut voor alle tenants. Azure Databricks stelt tijdens de onboarding een limiet per tenant in, zodat één tenant niet alle clustercapaciteit kan verbruiken. Als uw workload meer capaciteit vereist dan de limiet per tenant toestaat, neemt u contact op met uw Databricks-accountteam.
Zie Limieten en quota voor Foundation Model-API's voor meer limieten voor Foundation-model-API's.