Prioritní platba za token pro API modelů Foundation Model

Tato stránka popisuje priority plateb za token pro rozhraní API základního modelu s platbami za token, včetně toho, jak se chová a jak odesílat žádosti o prioritu.

Co je prioritní platba za token?

Prioritní platba za token, označovaná také jako prioritní režim, je možnost účtování za token pro aplikace v reálném čase citlivé na latenci. Když odešlete požadavek s parametrem service_tier nastaveným na "priority", Azure Databricks tento požadavek upřednostní před standardním provozem best-effort s platbou za token pro stejný model. Tím zajistíte konzistentnější dostupnost během období vysokého provozu.

Prioritní platba za token se aktivuje pro každý požadavek, takže můžete odesílat prioritní i standardní požadavky do stejného modelu. Nevyžaduje žádný závazek kapacity a účtuje se vyšší sazbou za token než standardní požadavky na platby za token.

Databricks doporučuje režim priority v případech, kdy:

  • Potřebujete konzistentnější výkon a dostupnost než u standardního modelu platby za token, ale ještě nejste připraveni zavázat se k vyhrazené kapacitě.
  • Vaše produkční aplikace vyžadují vyšší dostupnost.

Podporované modely

Následující modely s platbou za tokeny podporují režim priority. Pokud chcete odeslat žádost o prioritu, použijte název koncového bodu modelu s parametrem nastaveným service_tier na "priority".

Important

Priority pay-per-token je k dispozici pro modely OpenAI a Google Gemini prostřednictvím služeb ADI, které poskytuje Databricks. Pokud chcete získat přístup k těmto partnerským modelům ve vašem prostředí Azure Databricks, přečtěte si téma Služby ADI.

Open source modely

Provider Model Název koncového bodu Poznámky
Alibaba Cloud Qwen3.5 122B A10B databricks-qwen35-122b-a10b
  • Tento model je k dispozici ve verzi Preview. Obraťte se na své account manažery ohledně zaškolení.
  • K dispozici pouze v westeurope oblasti.

Jak funguje prioritní platba za token

Než použijete prioritní platby za token, zvažte následující chování:

  • Konzistentní výkon a dostupnost. Prioritní platba za token je navržena tak, aby udržovala konzistentní dostupnost i při zátěži. Nezaručuje konkrétní cílovou hodnotu doby do prvního tokenu ani latence end-to-end. Prioritní požadavky cílí na vyšší dostupnost než požadavky na standardní platby za tokeny. Azure Databricks definuje dostupnost na úrovni jako počet úspěšných žádostí vydělený celkovým počtem přijatých požadavků na této úrovni.
  • Kapacita v nejlepším úsilí. Režim priority nerezervuje kapacitu a neexistuje žádný závazek kapacity.
  • Přechod zpět na standardní platbu za token. Pokud je prioritní kapacita zcela vyčerpaná, požadavky se zpracovávají v rámci standardní dostupnosti při průběžném účtování za token a účtují se standardní sazby za token.
  • Premium za token. Žádosti o prioritu se účtují s vyšší sazbou za token než standardní žádosti o platby za token.

Priorita plateb za token ve srovnání se zřízenou propustností

Prioritní platba za token a zřízená propustnost jsou obě určeny pro produkční úlohy, ale přinášejí různé kompromisy:

Consideration Prioritní platba za token Zřízená propustnost
Capacity Nejlepší úsilí, sdílené. Vyhrazená rezervovaná kapacita.
Závazek Žádný. Přihlaste se na žádost. Vyžaduje zřízený koncový bod.
Availability Stabilnější než standardní platba za token při zatížení. Předvídatelné na základě rezervované kapacity.
Billing Za token, s přirážkou oproti standardní sazbě za token. Na základě přidělených jednotek modelu.

Odeslání žádosti o prioritu

Chcete-li použít prioritní režim, nastavte parametr service_tier na "priority" pro každý požadavek. Následující příklad používá klienta OpenAI:

from databricks_openai import DatabricksOpenAI

client = DatabricksOpenAI()

response = client.chat.completions.create(
    model="databricks-model-name",
    messages=[
      {
        "role": "user",
        "content": "What is a mixture of experts model?",
      }
    ],
    max_tokens=256,
    service_tier="priority",
)

Další možnosti dotazů najdete v referenčních informacích k rozhraní REST API základního modelu pro syntaxi parametrů a použití základních modelů .

Limity kapacity

Každý cluster podporuje maximální celkový počet tokenů za minutu ve všech tenantech. Azure Databricks během onboardingu nastaví limit pro jednotlivé tenanty, aby jeden tenant nemohl využívat veškerou kapacitu clusteru. Pokud vaše úloha vyžaduje větší kapacitu, než umožňuje limit pro jednotlivé tenanty, obraťte se na tým účtů Databricks.

Další omezení rozhraní API modelu foundation najdete v tématu Omezení a kvóty rozhraní API modelu foundation.

Dodatečné zdroje