Povolení zpracování priority pro modely Microsoft Foundry

Prioritní zpracování poskytuje nízkou latenci s pružností platby podle potřeby. V tomto článku povolíte zpracování priority v nasazení modelu, ověříte, která úroveň služby zpracovávala vaše požadavky, a budete monitorovat související náklady.

Požadavky

  • Předplatné Azure – Kreate si ho zdarma.
  • Projekt Microsoft Foundry s modelem nasazení typu GlobalStandard nebo DataZoneStandard byl nasazen.
  • Verze 2025-12-01 modelu nebo novější.

Klíčové případy použití

  • Konzistentní a nízká latence pro responzivní uživatelské prostředí
  • Jednoduchost průběžných plateb bez dlouhodobých závazků.
  • Provoz v běžné pracovní době nebo nárazový provoz, který využívá výhod škálovatelného a nákladově efektivního výkonu. Volitelně můžete kombinovat zpracování priority se zřízenými jednotkami propustnosti (PTU) pro zajištění kapacity stabilního stavu a optimalizace nákladů.

Cíl latence

Následující tabulka uvádí cílovou hodnotu latence pro každý model, který podporuje zpracování priority. Cílová hodnota latence se vypočítá jako latence požadavku p50 za 5 minut a vyjadřuje se jako prahová hodnota percentilu. Například 99% > 50 tokenů za sekundu (TPS) znamená, že 99% požadavků se zpracovává s více než 50 tokeny za sekundu.

Model Cílová hodnota latence
gpt-5.6-terra, 2026-07-091 99 % > 70 TPS
gpt-5.6-sol, 2026-07-091 99% > 50 TPS
gpt-5.5, 2026-04-24 99% > 50 TPS
gpt-5.4-mini, 2026-03-17 99% > 100 TPS
gpt-5.4, 2026-03-052 99% > 50 TPS
gpt-5.2, 2025-12-11 99% > 50 TPS
gpt-5.1, 2025-11-13 99% > 50 TPS
gpt-4.1, 2025-04-142 99% > 80 TPS

1Dlouhý kontext pro tento model, to znamená, že požadavky, u nichž se odhaduje, že překročí 272 tisíc tokenů vstupu, jsou přeřazeny na standardní zpracování a účtovány podle sazby standardní úrovně.

2Rozšířený kontext pro tento model, to znamená, že požadavky, u nichž se odhaduje, že překročí 128 tisíc tokenů promptu, jsou převedeny na standardní zpracování a jsou účtovány podle sazby standardní úrovně.

Dostupnost prioritního zpracování podle typu nasazení

Prioritní zpracování je možné povolit v nasazeních globálního standardu nebo v nasazeních standardu datové zóny (USA). Informace o cenách najdete na stránku ceníku Azure OpenAI.

Globální standardní dostupnost modelu

Oblasti gpt-5.6-terra, 2026-07-09 gpt-5.6-sol, 2026-07-09 gpt-5.5, 2026-04-24 gpt-5.4-mini, 2026-03-17 gpt-5.4, 2026-03-05 gpt-5.2, 2025-12-11 gpt-5.1, 2025-11-13 gpt-4.1, 2025-04-14
australiaeast
Brazíliesouth
kanadacentral
canadaeast
centralus
eastus
eastus2
franciecentral
Německo západ střed
Severní Itálie
japaneast
koreacentral
northcentralus
norwayeast
polskocentral
southafricanorth
southcentralus
jihovýchodní Asie
Jižní Indie
španělskocentral
swedencentral
Severní Švýcarsko
Švýcarsko-západ
UAE Sever
uksouth
západní evropa
westus
westus3

Povolte prioritu zpracování na úrovni nasazení

Můžete povolit zpracování priority na úrovni nasazení a (volitelně) na úrovni požadavku.

Poznámka

Je možné povolit prioritní zpracování v nasazeních globálního standardu nebo standardu datové zóny (USA). Prioritní zpracování používá stejnou kvótu jako standardní zpracování.

Na portálu Microsoft Foundry zapněte Zpracování priority při vytváření nasazení, nebo tak aktualizujte nastavení nasazeného modelu úpravou podrobností nasazení.

Snímek obrazovky znázorňující, jak povolit zpracování priority během nasazení modelu na portálu Foundry

Poznámka

Pokud dáváte přednost použití kódu k povolení zpracování priority na úrovni nasazení, můžete to provést prostřednictvím rozhraní REST API pro nasazení nastavením atributu service_tier následujícím způsobem: "properties" : {"service_tier" : "priority"}. Povolené hodnoty atributu service_tier jsou default a priority. default předpokládá standardní zpracování, zatímco priority umožňuje zpracování podle priority.

Jakmile je nasazení modelu nakonfigurované tak, aby používalo zpracování priority, můžete do modelu začít odesílat požadavky.

Zobrazení metrik využití

Míru využití prostředku můžete zobrazit v části Azure Monitor na portálu Azure.

Pokud chcete zobrazit objem požadavků zpracovaných standardním zpracováním a zpracováním priority, rozdělte vrstvu služby (standard nebo prioritu), která byla v původním požadavku:

  1. Přihlaste se k https://portal.azure.com.
  2. Přejděte na prostředek Azure OpenAI a v levém navigačním panelu vyberte možnost Metrické metriky.
  3. Na stránce metrik přidejte metriku Azure OpenAI žádosti. Můžete také vybrat další metriky, jako je latence Azure OpenAI, využití Azure OpenAI a další.
  4. Zvolte Přidat filtr a vyberte standardní nasazení, ke kterému byly zpracovány prioritní požadavky.
  5. Chcete-li rozdělit hodnoty podle ServiceTierRequest a ServiceTierResponse, vyberte Použít rozdělení.

Screenshot využití prioritního zpracování na stránce metrik prostředku v portálu Azure.

Další informace o monitorování nasazení najdete v tématu Monitor Azure OpenAI.

Monitorování nákladů

Na stránce analýzy nákladů na portálu Azure můžete zobrazit rozpis nákladů podle priority a standardních požadavků tak, že vyfiltrujete název nasazení a fakturační značky následujícím způsobem:

  1. Přejděte na stránku analýzy nákladů na portálu Azure.
  2. (Volitelné) Filtrovat podle prostředku
  3. Pokud chcete filtrovat podle názvu nasazení: Přidejte filtr pro fakturační značku> , vyberte nasazení jako hodnotu a pak zvolte název nasazení.

Screenshot využití zpracování s prioritou na stránce analýzy nákladů prostředků v Azure portálu.

Informace o cenách pro prioritní zpracování najdete v přehledu cen služby Azure OpenAI Service.

Povolit prioritní zpracování na úrovni požadavku

Important

Od 25. září 2026 vyřazuje Foundry automatický návrat flex do standardního zpracování pro modely, které nepodporují zpracování Flex. V současné době se tyto požadavky vrátí do standardního zpracování, ale po datu vyřazení vrátí http 400 místo invalid_request_error toho. Než se tato změna projeví, ověřte, že váš model podporuje flexibilní zpracování. Pokud je standardní zpracování přijatelné, nastavte service_tier místo default toho.

Povolení zpracování priority na úrovni požadavku je volitelné. Rozhraní API pro dokončování chatu i odpovědi mají volitelný atribut service_tier , který určuje typ zpracování, který se má použít při poskytování požadavku. Následující příklad ukazuje, jak nastavit service_tier na priority v požadavku na odpovědi.

curl -X POST https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AZURE_OPENAI_AUTH_TOKEN" \
  -d '{
     "model": "gpt-4.1",
     "input": "This is a test",
     "service_tier": "priority"
    }'

Použijte atribut service_tier k přepsání nastavení na úrovni nasazení. service_tier může převzít hodnoty auto, defaulta priority.

  • Pokud atribut nenastavíte, nastaví se automaticky na auto.

  • service_tier = auto znamená, že požadavek používá úroveň služby nakonfigurovanou v nasazení.

  • service_tier = default znamená, že požadavek používá pro vybraný model standardní ceny a výkon.

  • service_tier = priority znamená, že požadavek využívá úroveň služby s prioritním zpracováním.

Následující tabulka shrnuje, která úroveň služeb zpracovává vaše požadavky podle nastavení úrovně nasazení a úrovně požadavků service_tier.

Nastavení na úrovni nasazení Nastavení na úrovni požadavku Požadavek zpracovaný podle úrovně služby
výchozí Automaticky, výchozí Standard
výchozí Priorita Prioritní zpracování
Priorita automatický, priorita Prioritní zpracování
Priorita výchozí Standard

Omezení

  • Služba v současné době nepodporuje regionální standardní nasazení a standardní nasazení datového pásma EU.

  • Služba může během těchto scénářů znovu směrovat požadavky na určité priority na standardní zpracování*:

    • Pokud se rychle zvýší počet vašich tokenů prioritního zpracování za minutu, může to vést k dosažení omezení na rampovací rychlost. V současné době je limit rychlosti rampy definován jako zvýšení provozu o více než 50% tokenů za minutu za méně než 15 minut.
    • Během období vrcholu prioritních žádostí o zpracování.
    • Dlouhé požadavky na kontext odeslané do určitých modelů uvedených v cílové tabulce latence

    Tip

    Pokud se běžně setkáte s limity rychlosti rampy, zvažte nákup PTU místo nebo kromě prioritního zpracování.

    * Žádosti na vyúčtování služeb zpracovávané úrovní služby Standard se standardními sazbami. Požadavky zpracovávané úrovní služby Standard zahrnují service_tier = default do odpovědi, zatímco požadavky zpracovávané vrstvou zpracování priority zahrnují service_tier = priority odpověď.

Řešení potíží

Problém Příčina Rozlišení
Požadavky downgradované na úroveň Standard Jedna z těchto situací:
- Provoz se zvýšil o více než 50% tokenů za minutu během méně než 15 minut, což dosáhlo limitu rychlosti rampy.
– Požadavky odeslané během období špičky jsou zpracovány s prioritou.
– Dlouhé požadavky na kontext odeslané do určitých modelů uvedených v cílové tabulce latence.
- Pokud jste narazili na limity rychlosti rampy, zvyšte provoz postupně.
- Zvažte nákup PTU pro dosažení rovnovážné kapacity.