A Microsoft Foundry modellek prioritásos feldolgozásának engedélyezése

A prioritásos feldolgozás alacsony késésű teljesítményt biztosít, a használatalapú fizetés rugalmasságával. Ebben a cikkben egy modelltelepítésen engedélyezi a prioritásos feldolgozást, ellenőrzi, hogy melyik szolgáltatási szint dolgozta fel a kéréseit, és figyelemmel kíséri a kapcsolódó költségeket.

Előfeltételek

  • Egy Azure-előfizetés – Hozzon létre egyet ingyen.
  • Egy Microsoft Foundry projekt egy GlobalStandard vagy DataZoneStandard típusú üzembe helyezett modellel.
  • Modellverziók 2025-12-01 vagy újabb.

Kulcshasználati esetek

  • Konzisztens, alacsony késés a rugalmas felhasználói élmény érdekében.
  • Használatalapú fizetéses egyszerűség , hosszú távú kötelezettségvállalások nélkül.
  • A skálázható, költséghatékony teljesítmény előnyeit kihasználó munkaidő alatti vagy hirtelen megugró forgalom. Igény szerint kombinálhatja a prioritás-feldolgozást a kiosztott átviteli sebességegységekkel (PTU) az állandó állapotú kapacitás és a költségoptimalizálás érdekében.

Késleltetési cél

Az alábbi táblázat felsorolja az egyes prioritási feldolgozást támogató modellek késési célértékét . A késési célérték kiszámítása p50 kérelemkésés 5 percenkénti alapon történik, és percentilis küszöbértékként van kifejezve. Például a "99% > 50 token másodpercenként (TPS)" azt jelenti, hogy a kérések 99% másodpercenként több mint 50 tokent dolgoz fel.

Modell Késési célérték
gpt-5.6-terra, 2026-07-09 99% > 70 TPS
gpt-5.6-sol, 2026-07-09 99% > 50 TPS
gpt-5.5, 2026-04-24 99% > 50 TPS
gpt-5.4-mini, 2026-03-17 99 % > 100 TPS
gpt-5.4, 2026-03-051 99% > 50 TPS
gpt-5.2, 2025-12-11 99% > 50 TPS
gpt-5.1, 2025-11-13 99% > 50 TPS
gpt-4.1, 2025-04-141 99% > 80 TPS

1Hosszú kontextus ennél a modellnél, azaz a becslés szerint a 128 ezer prompttokent meghaladó kéréseket standard feldolgozásra minősítjük vissza, és a standard csomag díjszabása szerint számítjuk fel.

Prioritásfeldolgozás rendelkezésre állása üzembe helyezési típus szerint

A prioritásos feldolgozás engedélyezhető Globális alapértelmezett telepítésekben vagy a Data Zone alapértelmezett (US) telepítésekben. A díjszabással kapcsolatos információkért lásd a Azure OpenAI díjszabási oldalát.

Globális standard modell rendelkezésre állása

Régió gpt-5.6-terra, 2026-07-09 gpt-5.6-sol, 2026-07-09 gpt-5.5, 2026-04-24 gpt-5.4-mini, 2026-03-17 gpt-5.4, 2026-03-05 gpt-5.2, 2025-12-11 gpt-5.1, 2025-11-13 gpt-4.1, 2025-04-14
australiaeast
brazilsouth
canadacentral
Kelet-Kanada
centralus
eastus
eastus2
francecentral
Németország nyugat-közép
italynorth
japaneast
koreacentral
northcentralus
norwayeast
lengyelországcentral
southafricanorth
southcentralus
délkelet-ázsia
Dél-India
spaincentral
swedencentral
SvájcNorth
svájcnyugat
uaenorth
uksouth
westeurope
westus
westus3

Prioritás-feldolgozás engedélyezése az üzembe helyezés szintjén

A prioritás feldolgozását az üzembe helyezés szintjén és (opcionálisan) a kérés szintjén engedélyezheti.

Megjegyzés

Prioritásos feldolgozás engedélyezhető globális standard vagy Data Zone standard (USA) üzembe helyezésekben. A prioritás-feldolgozás ugyanazt a kvótát használja, mint a standard feldolgozás.

Az Microsoft Foundry portálon kapcsolja be a Priority processing kapcsolót az üzembe helyezés részleteinek lapján az üzembe helyezés létrehozásakor, vagy frissítse az üzembe helyezett modell beállítását az üzembe helyezés részleteinek szerkesztésével.

Képernyőkép a prioritás-feldolgozás engedélyezéséről a modell üzembe helyezése során az Foundry portálon.

Megjegyzés

Ha inkább a kódot szeretné használni a prioritás-feldolgozás üzembe helyezési szinten való engedélyezéséhez, ezt a REST API-n keresztül teheti meg az üzembe helyezéshez az service_tier alábbi attribútum beállításával: "properties" : {"service_tier" : "priority"}. Az service_tier attribútum megengedett értékei: default és priority. default standard feldolgozást jelent, míg priority lehetővé teszi a prioritásos feldolgozást.

Miután egy modelltelepítés prioritás-feldolgozás használatára van konfigurálva, megkezdheti a kérések küldését a modellnek.

Használati metrikák megtekintése

Az erőforrás kihasználtsági mértékét a Azure portál Azure Monitor szakaszában tekintheti meg.

A standard feldolgozás és a prioritás feldolgozása által feldolgozott kérelmek mennyiségének megtekintéséhez ossza fel az eredeti kérelemben szereplő szolgáltatási szint (standard vagy prioritás) szerint:

  1. Jelentkezzen be a következőbe https://portal.azure.com: .
  2. Nyissa meg a Azure OpenAI-erőforrást, és válassza a Metrics lehetőséget a bal oldali navigációs sávon.
  3. A metrikák lapon adja hozzá a Azure OpenAI-kérelmeket metrikát. Választhat más metrikákat is, például Azure OpenAI-késés, Azure OpenAI-használat stb.
  4. Válassza a Szűrő hozzáadása lehetőséget annak a standard üzemelő példánynak a kiválasztásához, amelynek prioritás-feldolgozási kéréseit feldolgozták.
  5. Válassza a Felosztás alkalmazása lehetőséget az értékek ServiceTierRequest és ServiceTierResponse szerinti felosztásához.

A prioritás feldolgozási kihasználtságának képernyőképe az Azure portálon az erőforrás metrikák lapján.

Az üzemelő példányok figyelésével kapcsolatos további információt itt talál: Monitor Azure OpenAI.

Költségek figyelése

A prioritási és standard kérések költségeinek lebontását a Azure portál költségelemzési oldalán tekintheti meg az üzembehelyezési névre és a számlázási címkékre való szűréssel az alábbiak szerint:

  1. Nyissa meg a Azure portál költségelemzési lapját.
  2. (Nem kötelező) Szűrés erőforrás szerint.
  3. Az üzembe helyezés neve alapján történő szűréshez: Adjon hozzá egy szűrőt a számlázási címkéhez> , válassza ki az üzembe helyezést értékként, majd válassza ki az üzembe helyezés nevét.

Képernyőkép a prioritásalapú feldolgozási kihasználtságról az erőforrás költségelemzési oldalán az Azure portálon.

További információ a prioritás-feldolgozás díjszabásáról: Azure OpenAI Service díjszabás áttekintése.

Prioritás-feldolgozás engedélyezése a kérés szintjén

Important

2026. szeptember 25-től a Foundry megszünteti a flex-ról a standard feldolgozásra történő automatikus visszaállást azon modellek esetében, amelyek nem támogatják a Flex-feldolgozást. Az ilyen kérések esetében jelenleg a szokásos feldolgozás történik, de a kivezetési dátum után ehelyett HTTP 400-as választ adnak vissza egy invalid_request_error elemmel. Mielőtt ez a módosítás érvénybe lép, ellenőrizze, hogy a modell támogatja-e a Flex-feldolgozást. Ha a standard feldolgozás elfogadható, állítsa be service_tier helyette default .

A prioritás feldolgozásának engedélyezése a kérés szintjén nem kötelező. A csevegővégzítési API és a válasz API is rendelkezik egy opcionális attribútummal service_tier , amely meghatározza a kérések kiszolgálása során használni kívánt feldolgozási típust. Az alábbi példa bemutatja, hogyan állítható be service_tier egy priority válaszkérés során.

curl -X POST https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AZURE_OPENAI_AUTH_TOKEN" \
  -d '{
     "model": "gpt-4.1",
     "input": "This is a test",
     "service_tier": "priority"
    }'

service_tier Az attribútummal felülbírálhatja az üzembe helyezési szintű beállítást. service_tier értékeket autovehet fel, defaultés priority.

  • Ha nem állítja be az attribútumot, az alapértelmezés szerint a következő lesz auto: .

  • service_tier = auto azt jelenti, hogy a kérés az üzembe helyezés során konfigurált szolgáltatási szintet használja.

  • service_tier = default azt jelenti, hogy a kérelem a kiválasztott modell standard díjszabását és teljesítményét használja.

  • service_tier = priority azt jelenti, hogy a kérés a prioritás-feldolgozási szolgáltatási szintet használja.

Az alábbi táblázat összefoglalja, hogy melyik szolgáltatásszint dolgozza fel a kéréseket a telepítés szintje és a kérésszint beállításai service_tieralapján.

Üzembe helyezési szintű beállítás Kérelemszintű beállítás Szolgáltatásszint által feldolgozott kérés
alapértelmezett automatikus, alapértelmezett Standard
alapértelmezett Prioritás Elsőbbségi feldolgozás
Prioritás automatikus, prioritás Elsőbbségi feldolgozás
Prioritás alapértelmezett Standard

Korlátozások

  • A szolgáltatás jelenleg nem támogatja a regionális standard telepítéseket és az UNIÓS adatzónák szabványos üzembe helyezését.

  • Előfordulhat, hogy a szolgáltatás az alábbi forgatókönyvek során újra átirányít néhány prioritási kérést a standard feldolgozásra* :

    • Ha a prioritási feldolgozási jogkivonatok percenkénti gyors növekedése a rámpa sebességkorlátainak eléréséhez vezet. Jelenleg a rámpasebesség-korlát úgy van definiálva, hogy a forgalmat 15 percen belül percenként több mint 50% tokennel növeli.
    • Az olyan csúcsidőszakokban, amikor prioritás feldolgozásra érkeznek a kérések,
    • A hosszú szövegkörnyezetű kérések a késési céltáblában felsorolt bizonyos modellekhez lettek küldve.

    Tipp

    Ha rendszeresen találkozik rámpasebesség korlátozásokkal, fontolja meg a PTU megvásárlását a prioritási feldolgozás mellett vagy helyett.

    * A szolgáltatás a standard szolgáltatási szint által feldolgozott kéréseket a standard díjszabással számlázza ki. A standard szolgáltatási szint által feldolgozott kérelmek szerepelnek service_tier = default a válaszban, míg a prioritási feldolgozási szint által feldolgozott kérések a service_tier = priority válaszban.

Hibaelhárítás

Kérdés Okoz Felbontás
Standard szintre visszaminősített kérések Az alábbi helyzetek egyike:
- A forgalom 15 percen belül több mint 50%-kal nőtt a tokenszám percenként, elérve a növekedési sebességhatárt.
- A prioritás-feldolgozásra irányuló kérelmek csúcsidőszakában küldött kérelmek.
- Hosszú szövegkörnyezeti kérelmek küldése a késleltetés céltáblában felsorolt egyes modelleknek.
- Növelje fokozatosan a forgalmat, ha rámpasebesség-korlátokat tapasztal.
- Fontolja meg a PTU megvásárlását állandó állapotú kapacitáshoz.