Mi a kiosztott átviteli sebesség az Foundry-modellekhez?

Jelenleg megtekintés:Új Foundry Portal-verzió - Váltás a klasszikus Foundry portál verziójára

A kiosztott átviteli sebesség az Microsoft Foundry központi telepítési típusa, amely dedikált modellfeldolgozási átviteli sebességet biztosít az üzembe helyezéshez. A szokásos üzembe helyezésekkel ellentétben, ahol a következtetési kapacitás meg van osztva az ügyfelek között, és az átviteli sebesség az igényektől függően változhat, a lefoglalt kapacitású üzembe helyezés egy rögzített mennyiségű feldolgozási kapacitást biztosít kizárólag az Ön üzembe helyezése számára, függetlenül attól, hogy érkeznek-e kérések.

Ez a cikk bemutatja a kiosztott átviteli sebesség alapvető fogalmait: mi az, mikor kell használni, hogyan történik a kapacitás mérése és számlázása, és mit kell tudni a kvótáról és a kapacitásról az üzembe helyezés előtt.

Üzembe helyezési kategóriák összehasonlítása

A standard üzembe helyezés, a kötegelt üzembe helyezés, a prioritásos feldolgozás és a lefoglalt átviteli kapacitás a modellek üzembe helyezésének módjai a Microsoft Foundryban. A megfelelő választás a késési követelményektől, a forgalmi mintáktól és a költségtűréstől függ.

Üzembe helyezés típusa Számlázás Késleltetésre vonatkozó szolgáltatási szint megállapodás (SLA) A munkaterhelés típusa és igényei
Szabvány Fizetés tokenenként Egyik sem Kiegyensúlyozott munkaterhelések: fejlesztési, tesztelési és éles üzemi környezetek változó vagy előre nem jelezhető forgalom mellett
Prioritás feldolgozása Fizetés tokenenként (prioritási díjszabás) Modellenkénti meghatározott késési cél Késésre érzékeny éles számítási feladatok, amelyek hosszú távú kötelezettségvállalás nélkül konzisztens alacsony késést igényelnek
Előirányzott PTU-nként óránként (vagy Azure-foglalásokkal) Modellenkénti meghatározott késési cél Kritikus fontosságú, nagy léptékű éles számítási feladatok, amelyek garantált átviteli sebességet és konzisztens késést igényelnek
Batch Fizetés tokenenként (kedvezményes kötegelt díjszabás) Egyik sem Számítási feladatok tömeges feldolgozása késési követelmények nélkül. Az eredmények aszinkron módon jelennek meg.

Mikor érdemes használni a kiosztott átviteli sebességet?

A kiosztott átviteli sebesség a megfelelő választás, ha az alkalmazás a következőt használja:

  • Kiszámítható forgalmi mintázatok: Reális becslése van a percenkénti kérések számáról és a tokenmennyiségről.
  • Késésre érzékeny követelmények: A felhasználóknak vagy az alsóbb rétegbeli rendszereknek konzisztens, alacsony késésű válaszokra van szükségük.
  • Üzemi méretű mennyiség: Nagy áteresztőképességet igénylő felhasználási eseteknél a tokenenkénti számlázás költségessé válik.
  • Valós idejű vagy interaktív forgatókönyvek: Csevegőalkalmazások, copilotok vagy ügynökök, ahol a változó válaszidők rontják a felhasználói élményt.

A standard telepítések továbbra is megfelelőbbek fejlesztéshez, teszteléshez, alacsony volumenű használathoz, illetve olyan erősen ingadozó forgalom esetén, amely miatt nehéz előre méretezni a telepítést.

Kiosztott átviteli kapacitás egységek

A kiosztott átviteli egységek (PTU-k) a kiosztott átviteli sebesség mértékegységei. A PTU rögzített mennyiségű modellfeldolgozási kapacitást jelöl. Amikor létrehoz egy kiosztott üzembe helyezést, megadja, hogy hány PTU-t kell hozzárendelni. Az Foundry lefoglalja ezt a számítási mennyiséget, és megtartja azt az üzembe helyezéshez.

A PTU-k főbb jellemzői:

Kvóta és kapacitás

A PTU-kvóta és a kapacitás összefüggő, de eltérő fogalmak, amelyek egyaránt befolyásolják, hogy létrehozhat-e egy telepítést. Ez a szakasz bemutatja, hogy mik ezek, hogyan kérhet további kvótát, és hogyan ellenőrizheti, hogy a kapacitás elérhető-e a régióban.

Mi az a PTU-kvóta?

A PTU-kvóta az előfizetésenként, régiónként és üzembe helyezési típusonként üzembe helyezhető PTU-k maximális száma. A kvóta a Azure által kikényszerített szabályzatkorlát, amelynek nincs társított költsége. A kvóta ajánlati szinten van meghatározva (a Global Provisioned, a Data Zone Provisioned és a Regional Provisioned külön kvótakészletek), valamint régiónként is (például az USA keleti régiójában érvényes kvóta nem érvényes Nyugat-Európára).

A kvóta alapértelmezett mennyisége több régióban jogosult előfizetésekhez van hozzárendelve.

Mi az a kapacitás?

A kapacitás az üzembe helyezhető modellverziónkénti PTU-k tényleges mennyisége. A kapacitás az üzembe helyezés időpontjában van lefoglalva, és az üzembe helyezés élettartamára van tárolva.

Fontos

A PTU-kvóta nem garantálja a kapacitás rendelkezésre állását. Ha a régió kapacitása nem elegendő a kért PTU-számhoz, az üzembe helyezés meghiúsul. Mindig ellenőrizze a kapacitás rendelkezésre állását az üzembe helyezés megtervezése vagy foglalás vásárlása előtt.

Mivel a kapacitás véges, dinamikusan változó erőforrás:

  • A kapacitás rendelkezésre állása napközben változik az ügyféligények alapján minden régióban és modellben.
  • A telepítés törlése vagy leskálázása felszabadítja a kapacitását, és visszaadja azt a régiós készletnek. Nincs garancia arra, hogy később ugyanekkora kapacitás lesz elérhető, ha újra létrehozza vagy felskálázza a telepítést.

Kvóta lekérése

A globális, adatzóna és regionális kiosztott kvóta alapértelmezett mennyisége több régióban jogosult előfizetésekhez van hozzárendelve. A kvótakérelmet tartalmazó űrlap elküldésével további kvótát vagy kapacitást kérhet. Az űrlap a Foundry portál Kvóta oldalán is elérhető.

A jóváhagyás több napot is igénybe vehet a kvóta rendelkezésre állása alapján, és e-mailben értesítést kap a kérelem jóváhagyásakor.

A rendelkezésre álló kapacitás ellenőrzése

Valós idejű kapacitás rendelkezésre állásának ellenőrzése:

  • Használja az Foundry portál üzembehelyezési felületét, amely megmutatja, hogy rendelkezésre áll-e kapacitás, amikor megpróbál létrehozni egy üzembe helyezést, és felsorolja a rendelkezésre álló kapacitással rendelkező alternatív régiókat, ha a célrégió nem rendelkezik elegendő kapacitással.
  • A modellkapacitási API használatával programozott módon lekérdezheti egy adott modell és régió maximálisan üzembe helyezhető PTU-számát.

Ha a célrégió nem rendelkezik rendelkezésre álló kapacitással:

  • Küldje el a kvótakérelem űrlapot , hogy több kvótát vagy kapacitást kérjen.
  • Próbáljon meg kevesebb PTU-val üzembe helyezni.
  • Később próbálkozzon újra, mivel a kapacitás rendelkezésre állása dinamikusan változik a nap folyamán.

Az előre lefoglalt üzembe helyezések létrehozására és a kapacitáskorlátok kezelésére vonatkozó, lépésről lépésre szóló útmutatóért lásd: Ismerkedés az előre lefoglalt üzembe helyezésekkel.

PTU-méretezés

Kiépített telepítés létrehozása előtt becsülje meg, hogy hány PTU szükséges a munkaterheléshez. A számítást három tényező befolyásolja:

  • Kérelemalakzat: A várt kérések percenként (RPM), átlagos kérésméret (bemeneti jogkivonatok) és átlagos válaszméret (kimeneti jogkivonatok).
  • Kimeneti-bemeneti arány: A kimeneti jogkivonatok feldolgozási kapacitása nagyobb, mint a bemeneti jogkivonatoké. Minden modellnek van egy aránya, amely azt fejezi ki, hogy egy kimeneti jogkivonat hány bemeneti jogkivonattal egyenértékű kapacitási célokra. A GPT-4.1-es és újabb Azure OpenAI-modellek esetében ez az arány megegyezik a modell kimeneti és bemeneti jogkivonatok közötti globális standard díjszabási arányával. Erről az arányról további információt az üzembehelyezési paraméterek és az átviteli sebesség értékei modell szerint című témakörben talál.
  • Gyorsítótár sebessége: A parancssori gyorsítótárból kiszolgált bemeneti jogkivonatok töredéke. A gyorsítótárazott tokenek nem fogyasztanak PTU-kapacitást, így a magasabb gyorsítótár-találati arány csökkenti a szükséges PTU-k mennyiségét.

A méretezési számítás ezeket a tényezőket használja a várt tokenkötetek egyetlen normalizált TPM-számmá alakításához, majd a modell bemeneti TPM/PTU értékével osztja el a szükséges PTU-szám eléréséhez.

Manuálisan méretezheti a képleteket és a modellenkénti értékeket, vagy használhatja a kapacitáskalkulátort az Foundry portálon egy irányított becsléshez.

A teljes méretezési módszertanról, beleértve a képleteket, a kidolgozott példákat és a kapacitáskalkulátorra vonatkozó referenciát, lásd a Munkaterhelés PTU-méretezésének meghatározása című témakört.

Kiépített áteresztőképesség telepítési típusai

A kiosztott átviteli sebesség három üzembehelyezési típusként érhető el. Ezek mindegyike dedikált kapacitást és kiszámítható késést biztosít az üzembe helyezés után. A különbség az, ahol a következtetési forgalom feldolgozása történik:

Üzembe helyezés típusa sku-name parancssori felületen Adatútválasztás Legjobb a számára
Globálisan biztosított GlobalProvisionedManaged Globálisan átirányítva Azure régiók között Legmagasabb rendelkezésre állás; ha az útválasztási régió nincs korlátozva
Kiépített adatzóna DataZoneProvisionedManaged Földrajzi zónán belül marad (USA vagy EU) Zónaszintű adattárolás a regionálisnál magasabb rendelkezésre állással
Regionálisan ellátott ProvisionedManaged Az üzembe helyezés adott Azure régiójában marad Szigorú egyrégiós adattárolási követelmények

Az összes Foundry üzembehelyezési típus – beleértve a standard, a kötegelt és a kiépített típust is – teljes összehasonlítását lásd itt: A Microsoft Foundry-modellek üzembehelyezési típusai.

Támogatott modellek

A kiosztott átviteli sebességet támogató Öntödei modellek teljes listáját, beleértve az egyes modellek által támogatott üzembehelyezési típusokat és a regionális rendelkezésre állást, tekintse meg a Region rendelkezésre állását a közvetlenül a Azure által értékesített Öntödei modellekhez.

Túlcsordulás

A spillover egy opcionális konfiguráció, amely a kiépített üzembe helyezések forgalmi ingadozásainak kezelésére szolgál azáltal, hogy a túlcsorduló kéréseket automatikusan egy megfelelő standard üzembe helyezésre irányítja ugyanabban a Foundry-erőforrásban. Ha egy kiépített üzembe helyezés teljesen ki van használva, és nem 200-as válaszokat ad vissza (például 429, amikor a PTU-k kimerülnek), a túlcsordulás ezeket a kéréseket a standard üzembe helyezésre irányítja át, ezzel segít csökkenteni a forgalmi kiugrások során fellépő fennakadásokat.

A Foundry-modellekben elérhető összes olyan Azure OpenAI-modell, amely támogatja a kiépített átviteli kapacitást, a túlcsordulást is támogatja. A más szolgáltatók öntödei modelljei (Azure DeepSeek, Meta Llama) jelenleg nem támogatják a kiömlést.

A spillover egy telepítés összes kérésére konfigurálható, vagy kérésenként szabályozható a(z) x-ms-spillover-deployment kérésfejléc használatával. A konfiguráció lépéseit lásd itt: A forgalom kezelése túlcsordulással kiépített üzembe helyezések esetén.

Óránkénti számlázás és Azure foglalások

A kiépített üzembe helyezések két számlázási módot támogatnak: óradíjas számlázást a rugalmas, rövid távú használathoz, valamint Azure Reservations szolgáltatást a hosszú távú éles számítási feladatokhoz, kedvezményes díjjal.

Óránkénti számlázás

Minden kiépített telepítési típus óradíj alapján kerül számlázásra ($/PTU/óra), a telepített PTU-k számától függetlenül a felhasznált tokenek számától. A mérő az üzembe helyezés létrehozásakor kezdődik, és a törléskor leáll.

Az óránkénti számlázás olyan rövid távú forgatókönyvek esetében praktikus, mint egy új modell teljesítménymérése vagy egy esemény, például egy hackathon ideiglenes felskálázása. Ne tervezze azonban a kiépített üzembe helyezések fel- és leskálázását a forgalomhoz igazítva azzal a céllal, hogy továbbra is óradíjas számlázásban maradjon, a következő okok miatt:

  • Előfordulhat, hogy nem áll rendelkezésre elegendő kapacitás, amikor újra fel kell skáláznia.

  • A magas kihasználtságú folyamatos óránkénti számlázás általában meghaladja a foglalás díjszabását.

Az óránkénti számlázással és a kiépített telepítések skálázásával kapcsolatos részletes útmutatásért lásd: Óránkénti számlázás.

Azure-foglalások

Az Azure-foglalások olyan pénzügyi kedvezmények, amelyeket a PTU számlázási mérőszámára alkalmaznak (vagyis arra az óránkénti használati számlálóra, amely alapján az Azure díjat számít fel), nem pedig az egyes üzembe helyezésekre. 1 hónapos vagy 1 éves kötelezettségvállalásért cserébe kedvezményes érvényes $/PTU/óra árfolyamot kap. Néhány fontos megjegyzés a foglalásokról:

  • A foglalások központi telepítési típusonként (globális, adatzóna vagy regionális) vásárolhatók, és hatóköre egy vagy több előfizetésre vagy erőforráscsoportra terjedhet ki.

  • A foglalások és az üzembe helyezések lazán kapcsolódnak egymáshoz, ami azt jelenti, hogy az üzembe helyezéseket és a foglalásokat egymástól függetlenül hozhatja létre.

  • A foglalások nem garantálják a kapacitást. Először hozzon létre üzembe helyezéseket annak ellenőrzéséhez, hogy rendelkezésre áll-e kapacitás, majd vásárolja meg a foglalást a kedvezményes díjszabás zárolásához.

A foglalások méretezésével, megvásárlásával és kezelésével kapcsolatos részletes útmutatásért lásd: Az Azure kiépített átviteli sebességre vonatkozó foglalásai.

PTU-költségek és számlázás nyomon követése

A Microsoft Cost Management használatával nyomon követheti és elemezheti a PTU használati és foglalási költségeit:

Mit szeretne tenni? Cikk
Megnézheti, hogy a fenntartott PTU-k hány százaléka van aktív használatban a telepítéseiben Az Azure-foglalások kihasználtságának megtekintése
A vásárlási előzmények és a visszatérítési tevékenységek áttekintése Az Azure Reservation vásárlási és visszatérítési tranzakcióinak megtekintése
A foglalások amortizált költséghatásának megismerése az üzembe helyezésenkénti számlázás egyértelműbb láthatósága érdekében Amortizált juttatási költségek megtekintése
A foglalási költségek elosztása a csapatok vagy projektek között a belső költségelszámolás érdekében Az Azure Reservation költségeinek visszatérítése
Automatikus megújítás beállítása a foglalás lejáratának megakadályozása és a kedvezményes díjszabás fenntartása érdekében Az Azure-foglalások automatikus megújítása