Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
Jelenleg megtekintés:Új Foundry Portal-verzió - Váltás a klasszikus Foundry portál verziójára
A kiosztott átviteli sebesség az Microsoft Foundry központi telepítési típusa, amely dedikált modellfeldolgozási átviteli sebességet biztosít az üzembe helyezéshez. A szokásos üzembe helyezésekkel ellentétben, ahol a következtetési kapacitás meg van osztva az ügyfelek között, és az átviteli sebesség az igényektől függően változhat, a lefoglalt kapacitású üzembe helyezés egy rögzített mennyiségű feldolgozási kapacitást biztosít kizárólag az Ön üzembe helyezése számára, függetlenül attól, hogy érkeznek-e kérések.
Ez a cikk bemutatja a kiosztott átviteli sebesség alapvető fogalmait: mi az, mikor kell használni, hogyan történik a kapacitás mérése és számlázása, és mit kell tudni a kvótáról és a kapacitásról az üzembe helyezés előtt.
Üzembe helyezési kategóriák összehasonlítása
A standard üzembe helyezés, a kötegelt üzembe helyezés, a prioritásos feldolgozás és a lefoglalt átviteli kapacitás a modellek üzembe helyezésének módjai a Microsoft Foundryban. A megfelelő választás a késési követelményektől, a forgalmi mintáktól és a költségtűréstől függ.
| Üzembe helyezés típusa | Számlázás | Késleltetésre vonatkozó szolgáltatási szint megállapodás (SLA) | A munkaterhelés típusa és igényei |
|---|---|---|---|
| Szabvány | Fizetés tokenenként | Egyik sem | Kiegyensúlyozott munkaterhelések: fejlesztési, tesztelési és éles üzemi környezetek változó vagy előre nem jelezhető forgalom mellett |
| Prioritás feldolgozása | Fizetés tokenenként (prioritási díjszabás) | Modellenkénti meghatározott késési cél | Késésre érzékeny éles számítási feladatok, amelyek hosszú távú kötelezettségvállalás nélkül konzisztens alacsony késést igényelnek |
| Előirányzott | PTU-nként óránként (vagy Azure-foglalásokkal) | Modellenkénti meghatározott késési cél | Kritikus fontosságú, nagy léptékű éles számítási feladatok, amelyek garantált átviteli sebességet és konzisztens késést igényelnek |
| Batch | Fizetés tokenenként (kedvezményes kötegelt díjszabás) | Egyik sem | Számítási feladatok tömeges feldolgozása késési követelmények nélkül. Az eredmények aszinkron módon jelennek meg. |
Mikor érdemes használni a kiosztott átviteli sebességet?
A kiosztott átviteli sebesség a megfelelő választás, ha az alkalmazás a következőt használja:
- Kiszámítható forgalmi mintázatok: Reális becslése van a percenkénti kérések számáról és a tokenmennyiségről.
- Késésre érzékeny követelmények: A felhasználóknak vagy az alsóbb rétegbeli rendszereknek konzisztens, alacsony késésű válaszokra van szükségük.
- Üzemi méretű mennyiség: Nagy áteresztőképességet igénylő felhasználási eseteknél a tokenenkénti számlázás költségessé válik.
- Valós idejű vagy interaktív forgatókönyvek: Csevegőalkalmazások, copilotok vagy ügynökök, ahol a változó válaszidők rontják a felhasználói élményt.
A standard telepítések továbbra is megfelelőbbek fejlesztéshez, teszteléshez, alacsony volumenű használathoz, illetve olyan erősen ingadozó forgalom esetén, amely miatt nehéz előre méretezni a telepítést.
Kiosztott átviteli kapacitás egységek
A kiosztott átviteli egységek (PTU-k) a kiosztott átviteli sebesség mértékegységei. A PTU rögzített mennyiségű modellfeldolgozási kapacitást jelöl. Amikor létrehoz egy kiosztott üzembe helyezést, megadja, hogy hány PTU-t kell hozzárendelni. Az Foundry lefoglalja ezt a számítási mennyiséget, és megtartja azt az üzembe helyezéshez.
A PTU-k főbb jellemzői:
- Modellfüggetlen: Ugyanaz a PTU-kvóta használható bármely támogatott modell üzembe helyezéséhez. Nem egy adott modellhez vásárol PTU-kat.
- Régióspecifikus: A PTU-kvóta előfizetésenként, régiónként és üzembe helyezési típusonként adható meg. Az USA keleti régiójában a kvóta nem terjed ki Nyugat-Európára.
- A teljesítmény modellenként változik: Az, hogy egy adott számú PTU percenként hány tokent biztosít (TPM), a modelltől függ. A nehezebb modellek több PTU-t igényelnek, hogy ugyanazt a TPM-et szolgálják ki, mint egy könnyebbet. Modellenkénti PTU–TPM arányokról lásd a modellenkénti átviteli sebesség paramétereit.
- A minimális üzembehelyezési méretek érvényesek: Minden modellhez minimális PTU-szám szükséges az üzembe helyezés létrehozásához. A minimumok modellenként változnak, és az üzembehelyezési paraméterek és az átviteli sebesség értékei modell szerint vannak felsorolva.
Kvóta és kapacitás
A PTU-kvóta és a kapacitás összefüggő, de eltérő fogalmak, amelyek egyaránt befolyásolják, hogy létrehozhat-e egy telepítést. Ez a szakasz bemutatja, hogy mik ezek, hogyan kérhet további kvótát, és hogyan ellenőrizheti, hogy a kapacitás elérhető-e a régióban.
Mi az a PTU-kvóta?
A PTU-kvóta az előfizetésenként, régiónként és üzembe helyezési típusonként üzembe helyezhető PTU-k maximális száma. A kvóta a Azure által kikényszerített szabályzatkorlát, amelynek nincs társított költsége. A kvóta ajánlati szinten van meghatározva (a Global Provisioned, a Data Zone Provisioned és a Regional Provisioned külön kvótakészletek), valamint régiónként is (például az USA keleti régiójában érvényes kvóta nem érvényes Nyugat-Európára).
A kvóta alapértelmezett mennyisége több régióban jogosult előfizetésekhez van hozzárendelve.
Mi az a kapacitás?
A kapacitás az üzembe helyezhető modellverziónkénti PTU-k tényleges mennyisége. A kapacitás az üzembe helyezés időpontjában van lefoglalva, és az üzembe helyezés élettartamára van tárolva.
Fontos
A PTU-kvóta nem garantálja a kapacitás rendelkezésre állását. Ha a régió kapacitása nem elegendő a kért PTU-számhoz, az üzembe helyezés meghiúsul. Mindig ellenőrizze a kapacitás rendelkezésre állását az üzembe helyezés megtervezése vagy foglalás vásárlása előtt.
Mivel a kapacitás véges, dinamikusan változó erőforrás:
- A kapacitás rendelkezésre állása napközben változik az ügyféligények alapján minden régióban és modellben.
- A telepítés törlése vagy leskálázása felszabadítja a kapacitását, és visszaadja azt a régiós készletnek. Nincs garancia arra, hogy később ugyanekkora kapacitás lesz elérhető, ha újra létrehozza vagy felskálázza a telepítést.
Kvóta lekérése
A globális, adatzóna és regionális kiosztott kvóta alapértelmezett mennyisége több régióban jogosult előfizetésekhez van hozzárendelve. A kvótakérelmet tartalmazó űrlap elküldésével további kvótát vagy kapacitást kérhet. Az űrlap a Foundry portál Kvóta oldalán is elérhető.
A jóváhagyás több napot is igénybe vehet a kvóta rendelkezésre állása alapján, és e-mailben értesítést kap a kérelem jóváhagyásakor.
A rendelkezésre álló kapacitás ellenőrzése
Valós idejű kapacitás rendelkezésre állásának ellenőrzése:
- Használja az Foundry portál üzembehelyezési felületét, amely megmutatja, hogy rendelkezésre áll-e kapacitás, amikor megpróbál létrehozni egy üzembe helyezést, és felsorolja a rendelkezésre álló kapacitással rendelkező alternatív régiókat, ha a célrégió nem rendelkezik elegendő kapacitással.
- A modellkapacitási API használatával programozott módon lekérdezheti egy adott modell és régió maximálisan üzembe helyezhető PTU-számát.
Ha a célrégió nem rendelkezik rendelkezésre álló kapacitással:
- Küldje el a kvótakérelem űrlapot , hogy több kvótát vagy kapacitást kérjen.
- Próbáljon meg kevesebb PTU-val üzembe helyezni.
- Később próbálkozzon újra, mivel a kapacitás rendelkezésre állása dinamikusan változik a nap folyamán.
Az előre lefoglalt üzembe helyezések létrehozására és a kapacitáskorlátok kezelésére vonatkozó, lépésről lépésre szóló útmutatóért lásd: Ismerkedés az előre lefoglalt üzembe helyezésekkel.
PTU-méretezés
Kiépített telepítés létrehozása előtt becsülje meg, hogy hány PTU szükséges a munkaterheléshez. A számítást három tényező befolyásolja:
- Kérelemalakzat: A várt kérések percenként (RPM), átlagos kérésméret (bemeneti jogkivonatok) és átlagos válaszméret (kimeneti jogkivonatok).
- Kimeneti-bemeneti arány: A kimeneti jogkivonatok feldolgozási kapacitása nagyobb, mint a bemeneti jogkivonatoké. Minden modellnek van egy aránya, amely azt fejezi ki, hogy egy kimeneti jogkivonat hány bemeneti jogkivonattal egyenértékű kapacitási célokra. A GPT-4.1-es és újabb Azure OpenAI-modellek esetében ez az arány megegyezik a modell kimeneti és bemeneti jogkivonatok közötti globális standard díjszabási arányával. Erről az arányról további információt az üzembehelyezési paraméterek és az átviteli sebesség értékei modell szerint című témakörben talál.
- Gyorsítótár sebessége: A parancssori gyorsítótárból kiszolgált bemeneti jogkivonatok töredéke. A gyorsítótárazott tokenek nem fogyasztanak PTU-kapacitást, így a magasabb gyorsítótár-találati arány csökkenti a szükséges PTU-k mennyiségét.
A méretezési számítás ezeket a tényezőket használja a várt tokenkötetek egyetlen normalizált TPM-számmá alakításához, majd a modell bemeneti TPM/PTU értékével osztja el a szükséges PTU-szám eléréséhez.
Manuálisan méretezheti a képleteket és a modellenkénti értékeket, vagy használhatja a kapacitáskalkulátort az Foundry portálon egy irányított becsléshez.
A teljes méretezési módszertanról, beleértve a képleteket, a kidolgozott példákat és a kapacitáskalkulátorra vonatkozó referenciát, lásd a Munkaterhelés PTU-méretezésének meghatározása című témakört.
Kiépített áteresztőképesség telepítési típusai
A kiosztott átviteli sebesség három üzembehelyezési típusként érhető el. Ezek mindegyike dedikált kapacitást és kiszámítható késést biztosít az üzembe helyezés után. A különbség az, ahol a következtetési forgalom feldolgozása történik:
| Üzembe helyezés típusa |
sku-name parancssori felületen |
Adatútválasztás | Legjobb a számára |
|---|---|---|---|
| Globálisan biztosított | GlobalProvisionedManaged |
Globálisan átirányítva Azure régiók között | Legmagasabb rendelkezésre állás; ha az útválasztási régió nincs korlátozva |
| Kiépített adatzóna | DataZoneProvisionedManaged |
Földrajzi zónán belül marad (USA vagy EU) | Zónaszintű adattárolás a regionálisnál magasabb rendelkezésre állással |
| Regionálisan ellátott | ProvisionedManaged |
Az üzembe helyezés adott Azure régiójában marad | Szigorú egyrégiós adattárolási követelmények |
Az összes Foundry üzembehelyezési típus – beleértve a standard, a kötegelt és a kiépített típust is – teljes összehasonlítását lásd itt: A Microsoft Foundry-modellek üzembehelyezési típusai.
Támogatott modellek
A kiosztott átviteli sebességet támogató Öntödei modellek teljes listáját, beleértve az egyes modellek által támogatott üzembehelyezési típusokat és a regionális rendelkezésre állást, tekintse meg a Region rendelkezésre állását a közvetlenül a Azure által értékesített Öntödei modellekhez.
Túlcsordulás
A spillover egy opcionális konfiguráció, amely a kiépített üzembe helyezések forgalmi ingadozásainak kezelésére szolgál azáltal, hogy a túlcsorduló kéréseket automatikusan egy megfelelő standard üzembe helyezésre irányítja ugyanabban a Foundry-erőforrásban. Ha egy kiépített üzembe helyezés teljesen ki van használva, és nem 200-as válaszokat ad vissza (például 429, amikor a PTU-k kimerülnek), a túlcsordulás ezeket a kéréseket a standard üzembe helyezésre irányítja át, ezzel segít csökkenteni a forgalmi kiugrások során fellépő fennakadásokat.
A Foundry-modellekben elérhető összes olyan Azure OpenAI-modell, amely támogatja a kiépített átviteli kapacitást, a túlcsordulást is támogatja. A más szolgáltatók öntödei modelljei (Azure DeepSeek, Meta Llama) jelenleg nem támogatják a kiömlést.
A spillover egy telepítés összes kérésére konfigurálható, vagy kérésenként szabályozható a(z) x-ms-spillover-deployment kérésfejléc használatával. A konfiguráció lépéseit lásd itt: A forgalom kezelése túlcsordulással kiépített üzembe helyezések esetén.
Óránkénti számlázás és Azure foglalások
A kiépített üzembe helyezések két számlázási módot támogatnak: óradíjas számlázást a rugalmas, rövid távú használathoz, valamint Azure Reservations szolgáltatást a hosszú távú éles számítási feladatokhoz, kedvezményes díjjal.
Óránkénti számlázás
Minden kiépített telepítési típus óradíj alapján kerül számlázásra ($/PTU/óra), a telepített PTU-k számától függetlenül a felhasznált tokenek számától. A mérő az üzembe helyezés létrehozásakor kezdődik, és a törléskor leáll.
Az óránkénti számlázás olyan rövid távú forgatókönyvek esetében praktikus, mint egy új modell teljesítménymérése vagy egy esemény, például egy hackathon ideiglenes felskálázása. Ne tervezze azonban a kiépített üzembe helyezések fel- és leskálázását a forgalomhoz igazítva azzal a céllal, hogy továbbra is óradíjas számlázásban maradjon, a következő okok miatt:
Előfordulhat, hogy nem áll rendelkezésre elegendő kapacitás, amikor újra fel kell skáláznia.
A magas kihasználtságú folyamatos óránkénti számlázás általában meghaladja a foglalás díjszabását.
Az óránkénti számlázással és a kiépített telepítések skálázásával kapcsolatos részletes útmutatásért lásd: Óránkénti számlázás.
Azure-foglalások
Az Azure-foglalások olyan pénzügyi kedvezmények, amelyeket a PTU számlázási mérőszámára alkalmaznak (vagyis arra az óránkénti használati számlálóra, amely alapján az Azure díjat számít fel), nem pedig az egyes üzembe helyezésekre. 1 hónapos vagy 1 éves kötelezettségvállalásért cserébe kedvezményes érvényes $/PTU/óra árfolyamot kap. Néhány fontos megjegyzés a foglalásokról:
A foglalások központi telepítési típusonként (globális, adatzóna vagy regionális) vásárolhatók, és hatóköre egy vagy több előfizetésre vagy erőforráscsoportra terjedhet ki.
A foglalások és az üzembe helyezések lazán kapcsolódnak egymáshoz, ami azt jelenti, hogy az üzembe helyezéseket és a foglalásokat egymástól függetlenül hozhatja létre.
A foglalások nem garantálják a kapacitást. Először hozzon létre üzembe helyezéseket annak ellenőrzéséhez, hogy rendelkezésre áll-e kapacitás, majd vásárolja meg a foglalást a kedvezményes díjszabás zárolásához.
A foglalások méretezésével, megvásárlásával és kezelésével kapcsolatos részletes útmutatásért lásd: Az Azure kiépített átviteli sebességre vonatkozó foglalásai.
PTU-költségek és számlázás nyomon követése
A Microsoft Cost Management használatával nyomon követheti és elemezheti a PTU használati és foglalási költségeit:
| Mit szeretne tenni? | Cikk |
|---|---|
| Megnézheti, hogy a fenntartott PTU-k hány százaléka van aktív használatban a telepítéseiben | Az Azure-foglalások kihasználtságának megtekintése |
| A vásárlási előzmények és a visszatérítési tevékenységek áttekintése | Az Azure Reservation vásárlási és visszatérítési tranzakcióinak megtekintése |
| A foglalások amortizált költséghatásának megismerése az üzembe helyezésenkénti számlázás egyértelműbb láthatósága érdekében | Amortizált juttatási költségek megtekintése |
| A foglalási költségek elosztása a csapatok vagy projektek között a belső költségelszámolás érdekében | Az Azure Reservation költségeinek visszatérítése |
| Automatikus megújítás beállítása a foglalás lejáratának megakadályozása és a kedvezményes díjszabás fenntartása érdekében | Az Azure-foglalások automatikus megújítása |
Kapcsolódó tartalom
- Ismerkedés a kiépített üzembe helyezésekkel
- PTU-költségek és számlázás
- Forgalom kezelése a kiépített üzemelő példányok átmenő forgalmával
- Prioritásos feldolgozás engedélyezése a Microsoft Foundry-modellekhez
- Takarítson meg költségeket a Microsoft Foundry kiépített átviteli kapacitásra vonatkozó foglalásaival
- Öntödei modellek kvótái és korlátai