Migrálási útmutató GPU számítási feladatokhoz a Azure

Mivel a nagyobb teljesítményű GPU-k elérhetővé válnak a piactéren és Microsoft Azure adatközpontokban, javasoljuk, hogy értékelje újra a számítási feladatok teljesítményét, és mérlegelje az újabb GPU-kra való migrálást.

Ugyanezen okból, valamint a magas minőségű és megbízható szolgáltatásajánlat fenntartása érdekében Azure rendszeresen kivonja a régebbi virtuálisgép-méreteket használó hardvereket. Az első GPU-termékcsoport, amelyet visszavonásra kerül az Azure-ban, az eredeti NC, NC v2 és ND sorozatú virtuális gépek, amelyeket az NVIDIA Tesla K80, P100 és P40 adatközponti GPU-gyorsítók működtetnek. Ezeket a termékeket 2023. augusztus 31-én kivonjuk, és a sorozatból a legrégebbi virtuális gépeket 2016-ban indították el.

Azóta a GPU-k hihetetlen előrelépéseket tettek a mélytanulás és a HPC iparággal együtt, általában meghaladva a teljesítmény megduplázását a generációk között. Az NVIDIA K80, P40 és P100 GPU-k megjelenése óta a Azure több újabb generációt és kategóriába sorolta a GPU által gyorsított számításra és AI-re épülő virtuálisgép-termékeket, amelyek az NVIDIA T4, V100 és A100 GPU-jaira épülnek, és megkülönböztetik az opcionális funkciókat, például az InfiniBand-alapú összekapcsolási hálókat. Ezek mind olyan lehetőségek, amelyek vizsgálatára ösztönözzük az ügyfeleket mint migrálási útvonalakat.

A legtöbb esetben a gpu-k újabb generációi által kínált drámai teljesítménynövekedés csökkenti a teljes TCO-t a feladat időtartamának csökkentésével, a kipukkanható feladatok esetében, vagy a gpu-kompatibilis virtuális gépek teljes mennyiségének csökkentésével, amely a számítási erőforrások rögzített méretű keresletének fedezéséhez szükséges, annak ellenére, hogy a GPU-óránkénti költségek eltérőek lehetnek. Ezen előnyök mellett az ügyfelek magasabb teljesítményű virtuális gépeken keresztül javíthatják a megoldáshoz szükséges időt, és az újabb szoftver- és CUDA-futtatókörnyezetek és illesztőprogram-verziók alkalmazásával javíthatják megoldásuk állapotát és támogatottságát.

Migrálás és optimalizálás

Azure felismeri, hogy az ügyfelek számos olyan követelményt támasztanak, amelyek meghatározhatják egy adott GPU virtuálisgép-termék kiválasztását, beleértve a GPU architekturális szempontjait, az összekapcsolásokat, a TCO-t, a megoldáshoz szükséges időt, valamint a megfelelőségi területi vagy késési követelmények alapján a regionális rendelkezésre állást, és ezek némelyike idővel megváltozik.

Ugyanakkor a GPU-gyorsítás egy új és gyorsan fejlődő terület.

Így a termékterülethez nincs valódi egyméretű útmutató, és a migrálás tökéletes alkalom a számítási feladatok potenciálisan drámai változásainak újraértékelésére, például a fürtözött üzemi modellről egyetlen nagy, 8 GPU-s virtuális gépre való áttérésre, vagy fordítva, a csökkentett pontosságú adattípusok kihasználásával, olyan funkciók bevezetésével, mint a többpéldányos GPU és még sok más.

Ezek a szempontok – ha a már generációnkénti GPU-teljesítmény növekedésének kontextusát vesszük figyelembe, ahol egy olyan funkció, mint például a TensorCores hozzáadása, nagyságrendekkel növelheti a teljesítményt, rendkívül munkaterhelés-specifikusak.

A migrálás és az alkalmazás-újraarchitektúra kombinálása óriási értéket és javulást eredményezhet a költségekben és a megoldáshoz szükséges időértékekben.

Ezek a fejlesztések azonban túlmutatnak a dokumentum hatókörén, amelynek célja, hogy az ügyfelek által jelenleg futtatható általános számítási feladatok közvetlen egyenértékűségi osztályaira összpontosítson, hogy azonosítsa a GPU-nkénti árban és teljesítményben a leginkább hasonló virtuálisgép-lehetőségeket a meglévő, kivonás alatt álló virtuálisgép-családokhoz.

Így ez a dokumentum feltételezi, hogy a felhasználónak nincs rálátása vagy irányítása a munkaterhelés-specifikus tulajdonságok felett, mint például a szükséges virtuális gép-példányok száma, GPU-k, összekapcsolások stb.

NC-Series NVIDIA K80 GPU-kat tartalmazó virtuális gépek

A NC (v1)-Series virtuális gépek Azure legrégebbi GPU-gyorsított számítási virtuális géptípusai, amelyek 1–4 NVIDIA Tesla K80 adatközponti GPU-gyorsítóval vannak párosítva Intel Xeon E5-2690 v3 (Haswell) processzorokkal. Miután az igényes AI-, ML- és HPC-alkalmazások egyik zászlóshajó virtuálisgép-típusa volt, később is népszerű választás maradt a termék életciklusában (különösen az NC-sorozat promóciós díjszabásán keresztül), azoknak a felhasználóknak, akik nagyra értékelték, hogy gpu-óránként nagyon alacsony abszolút költséggel rendelkeznek a gpu-kkal szemben, dolláronként magasabb átviteli sebességgel.

Az öregedő NVIDIA K80 GPU-platform viszonylag alacsony számítási teljesítménye miatt az újabb GPU-kat tartalmazó virtuálisgép-sorozatokhoz képest az NC-sorozat egyik népszerű használati esete a valós idejű következtetési és elemzési számítási feladatok, ahol a gyorsított virtuális gépnek stabil állapotban kell rendelkezésre állnia az alkalmazások kéréseinek kiszolgálásához, amikor megérkeznek. Ezekben az esetekben előfordulhat, hogy a kérelmek mennyisége vagy kötegmérete nem elegendő a nagyobb teljesítményű GPU-k előnyeinek kihasználásához. Az NC virtuális gépek olyan fejlesztők és diákok számára is népszerűek, akik gpu-gyorsítással ismerkednek, fejlesztenek vagy kísérleteznek, akiknek egy olcsó, felhőalapú CUDA üzembehelyezési célra van szükségük, amelyen az éles szinteken nem szükséges iterálni.

Általánosságban elmondható, hogy NC-Series ügyfeleknek érdemes közvetlenül áttérni az NC-méretekről a NC T4 v3 méretre, Azure új GPU-gyorsított platformjára az NVIDIA Tesla T4 GPU-k által működtetett könnyű számítási feladatokhoz.

Aktuális virtuális gép méret Cél virtuális gép mérete A specifikáció különbsége
Standard_NC6
Standard_NC6_Promo
Standard_NC4as_T4_v3
vagy
Standard_NC8as_T4
CPU: Intel Haswell vs AMD Rome
GPU-szám: 1 (ugyanaz)
GPU-generáció: NVIDIA Keppler és Turing (+2 generáció, ~2x FP32 FLOP)
GPU-memória (GPU-nkénti GiB): 16 (+4)
vCPU: 4 (-2) vagy 8 (+2)
Memória GiB: 16 (-40) vagy 56 (ugyanaz)
Temp Storage (SSD) GiB: 180 (-160) vagy 360 (+20)
Maximális adatlemezek: 8 (-4) vagy 16 (+4)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
Standard_NC12
Standard_NC12_Promo
Standard_NC16as_T4_v3 CPU: Intel Haswell vs AMD Rome
GPU-szám: 1 (-1)
GPU-generáció: NVIDIA Keppler és Turing (+2 generáció, ~2x FP32 FLOP)
GPU-memória (GPU-nkénti GiB): 16 (+4)
vCPU: 16 (+4)
Memória GiB: 110 (-2)
Ideiglenes tárhely (SSD) GiB: 360 (-320)
Maximális adatlemezek: 48 (+16)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
Standard_NC24
Standard_NC24_Promo
Standard_NC64as_T4_v3* CPU: Intel Haswell vs AMD Rome
GPU-szám: 4 (ugyanaz)
GPU-generáció: NVIDIA Keppler és Turing (+2 generáció, ~2x FP32 FLOP)
GPU-memória (GPU-nkénti GiB): 16 (+4)
vCPU: 64 (+40)
Memória GiB: 440 (+216)
Temp Storage (SSD) GiB: 2880 (+1440)
Maximális adatlemezek: 32 (-32)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
Standard_NC24r
Standard_NC24r_Promo
Standard_NC64as_T4_v3* CPU: Intel Haswell vs AMD Rome
GPU-szám: 4 (ugyanaz)
GPU-generáció: NVIDIA Keppler és Turing (+2 generáció, ~2x FP32 FLOP)
GPU-memória (GPU-nkénti GiB): 16 (+4)
vCPU: 64 (+40)
Memória GiB: 440 (+216)
Temp Storage (SSD) GiB: 2880 (+1440)
Maximális adatlemezek: 32 (-32)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
InfiniBand-összekapcsolás: Nem

NVIDIA Tesla P100 GPU-kat tartalmazó NC v2-sorozatú virtuális gépek

Az NC v2-sorozatú virtuális gépek egy zászlóshajó platform, amelyet eredetileg AI- és Deep Learning-számítási feladatokhoz terveztek. Kiváló teljesítményt kínáltak a Mélytanulás betanításához, a GPU-nkénti teljesítmény nagyjából 2x az eredeti NC-Series, és NVIDIA Tesla P100 GPU-k és Intel Xeon E5-2690 v4 (Broadwell) processzorok hajtják őket. Az NC és az ND sorozathoz hasonlóan az NC v2 sorozat is kínál egy konfigurációt, amely egy másodlagos kis késésű, nagy átviteli sebességű hálózattal rendelkezik AZ RDMA és az InfiniBand kapcsolaton keresztül, így nagy léptékű betanítási feladatokat futtathat, amelyek több GPU-ra terjednek ki.

Általánosságban elmondható, hogy NCv2-Series ügyfeleknek érdemes közvetlenül áttérni NC A100 v4 méretre, Azure NVIDIA Ampere A100 PCIe GPU-k által működtetett új GPU-gyorsított platformjára.

Aktuális virtuális gép méret Cél virtuális gép mérete A specifikáció különbsége
Standard_NC6s_v2 Standard_NC24ads_A100_v4 CPU: Intel Broadwell vs AMD Milan processzorok összehasonlítása
GPU-szám: 1 (ugyanaz)
GPU-generáció: NVIDIA Pascal és Ampere (+2 generáció)
GPU-memória (GPU-nkénti GiB): 80 (+64)
vCPU: 24 (+18)
Memória GiB: 220 (+108)
Ideiglenes tárhely (SSD) GiB: 1123 (+387)
Maximális adatlemezek: 12 (ugyanaz)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
Standard_NC12s_v2 Standard_NC48ads_A100_v4 CPU: Intel Broadwell vs AMD Milan
GPU-szám: 2 (ugyanaz)
GPU-generáció: NVIDIA Pascal és Ampere (+2 generáció)
GPU-memória (GPU-nkénti GiB): 80 (+64)
vCPU: 48 (+36)
Memória GiB: 440 (+216)
Temp Storage (SSD) GiB: 2246 (+772)
Maximális adatlemezek: 24 (ugyanaz)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
Standard_NC24s_v2 Standard_NC96ads_A100_v4 Processzor: Intel Broadwell szemben az AMD Milannal
GPU-szám: 4 (ugyanaz)
GPU-generáció: NVIDIA Pascal és Ampere (+2 generáció)
GPU-memória (GPU-nkénti GiB): 80 (+64)
vCPU: 96 (+72)
Memória GiB: 880 (+432)
Temp Storage (SSD) GiB: 4492 (+1544)
Maximális adatlemezek: 32 (ugyanaz)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
Standard_NC24rs_v2 Standard_NC96ads_A100_v4 CPU: Intel Broadwell vs AMD Milan processzorok összehasonlítása
GPU-szám: 4 (ugyanaz)
GPU-generáció: NVIDIA Pascal és Ampere (+2 generáció)
GPU-memória (GPU-nkénti GiB): 80 (+64)
vCPU: 96 (+72)
Memória GiB: 880 (+432)
Temp Storage (SSD) GiB: 4492 (+1544)
Maximális adatlemezek: 32 (ugyanaz)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
InfiniBand összeköttetés: Nincs (-)

ND-Series NVIDIA Tesla P40 GPU-kat tartalmazó virtuális gépek

Az ND-sorozatú virtuális gépek egy középkategóriás platform, amelyet eredetileg AI- és Deep Learning-számítási feladatokhoz terveztek. Kiváló teljesítményt kínáltak a kötegelt következtetéshez az egyszeres pontosságú lebegőpontos műveletek javításával, elődjeikhez képest, és NVIDIA Tesla P40 GPU-k és Intel Xeon E5-2690 v4 (Broadwell) processzorok működtetik őket. Az NC-hez és az NC v2-sorozathoz hasonlóan a ND-Series is kínál egy konfigurációt, amely egy másodlagos kis késésű, nagy átviteli sebességű hálózattal rendelkezik az RDMA-val és az InfiniBand-kapcsolattal, így nagy léptékű betanítási feladatokat futtathat, amelyek több GPU-t is lefednek.

Aktuális virtuális gép méret Cél virtuális gép mérete A specifikáció különbsége
Standard_ND6 Standard_NC4as_T4_v3
vagy
Standard_NC8as_T4_v3
CPU: Intel Broadwell vs AMD Rome
GPU-szám: 1 (ugyanaz)
GPU-generáció: NVIDIA Pascal és Turing (+1 generáció)
GPU-memória (GPU-nkénti GiB): 16 (-8)
vCPU: 4 (-2) vagy 8 (+2)
Memória GiB: 16 (-40) vagy 56 (-56)
Temp Storage (SSD) GiB: 180 (-552) vagy 360 (-372)
Maximális adatlemezek: 8 (-4) vagy 16 (+4)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
Standard_ND12 Standard_NC16as_T4_v3 CPU: Intel Broadwell vs AMD Rome
GPU-szám: 1 (-1)
GPU-generáció: NVIDIA Pascal és Turing (+1 generáció)
GPU-memória (GPU-nkénti GiB): 16 (-8)
vCPU: 16 (+4)
Memória GiB: 110 (-114)
Ideiglenes tárhely (SSD) GiB: 360 (–1.114)
Maximális adatlemezek: 48 (+16)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
Standard_ND24 Standard_NC64as_T4_v3* CPU: Intel Broadwell vs AMD Rome
GPU-szám: 4 (ugyanaz)
GPU-generáció: NVIDIA Pascal és Turing (+1 generáció)
GPU-memória (GPU-nkénti GiB): 16 (-8)
vCPU: 64 (+40)
Memória GiB: 440 (ugyanaz)
Temp Storage (SSD) GiB: 2880 (ugyanaz)
Maximális adatlemezek: 32 (ugyanaz)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
Standard_ND24r Standard_ND96amsr_A100_v4 CPU: Intel Broadwell vs AMD Rome
GPU-szám: 8 (+4)
GPU-generáció: NVIDIA Pascal és Ampere (+2 generáció)
GPU-memória (GPU-nkénti GiB): 80 (+56)
vCPU: 96 (+72)
Memória GiB: 1900 (+1452)
Temp Storage (SSD) GiB: 6400 (+3452)
Maximális adatlemezek: 32 (ugyanaz)
Gyorsított hálózatkezelés: Igen (+)
Premium Storage: Igen (+)
InfiniBand összeköttetés: Igen (Ugyanaz)

NP-Series virtuális gépek

Important

Az NP-sorozatok méretei (Standard_NP10s, Standard_NP20s, Standard_NP40s) 2027. május 31-én lesznek kivezetésre ütemezve. Ezen dátum után a megmaradt NP-sorozatú virtuális gépek automatikusan leállítva lesznek, leállnak, nem számítanak fel díjat, és már nem tartoznak SLA vagy támogatás alá. A felügyelt lemez adatai megmaradnak.

Reserved Instance purchase cutoff: Az N-sorozatú 1 éves és 3 éves Azure lefoglalt VM-példányok vásárlása 2026. április 2. megszűnt. A fenntartott példányokhoz kapcsolódó kapacitástervezéssel rendelkező ügyfeleknek ennek megfelelően kell migrálniuk vagy módosítaniuk a foglalásokat.

Az NP sorozatú virtuális gépeket amd Xilinx Alveo U250 FPGA-k működtetik, és olyan egyéni FPGA-gyorsított számítási feladatokhoz használják, mint az ML-következtetés, a videoátkódolás és az adatbázis-keresés és -elemzés. A GPU-alapú virtuálisgép-sorozattól eltérően az NP-sorozat FPGA-gyorsítást használ Xilinx XRT/Vitis eszközláncokkal. A GPU-alapú alternatívákra való migráláshoz a számítási feladatok FPGA-alapú keretrendszerekből GPU-alapú keretrendszerekbe, például CUDA-ba történő átvitele szükséges.

Javasolt migrálási célok számítási feladatok jellemzői alapján:

  • NCasT4_v3 (NVIDIA T4) – Legjobb következtetéshez, interaktív ábrákhoz és költségérzékeny számítási feladatokhoz.
  • NDv2 (NVIDIA V100 és NVLink) – A GPU által gyorsított AI-betanításhoz és a magas GPU-memóriát és összekapcsolást igénylő HPC-számítási feladatokhoz ideális.
  • NCads_H100_v5 (NVIDIA H100) – A legjobb a modern AI-betanításhoz és a kötegelt inferenciához a legújabb GPU-generáción.
Aktuális virtuális gép méret Cél virtuális gép mérete GPU GPU-k száma GPU-létrehozás vCPUs (virtuális processzor egységek) Memória (GiB)
Standard_NP10s Standard_NC4as_T4_v3 NVIDIA T4 1 Turing 4 28
Standard_NP20s Standard_NC16as_T4_v3
vagy Standard_ND40rs_v2 (tréning)
NVIDIA T4 vagy V100 1 vagy 8 Turing vagy Volta 16 vagy 40 110 vagy 672
Standard_NP40s Standard_NC64as_T4_v3
vagy Standard_NC24ads_A100_v4 (csúcskategóriás)
NVIDIA T4 vagy H100 4 vagy 1 Turing vagy Hopper 64 vagy 24 440 vagy 220

A migrálás lépései

Általános módosítások

  1. Válasszon sorozatot és méretet a migráláshoz. További információkért használja a díjkalkulátort .

  2. Szerezze be a kvótát a cél virtuális gép sorozathoz

  3. Méretezze át az aktuális N* sorozatú virtuális gép méretét a célméretre. Ez alkalmas idő lehet a virtuális gépkép által használt operációs rendszer frissítésére, vagy az illesztőprogramokkal előtelepített HPC-képek egyikének használatára kiindulási pontként.

    Important

    Előfordulhat, hogy a virtuális gép képfájlját a CUDA runtime rendszer, az NVIDIA-illesztőprogram és (adott esetben, csak RDMA-kompatibilis méretek esetén) a Mellanox OFED illesztőprogramok régebbi verziójával készítették, mint amelyet az új GPU-alapú virtuális gép sorozat megkövetel, amelyek az Azure Dokumentáció utasításai alapján frissíthetők.

Kompatibilitástörő változások

A migrálás célméretének kiválasztása

Az aktuális használat felmérése után döntse el, hogy milyen típusú GPU virtuális gépre van szüksége. A számítási feladatokra vonatkozó követelményektől függően néhány különböző lehetőség közül választhat.

Note

Ajánlott eljárás a virtuális gép méretének kiválasztása költség és teljesítmény alapján. Az útmutatóban szereplő javaslatok a teljesítménymutatók általános célú egy az egyhez történő összehasonlításán és egy másik VM sorozat legközelebbi megfelelőjén alapulnak. A megfelelő méret kiválasztása előtt kérje le a költség összehasonlítását a Azure díjkalkulátor használatával.

NP-sorozatú ügyfelek: Az NP-sorozatú virtuális gépek alternatíváinak kiválasztásakor vegye figyelembe a költségeket és a teljesítményt is. Az újabb GPU-generációk (T4, V100, H100) jelentősen csökkenthetik az AI és az elemzési számítási feladatok megoldási idejét. Az NP-sorozatok migrálásának részletes útmutatóját a fenti NP-Series virtuális gépek szakaszában találja.

Important

Az előzőleg használt NC, NC v2 és ND-Series méretek elérhetők több GPU-s konfigurációban, beleértve a 4 GPU-s méreteket InfiniBand-kapcsolattal és anélkül is. Ezeket a konfigurációkat arra tervezték, hogy megfeleljenek azoknak a szorosan összekapcsolt feladatoknak, amelyek több számítási kapacitást igényelnek, mint amit egyetlen 4 GPU-s virtuális gép vagy egyetlen K80, P40, illetve P100 GPU biztosítani tudna. Bár a fenti javaslatok egyértelmű előrelépést kínálnak, az ilyen méretű felhasználóknak érdemes megfontolniuk a teljesítménycéljaik elérését a nagyobb teljesítményű NVIDIA V100 GPU-alapú virtuálisgép-sorozatokkal, például az NC v3-sorozattal és az ND v2-sorozattal, amelyek általában alacsonyabb költségek mellett és jobb kezelhetőséggel teszik lehetővé ugyanazt a számítási feladat teljesítményét, mivel jelentősen nagyobb teljesítményt biztosítanak GPU-nként és virtuális gépenként, mielőtt több GPU- és többcsomópontos konfigurációkra lenne szükség, illetőleg.

A cél virtuális gép családjának kvótáját szerezze meg

Kövesse az útmutatót a virtuálisgép-család vCPU-kvótájának növeléséhez. Válassza ki a migráláshoz kiválasztott cél virtuálisgép-méretet.

Az aktuális virtuális gép átméretezése

Átméretezheti a virtuális gépet.

Következő lépések

A GPU-kompatibilis virtuális gépek méreteinek teljes listáját lásd: GPU – gyorsított számítási áttekintés