Vysokovýkonné výpočetní prostředí (HPC) na Azure

Seznámení s prostředím HPC

Vysokovýkonné výpočetní prostředí (HPC), označované také jako velké výpočetní prostředí, využívá k řešení složitých matematických úloh velký počet počítačů založených na procesoru nebo GPU.

Řada odvětví pomocí prostředí HPC řeší některé ze svých nejobtížnějších problémů. Mezi tyto pracovní zátěže patří:

  • Genomics
  • Simulace v petrochemii
  • Finance
  • Návrh polovodičů
  • Inženýrství
  • Modelování počasí

Jak se prostředí HPC liší v cloudu?

Jedním z hlavních rozdílů mezi místním systémem HPC a jedním v cloudu je schopnost dynamicky přidávat a odebírat prostředky podle potřeby. Pomocí dynamického škálování není výpočetní kapacita kritickým místem a zákazníci mohou naopak přizpůsobit velikost infrastruktury požadavkům svých úloh.

Následující články poskytují o této funkci dynamického škálování další podrobnosti.

Kontrolní seznam pro implementaci

Při implementaci vlastního řešení PROSTŘEDÍ HPC na Azure se ujistěte, že jste si prostudovali následující témata:

  • Volba odpovídající architektury na základě vašich požadavků
  • Zjistěte, která výpočetní možnost je pro vaši zátěž nejvhodnější
  • Identifikace správného řešení úložiště vyhovujícího vašim potřebám
  • Rozhodnutí o způsobu správy všech vašich prostředků
  • Optimalizace vaší aplikace pro cloud
  • Zabezpečení vaší infrastruktury

Infrastruktura

Existuje mnoho komponent infrastruktury, které jsou nezbytné k vytvoření systému HPC. Výpočetní prostředky, úložiště a sítě poskytují základní komponenty bez ohledu na to, jak se rozhodnete spravovat úlohy prostředí HPC.

Compute

Azure nabízí řadu velikostí, které jsou optimalizované pro úlohy náročné na výkon CPU a GPU.

Virtuální počítače založené na CPU

Virtuální počítače s podporou GPU

Virtuální počítače řady N jsou vybavené grafickými procesory NVIDIA pro aplikace náročné na výpočetní nebo grafický výkon, včetně vizualizací a učení umělé inteligence (AI).

Storage

Úlohy Batch a HPC ve velkém měřítku mají požadavky na úložiště dat a přístup, které přesahují možnosti tradičních cloudových systémů souborů. Existuje mnoho řešení, která spravují rychlost i kapacitu aplikací HPC na Azure:

Další informace o porovnání Lustre, GlusterFS a BeeGFS na Azure najdete v Parallel Files Systems on Azure e-book a Lustre na Azure blogu.

Sítě

Virtuální počítače H16r, H16mr, A8 a A9 se můžou připojit k back-endové síti RDMA s vysokou propustností. Tato síť může zlepšit výkon úzce propojených paralelních aplikací spuštěných v rámci Microsoft Message Passing Interface, které se lépe označuje jako MPI nebo Intel MPI.

Řízení

Udělej si sám

Vytváření systému HPC od nuly na Azure nabízí značné množství flexibility, ale často je velmi náročné na údržbu.

  1. Nastavte si vlastní prostředí clusteru ve virtuálních počítačích Azure nebo Virtual Machine Scale Sets.
  2. Pomocí šablon Azure Resource Manager nasaďte vedoucí správce pracovních zátěží, infrastrukturu a aplikace.
  3. Zvolte velikosti virtuálních počítačů HPC a GPU, které zahrnují specializovaný hardware a síťová připojení pro úlohy MPI nebo GPU.
  4. Přidejte vysoce výkonné úložiště pro úlohy náročné na vstupně-výstupní operace.

Hybridní a cloudové burstování

Pokud máte existující místní systém HPC, ke kterému se chcete připojit Azure, máte několik zdrojů informací, které vám pomůžou začít.

Nejprve si projděte článek Možnosti připojení místní sítě k Azure v dokumentaci. Tady najdete další informace o těchto možnostech připojení:

Jakmile je bezpečně navázáno síťové připojení, můžete začít používat cloudové výpočetní prostředky na vyžádání s možností dočasného navýšení výkonu vašeho stávajícího správce úloh.

Řešení pro trhu

Na Microsoft Marketplace se nabízí mnoho správců úloh.

Azure Batch

Azure Batch je platforma služba pro efektivní spouštění rozsáhlých paralelních aplikací a aplikací PROSTŘEDÍ HPC v cloudu. Azure Batch rozvrhuje intenzivní výpočetní úlohy ke spuštění na spravovaném fondu virtuálních počítačů a může automaticky škálovat výpočetní prostředky tak, aby splňovaly potřeby vašich úloh.

Poskytovatelé SaaS nebo vývojáři mohou pomocí sad SDK a nástrojů Batch integrovat aplikace HPC nebo kontejnerové úlohy s Azure, nahrávat data do Azure a vytvářet procesy pro spuštění úloh.

V Azure Batch všechny služby běží v cloudu. Následující obrázek ukazuje, jak architektura vypadá s Azure Batch, přičemž konfigurace škálovatelnosti a plánu úloh běží v cloudu, zatímco výsledky a sestavy se dají odeslat do místního prostředí.

Diagram ukazuje ukázku architektury prostředí HPC pro Azure Batch.

Azure CycleCloud

Azure CycleCloud Poskytuje nejjednodušší způsob, jak spravovat úlohy PROSTŘEDÍ HPC pomocí libovolného plánovače (například Slurm, Grid Engine, HPC Pack, HTCondor, LSF, PBS Pro nebo Symphony) na Azure

CycleCloud umožňuje následující:

  • Nasazení kompletních clusterů a dalších prostředků, včetně plánovače, výpočetních virtuálních počítačů, úložiště, sítí a mezipaměti
  • Orchestrace pracovních postupů úloh, dat a cloudu
  • Zajištění plné kontroly správců nad tím, kteří uživatelé mohou spouštět úlohy a také kde a s jakými náklady
  • Přizpůsobte a optimalizujte clustery prostřednictvím pokročilých funkcí zásad a správy, včetně řízení nákladů, integrace služba Active Directory, monitorování a vytváření sestav.
  • Možnost využití aktuálního plánovače úloh a aplikací bez nutnosti změn
  • Využití výhod integrace automatického škálování a prověřených referenčních architektur pro širokou škálu oborů a úloh HPC
Model hybridního nebo cloudového shlukování

V tomto diagramu hybridního příkladu vidíme jasně, jak se tyto služby distribuují mezi cloud a místní prostředí. Možnost spouštět úlohy v obou typech zatížení. Diagram ukazuje příklad architektury HPC pro CycleCloud na Azure v hybridním prostředí.

Model nativní pro cloud

Následující ukázkový diagram modelu nativní pro cloud ukazuje, jak bude úloha v cloudu zpracovávat vše a současně si zachová připojení k místnímu prostředí.

Diagram ukazuje příkladovou architekturu HPC pro CycleCloud na Azure v nativním cloudovém modelu.

Srovnávací graf

funkce Azure Batch Azure CycleCloud
Plánovač Rozhraní API a nástroje služby Batch a skripty příkazového řádku na portálu Azure (nativní pro cloud). Používejte standardní plánovače PROSTŘEDÍ HPC, jako jsou Slurm, PBS Pro, LSF, Grid Engine a HTCondor nebo rozšiřte moduly plug-in automatického škálování CycleCloudu, abyste mohli pracovat s vlastním plánovačem.
Výpočetní prostředky Uzly software jako služby – platforma jako služba Software typu Platforma jako služba – Platforma jako služba
Nástroje monitorování Azure Monitor Azure Monitor, Grafana
Přizpůsobení Vlastní fondy obrázků, obrázky třetích stran, přístup k Batch API. Použití komplexního rozhraní RESTful API k přizpůsobení a rozšíření funkcí, nasazení vlastního plánovače a podpory do stávajících správců úloh
Integrace Data Factory v Microsoft Fabric, Azure Data Factory, Azure CLI Vestavěné rozhraní příkazového řádku pro Windows a Linux
Typ uživatele Developers Klasické správce a uživatelé prostředí HPC
Typ práce Dávka, Pracovní postupy Úzce svázané (Message Passing Interface/ MPI).
podpora Windows Ano Liší se v závislosti na volbě plánovače.

Správci úloh

Tady jsou příklady správců clusterů a úloh, které se můžou spouštět v Azure infrastruktuře. Vytvářejte samostatné clustery na Azure virtuálních počítačích nebo je rozšiřujte na Azure virtuální počítače z místního clusteru.

Containers

Containers můžete také použít ke správě některých úloh prostředí HPC. Služby jako Azure Kubernetes Service (AKS) usnadňují nasazení spravovaného clusteru Kubernetes v Azure.

Správa nákladů

Správa nákladů na prostředí HPC na Azure se dá provést několika různými způsoby. Zkontrolujte možnosti nákupu Azure a vyhledejte nejvhodnější metodu pro vaši organizaci.

Zabezpečení

Přehled osvědčených postupů zabezpečení pro Azure najdete v dokumentaci k zabezpečení Azure.

Kromě konfigurací sítě dostupných v části Cloud Bursting můžete implementovat konfiguraci hub/spoke pro izolaci vašich výpočetních prostředků:

Aplikace prostředí HPC

Spouštění vlastních nebo komerčních aplikací HPC v Azure Některé příklady v této části jsou testované, aby se efektivně škálovaly s dalšími virtuálními počítači nebo výpočetními jádry. Navštivte Microsoft Marketplace pro řešení připravená k nasazení.

Poznámka:

S dodavateli komerčních aplikací se vždy poraďte ohledně licencování a dalších omezení při spouštění v cloudu. Ne všichni dodavatelé nabízejí licencování formou průběžných plateb. Možná pro své řešení budete potřebovat licenční server v cloudu nebo se připojit k místnímu licenčnímu serveru.

Technické aplikace

Grafika a vykreslování

AI a hluboké učení

Poskytovatelé MPI

Vzdálená vizualizace

Spuštění virtuálních počítačů využívajících GPU v Azure ve stejné oblasti jako výstup prostředí HPC pro co nejnižší latenci, lepší přístup a pro možnost vzdálené vizualizace prostřednictvím Azure Virtual Desktop.

Srovnávací testy výkonu

Další důležité informace

Další kroky

Nejnovější oznámení najdete v následujících zdrojích informací:

Příklady Microsoft Batch

V těchto kurzech najdete podrobnosti o spouštění aplikací ve službě Microsoft Batch: