Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Služba Microsoft Discovery integruje agentskou AI, data a vysokovýkonné výpočetní prostředí (HPC) do jedné výzkumné platformy. Superpočítač Microsoft Discovery poskytuje vrstvu prostředí HPC této platformy. Superpočítač společně se svými skupinami uzlů provádí simulace, zpracování velkých objemů dat a další výpočetně náročné úlohy pro agenty Discovery a lidské uživatele.
Přehled
Microsoft Superpočítač Discovery poskytuje přístup k Microsoft prostředkům prostředí HPC, které pokrývají tisíce jader napříč několika architekturami, včetně procesorů a GPU. Pooly uzlů seskupují tyto prostředky, aby bylo možné úlohy nasazovat na hardware odpovídající jejich požadavkům. Agenti zjišťování odesílají úlohy do superpočítače, který vybere příslušný fond uzlů a spravuje provádění.
Klíčové funkce
- Paralelní spuštění. Superpočítač spouští úlohy souběžně až do konfigurovatelného limitu. Pozdější úlohy jsou zařazeny do fronty a zpracovány, jakmile je k dispozici kapacita.
- Podnikové zabezpečení a dodržování předpisů. Všechny úlohy běží ve vašem tenantovi Azure a dědí stávající kontrolní mechanismy dodržování předpisů a zabezpečení. Zdrojová data, modely a průběžné výsledky zůstanou ve vašem předplatném.
- Elastická kapacita. Prostředky se škálují na vyžádání v mezích, které definujete, od několika souběžných úloh po desítky tisíc.
- Hardwarová rozmanitost. Podporovaný hardware zahrnuje gpu, procesory x86 z procesorů Intel a AMD a procesory založené na ARM. Nové typy procesorů Azure jsou dostupné bez zpoždění při zadávání zakázek.
Skupiny uzlů
Skupina uzlů je detailní organizační jednotka, kterou služba Discovery používá k uspořádání sady podobných výpočetních prostředků. Každý fond uzlů definuje konfiguraci výpočetních prostředků a paměti svých členů, aby Discovery mohlo umisťovat úlohy do příslušného clusteru. Každý fond také nastaví limit paralelismu pro úlohy naplánované na něm.
Fond uzlů určuje následující atributy:
- Profilhardwaru (velikost) označuje typy virtuálních počítačů Azure používané všemi uzly ve fondu. Například fond GPU může používat virtuální počítače ŘADY ND s GPU NVIDIA Blackwell Ultra a procesory Grace pro úlohy AI, zatímco fond procesorů může pro tradiční prostředí HPC používat procesory AMD, Intel nebo Cobalt ARM. Superpočítač Discovery podporuje širokou škálu služeb Azure HPC pro specializované úlohy, jako jsou úlohy využívající GPU, úlohy s vysokými nároky na paměť a typy virtuálních počítačů pro menší horizontální škálování.
- Kapacita označuje maximální počet virtuálních počítačů, které může fond spustit. Fond může mít při nečinnosti nulový počet uzlů a škálovat až na nakonfigurované maximum. Kapacita podléhá kvótám vašeho předplatného.
- Sítě a umístění definují, jak se uzly ve fondu připojují k určené podsíti virtuální sítě, která jim umožňuje přístup ke službám platformy, jako je úložiště, a systém orchestrace superpočítačů. Fond uzlů se nachází ve stejné oblasti Azure a virtuální síti jako superpočítač, aby se zajistilo propojení s nízkou latencí pro úlohy a sdílení dat rozhraní MPI (Message Passing Interface).
- Přiřazení úloh Skupina uzlů může být vyhrazena pro konkrétní úlohu, tým nebo projekt, aby se podpořila izolace a sledování úloh.
Protože jsou prostředky Azure virtuální, dimenzování fondu pro špičkové zatížení neplýtvá prostředky, když je fond nečinný. Správci můžou použít limity souběžnosti na fond a uživatelé a agenti odesílají úlohy do fondu, které nejlépe vyhovují jejich požadavkům.
Konfigurace skupiny uzlů
Úlohy mají různé charakteristiky zpracování. Některé jsou optimalizované pro vektorové nebo tensorové operace; ostatní jsou optimalizované pro skalární výpočty. Skupiny uzlů umožňují přiřadit hardware ke konkrétním úlohám.
Kategorie hardwaru
- Fondy uzlů akcelerované pomocí GPU Virtuální počítače vybavené GPU, vhodné pro trénování modelů hlubokého učení, molekulární dynamiku a další algoritmy, kterým prospívá akcelerace pomocí GPU. Fond ND-series s grafickými procesory NVIDIA Blackwell, například poskytuje vysokou propustnost maticových výpočtů a je vhodný pro výpočetní chemii, genomiku a zpracování obrázků.
- Fondy uzlů optimalizované pro procesor Vysoce výkonné virtuální počítače s procesorem pro úlohy, které se škálují s jádry nebo pamětí, ale nemají prospěch z grafických procesorů, jako jsou tradiční úlohy HPC a automatizace elektronického návrhu (EDA), statistické analýzy a zpracování dat. Virtuální počítače s procesorem s nižšími náklady jsou také vhodné pro předběžné zpracování, orchestraci a řízení úloh.
- Specializované skupiny uzlů. Velikosti virtuálních počítačů, které splňují specializované požadavky na hardware, jako jsou například FPGA.
Jeden superpočítač může kombinovat více hardwarových kategorií, aby podporoval různorodé vědecké výpočty na jedné platformě. Například farmaceutická organizace může provozovat jeden fond GPU pro generování molekul řízené AI, druhý fond GPU pro simulaci a fond procesoru pro zpracování experimentálních dat. Tým pro silicon engineering může spárovat fond GPU pro elektromagnetickou simulaci s fondem procesoru pro ověření návrhu.
Škálování modelů
- Automaticky škálované skupiny uzlů (na vyžádání). Výchozí konfigurace. Fond nemá při nečinnosti žádné spuštěné uzly. Uzly se zřizují při odeslání úloh a po jejich dokončení se uvolňují, až do nakonfigurovaného maxima. Tento model je nákladově efektivní pro nárazové nebo občasné úlohy.
- Trvalé (stále zapnuté) pooly uzlů. Nakonfigurováno s minimálním počtem uzlů větším než nula. Trvalé fondy zaručují dostupnou kapacitu pro úlohy citlivé na latenci za cenu nečinnosti využití virtuálních počítačů.
Požadavky a artefakty
Nasazení superpočítače vyžaduje následující artefakty: virtuální síť a podsítě, spravované identity, image kontejnerů a definice prostředků pro nástroje.
Síťová infrastruktura
Superpočítač běží ve vašem prostředí Azure, takže zadáte konfiguraci sítě, která integruje cluster PROSTŘEDÍ HPC s podnikovými síťovými a bezpečnostními prvky.
Superpočítač vyžaduje Azure virtuální síť a používá dvě podsítě, jednu pro orchestraci systému a komponenty pro správu a druhou pro výpočetní uzly. Obě podsítě musí být ve stejné virtuální síti a systémová podsíť musí mít konektivitu k podsítím fondu uzlů, aby řídicí rovina mohla koordinovat plánování úloh a kontroly stavu.
CIDR pro pody a CIDR pro služby
Podkladový cluster AKS superpočítače používá pro pody a služby v Kubernetes samostatné rozsahy IP adres, označované jako Pod CIDR a Service CIDR. Tyto rozsahy jsou záměrně nakonfigurované mimo adresní prostor virtuální sítě a používají se výhradně pro interní sítě Kubernetes.
CIDR podu
Pod CIDR je rozsah IP adres, ze kterého Kubernetes přiřazuje IP adresy podům aplikací spuštěným v clusteru. Každý pod obdrží IP adresu z rozsahu Pod CIDR, což umožňuje přímou komunikaci mezi pody v rámci clusteru.
CIDR služby
CIDR služby je rozsah IP adres používaný pro služby Kubernetes Services (služby ClusterIP). Každá služba má přiřazenou virtuální IP adresu z tohoto rozsahu. Tyto virtuální IP adresy poskytují stabilní koncový bod pro přístup k aplikacím bez ohledu na to, které pody aktuálně obsluhují provoz.
Proč jsou tyto rozsahy CIDR mimo adresní prostor virtuální sítě
V clusteru AKS superpočítače jsou CIDR pro pody a CIDR pro služby nakonfigurovány mimo adresní prostor virtuální sítě z následujících důvodů:
- Oddělení infrastruktury a sítí Kubernetes Adresní prostor virtuální sítě se používá pro prostředky infrastruktury, jako jsou uzly AKS, virtuální počítače, nástroje pro vyrovnávání zatížení, privátní koncové body a další služby Azure. Oddělení rozsahů CIDR brání kolizím mezi IP adresami infrastruktury a IP adresami spravovanými Kubernetes.
- Vylepšené využití IP adres Pody se můžou rychle škálovat a využívat velký počet IP adres. Vyhrazený pod CIDR podporuje rozsáhlé úlohy bez vyčerpání adresního prostoru virtuální sítě. To je obzvlášť výhodné při použití sítě Azure CNI Overlay, kde jsou IP adresy podů spravovány nezávisle na síti VNet.
- Zjednodušená správa sítě Oddělení rozsahů CIDR pro Pody a Služby usnadňuje plánování přidělování síťových adres, zamezení vyčerpání adresního prostoru, správu růstu clusteru a řešení problémů se sítí.
- Vyhněte se konfliktům směrování. CiDR podu a CIDR služby se nesmí překrývat s adresními prostory virtuální sítě AKS, partnerskými virtuálními sítěmi, místními sítěmi připojenými přes SÍŤ VPN nebo ExpressRoute nebo jinými rozsahy sítí clusteru AKS. Použití vyhrazených nepřekrývajících se rozsahů adres zajišťuje předvídatelné chování směrování.
Příklad konfigurace
| Component | Rozsah CIDR |
|---|---|
| virtuální síť | 10.100.0.0/16 |
| Podsíť uzlu AKS | 10.100.1.0/24 |
| CIDR podu | 10.244.0.0/16 |
| CIDR služby | 10.0.0.0/16 |
V tomto příkladu uzly AKS dostávají IP adresy ze subnetu virtuální sítě (10.100.1.0/24), pody dostávají IP adresy z CIDR podů (10.244.0.0/16) a služby Kubernetes dostávají virtuální IP adresy z CIDR služeb (10.0.0.0/16).
Important
Správné plánování nepřekrývajících se rozsahů CIDR je nezbytné pro úspěšná nasazení superpočítačů a budoucí růst clusteru. Ujistěte se, že se rozsahy Pod CIDR a Service CIDR nepřekrývají s žádnými sítěmi dosažitelnými z vaší VNet.
Zabezpečení a identita
Superpočítač používá Azure spravované identity k interakci s jinými službami Azure a ke správě virtuálních počítačů.
- Identita clusteru Spravovaná identita přiřazená uživatelem, kterou při nasazení přiřadíte superpočítači. Řídicí rovina používá tuto identitu k provádění operací clusteru, jako je připojení úložiště a vyžádání imagí kontejnerů z Azure Container Registry (ACR).
- Identita uzlu (kubelet). Druhá spravovaná identita přiřazená virtuálním počítačům uzlů, která jim uděluje přístup k prostředkům, jako je ACR pro image nástrojů. Identita kubeletu může mít užší rozsah než clusterová identita, ale musí mít u clusterové identity přiřazenou roli Managed Identity Operator. Toto uspořádání umožňuje virtuálním počítačům uzlů používat oprávnění identit clusteru pro konkrétní operace bez vystavení přihlašovacích údajů a zachování oddělení mezi řídicí rovinou a rovinou uzlu.
- Identity pracovních zátěží Discovery podporuje oddělené identity pro výpočetní, administrační a řídicí roviny superpočítače. Identity úloh umožňují nástrojům používat správu identit Azure bez nutnosti spravovat tajné kódy.
- Přístup k registru bitových kopií Image kontejnerů nástrojů se obvykle ukládají v ACR nebo v jiném registru kontejnerů. Identity služby Supercomputer vyžadují oprávnění pull. Nakonfigurujte ACR tak, aby důvěřovalo spravované identitě superpočítače prostřednictvím Microsoft Entra ID namísto přímé správy přihlašovacích údajů pro Docker.
- Spravovaná skupina prostředků Vytvoření superpočítače vytvoří ve vašem předplatném spravovanou skupinu prostředků, která obsahuje základní prostředky Azure, například škálovací sady virtuálních počítačů. Discovery za vás spravuje tuto skupinu prostředků, a to odděleně od vašich ostatních skupin prostředků. Ujistěte se, že vaše předplatné má dostatečnou kvótu pro velikosti virtuálních počítačů, které plánujete použít. Odstraněním superpočítače se odstraní spravovaná skupina prostředků.
Image kontejnerů nástrojů a softwarové prostředí
Nástroje pro zjišťování běží na superpočítači pomocí kontejnerů Dockeru. Obrázek musí obsahovat binární soubory, knihovny a kód vyžadované nástrojem. Image musí být kompatibilní s operačním systémem uzlu, což je ve výchozím nastavení Linux. Když se nástroj spustí, platforma načítá svou image z nakonfigurovaného registru do přiřazeného uzlu. Funkce Přineste si vlastní nástroje musí obsahovat všechny ovladače, které nejsou přítomné v základní imagi.
Pořadí nasazení
Následující posloupnost popisuje, jak se komponenty nasazují a používají.
- Vytvoření superpočítače (řídicí rovina). Správce nasadí prostředek superpočítače prostřednictvím portálu Azure, Azure CLI nebo šablony ARM. Nasazení určuje název a oblast, propojuje požadovanou podsíť a přiřazuje spravované identity.
- Zřiďte cluster HPC (datová rovina). Discovery automaticky vytvoří spravovanou skupinu prostředků a nasadí prostředky pro cluster a vyzve k zadání konfigurace podsítě a základního prostředí.
- Definujte fondy uzlů (řídicí rovina). Správce vytvoří jeden nebo více fondů uzlů pro superpočítač, určí velikost virtuálního počítače, podsíť uzlu a parametry škálování. Discovery spravuje odpovídající škálovací sady virtuálních počítačů ve spravované skupině prostředků. Fondy můžou začínat nulovými uzly, pokud je povolené automatické škálování nebo s nakonfigurovaným minimem, pokud je trvalé.
- Registrace nástrojů a agentů (řídicí rovina) Autoři nástrojů registrují nástroje v katalogu Discovery a uvádějí umístění image kontejneru každého nástroje a požadavky na prostředky systému. Agenti pak můžou vyvolat registrované nástroje.
- Spouštění úloh (rovina dat) Když uživatel spustí úlohu prostřednictvím Copilot nebo pracovního postupu agenta, služba Discovery orchestruje spuštění a vyvolá požadované nástroje v příslušných fondech uzlů.
- Monitorování a dokončení úloh Řídicí rovina sleduje běžící úlohy prostřednictvím front úloh, logů a kontrol stavu. Uživatelé dostávají aktualizace stavu prostřednictvím Copilot. Po dokončení úlohy se výsledky zapíšou do určeného úložiště a kontejner se ukončí. Nečinné uzly jsou uvolňovány ve fondech s automatickým škálováním.
- Iterujte a škálujte. Uživatelé mohou zkontrolovat výsledky a v případě potřeby spustit navazující běhy. Fondy uzlů se škálují na vyžádání a správci můžou měnit velikost stávajících fondů nebo přidávat nové fondy s vývojem úloh.
Integrace s Microsoft Zjišťování a úložiště
Discovery integruje superpočítač s úložištěm Azure HPC pomocí typu prostředku Microsoft.Discovery/storages. Pro úlohy, které vyžadují vysoce výkonné úložiště souborů, je Azure NetApp Files vhodná možnost.
DataContainers a datová aktiva
Kromě infrastruktury úložiště spravuje Discovery vědecké data prostřednictvím dataContainerů a datových prostředků. Oba jsou nedílnou součástí kanálu provádění nástrojů a jsou definovány v projektech zjišťování.
DataContainers
DataContainer je logické úložiště dat, které abstrahuje základní technologii úložiště a představuje konzistentní rozhraní pro agenty AI napříč Azure Blob Storage, discovery Storage a dalšími back-endy. DataContainers poskytují:
- Abstrakce úložiště. Jednotný přístup napříč úložnými backendy
- Řízení přístupu Správa přihlašovacích údajů pro zabezpečený přístup
- Integrace. Definovaný integrační bod mezi prostředky úložiště a nástroji pro výzkum.
DataContainers jsou představovány jako prostředky Microsoft.Discovery.DataContainer, které jsou propojené s konkrétními účty úložiště nebo svazky.
Datové prostředky
Datový asset představuje jednotlivý soubor, datovou sadu nebo kolekci uvnitř dataContaineru. Datové prostředky poskytují:
- Organizace. Seskupování podle úkolu, úlohy nebo projektu
- Původ. Záznam o původu a transformacích dat
- Metadata. Popisné atributy, které zlepšují zjistitelnost.
- Vstupně-výstupní operace nástroje. Strukturovaný mechanismus pro nástroje pro využívání a vytváření dat.
Metadata datového assetu popisují obsah, formát a vztahy prostředku, což umožňuje, aby se prostředky mohly účastnit složitých pracovních postupů.