Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Microsoft Foundry Models to centrum do odnajdywania i wdrażania szerokiej gamy modeli sztucznej inteligencji na potrzeby generowania aplikacji sztucznej inteligencji. Aby udostępnić model dla żądań wnioskowania, należy go wdrożyć. Platforma Foundry oferuje dwie opcje wdrażania w zależności od typu modelu i potrzeb infrastruktury.
Wskazówka
Nie zawsze trzeba tworzyć wdrożenie. Dzięki dostępowi natychmiastowemu (wersja zapoznawcza) możesz wywoływać obsługiwane modele po nazwie i od razu uruchamiać inferencję — bez konieczności wdrażania.
Opcje wdrażania
Usługa Foundry udostępnia dwie opcje wdrażania:
- Bezserwerowy interfejs API — dla modeli Foundry, w tym modeli Foundry sprzedawanych przez Azure oraz wybranych modeli od partnerów i społeczności. Ta opcja jest preferowaną i najbardziej zdolną ścieżką wdrożenia. Obejmuje standardowy typ wdrożenia, typ z aprowizowaną przepływnością, typ wsadowy i typ deweloperski.
- Moc obliczeniowa zarządzana (wersja zapoznawcza) — Dla modeli open source, modeli partnerskich i modeli niestandardowych uruchamianych na dedykowanych zasobach GPU, którymi zarządza za Ciebie Foundry.
Foundry wybiera odpowiednią opcję wdrożenia na podstawie modelu, który wybierzesz.
Jeśli potrzebujesz tylko wypróbować obsługiwany model, możesz całkowicie pominąć wdrażanie i użyć natychmiastowego dostępu (wersja zapoznawcza), który wywołuje modele według nazwy bez tworzenia bezserwerowego interfejsu API lub zarządzanego wdrożenia obliczeniowego.
Aby uzyskać pełne porównanie możliwości, zobacz Porównanie opcji wdrażania.
Bezserwerowe API
Bezserwerowy interfejs API jest preferowaną opcją wdrożenia w narzędziu Foundry. Obsługuje on najszerszy zakres możliwości i typów wdrożeń.
Które modele używają bezserwerowych wdrożeń interfejsu API?
Wszystkie Modele Foundry, w tym Modele Foundry oferowane przez Azure oraz wybrane modele od partnerów i społeczności, korzystają z bezserwerowych wdrożeń interfejsu API. Modele Foundry sprzedawane przez platformę Azure obejmują wszystkie modele Azure OpenAI oraz wybrane modele czołowych dostawców, które są rozliczane w ramach subskrypcji Azure, objęte umowami SLA platformy Azure i obsługiwane przez firmę Microsoft. Modele od partnerów i społeczności, które używają bezserwerowych wdrożeń interfejsu API, obejmują modele Anthropic i określone modele od partnerów, takich jak Mistral, Cohere i Meta.
Możliwości bezserwerowego interfejsu API
Obsługa wdrożeń bezserwerowego interfejsu API:
- Wiele typów wdrożeń (lub jednostek SKU wdrożenia) — Global Standard, Data Zone Standard, Standard (pojedynczy region), z aprowizacją, wsadowe i inne. Każdy typ określa miejsce przetwarzania danych i sposób płatności. Aby uzyskać szczegółowe informacje, zobacz typy wdrożeń dla Microsoft Foundry Models.
- Elastyczność przetwarzania danych — wybierz regionalną, strefę danych (STANY ZJEDNOCZONE, UE lub APAC) lub globalne przetwarzanie na podstawie wymagań dotyczących zgodności.
- Filtrowanie zawartości — wbudowane filtry Bezpieczeństwo zawartości platformy Azure AI z dostosowywalnymi konfiguracjami.
- Uwierzytelnianie bez klucza — Microsoft Entra ID (zalecane) i uwierzytelnianie oparte na kluczach.
- Sieć prywatna — integracja sieci wirtualnej na potrzeby bezpiecznego dostępu.
- Przepustowość aprowizowana — zarezerwuj zasoby za pomocą jednostek aprowizowanej przepustowości (PTU), aby zapewnić przewidywalną wydajność przy niskich opóźnieniach. Aby uzyskać szczegółowe informacje, zobacz Zarezerwowana przepustowość.
Wymagania dotyczące zasobów
Bezserwerowe wdrożenia interfejsu API są dostępne w:
- Zasoby odlewnicze — to podstawowy typ zasobu dla nowych projektów odlewniczych. Nie jest wymagane żadne centrum sztucznej inteligencji.
- Azure zasoby OpenAI — jeśli używasz Azure zasobów openAI, wykaz modeli pokazuje tylko Azure modele OpenAI do wdrożenia. Uaktualnij do zasobu Foundry, aby uzyskać dostęp do pełnego zestawu modeli Foundry.
Aby rozpocząć wdrażanie bezserwerowego interfejsu API, zobacz Wdrażanie modeli Microsoft Foundry w portalu Foundry lub Wdrażanie modeli przy użyciu Azure CLI i Bicep.
Wdrażanie zarządzanych zasobów obliczeniowych (wersja zapoznawcza)
Note
Zarządzane zasoby obliczeniowe w rozwiązaniu Foundry są obecnie dostępne w publicznej wersji zapoznawczej. Ta wersja zapoznawcza jest udostępniana bez umowy dotyczącej poziomu usług i nie zalecamy korzystania z niej w przypadku obciążeń produkcyjnych. Niektóre funkcje mogą nie być obsługiwane lub mogą mieć ograniczone możliwości. Aby uzyskać więcej informacji, zobacz Warunki dodatkowe korzystania z testowych wersji Microsoft Azure.
Zarządzane zasoby obliczeniowe w usłudze Foundry (wersja zapoznawcza) to zarządzana platforma GPU jako usługa (PaaS), która udostępnia modele o otwartym kodzie źródłowym i modele z niestandardowymi wagami przy użyciu dedykowanych zasobów GPU. Uzyskujesz dostęp do zarządzanych wdrożeń obliczeniowych za pośrednictwem tego samego punktu końcowego projektu Foundry co w przypadku innych typów wdrożeń, bez konieczności posiadania maszyn wirtualnych, klastrów ani środowisk uruchomieniowych do obsługi inferencji. Foundry dobiera skalę wdrożenia, udostępnia akceleratory i dba o aktualność poprawek środowiska uruchomieniowego.
Ważne
Zarządzane zasoby obliczeniowe obsługują modele open source, partnerskie, branżowe i niestandardowe. Zarządzane wdrożenia obliczeniowe są udostępniane za pośrednictwem ujednoliconego punktu końcowego projektu Foundry, z wykorzystaniem tego samego uwierzytelniania, ustawień sieciowych i interfejsu SDK.
Które modele korzystają z zarządzanych zasobów obliczeniowych?
Możesz wdrażać modele z kolekcji Hugging Face za pomocą zarządzanych zasobów obliczeniowych. Oto kilka przykładów:
- Modele Qwen
- Modele NVIDIA Nemotron
- Wybrane modele meta
- Wybrane modele mistralne
katalog Microsoft Foundry obejmuje duży i rosnący wybór modeli typu open source i partnerów. Aby zapoznać się z bieżącym wykazem, zobacz wykaz modeli.
Możliwości zarządzanych zasobów obliczeniowych
Zarządzane zasoby obliczeniowe (wersja zapoznawcza) obsługują:
-
Ujednolicony punkt końcowy usługi Foundry i uwierzytelnianie — Użyj tego samego punktu końcowego projektu, kluczy API, usługi Microsoft Entra ID i sieci prywatnych jak w przypadku wdrożeń z płatnością za token oraz z aprowizowaną przepustowością. Ścieżki wnioskowania używają
<endpoint>/managed-deployments/<deployment-name>/. Środowiska uruchomieniowe zgodne z Chat Completions działają również pod standardową ścieżką/openai/v1/przy użyciu pakietu OpenAI SDK. - Określanie rozmiaru instancji modelu — wdrożenia są określane w kategoriach modelocentrycznych. Nie musisz wybierać jednostek SKU maszyn wirtualnych, ponieważ Foundry dobiera układy GPU dla każdego wystąpienia na podstawie rozmiaru modelu, architektury, długości kontekstu oraz tego, czy obciążenie zoptymalizowano pod kątem niskich opóźnień czy wysokiej przepustowości.
- Zoptymalizowane środowiska wykonawcze inferencji — kontenery vLLM, SGLang i NVIDIA NIM wyselekcjonowane przez Microsoft, z ciągłym przetwarzaniem wsadowym i równoległością tensorową.
- Rodziny akceleratorów — A100 (80 GB), H100 (80 GB) i MI300X (192 GB).
- Automatyczne skalowanie i skalowanie do zera — Skaluj automatycznie na podstawie bieżącego ruchu lub ręcznie. Skonfiguruj limit czasu bezczynności, aby wdrożenie skalowało się do zera, gdy żaden ruch nie dociera, co sprawia, że rozliczenia są natychmiast zatrzymywane.
- Środowiska uruchomieniowe zarządzane przez firmę Microsoft — firma Microsoft odpowiada za środowiska uruchomieniowe, bazowe obrazy kontenerów i poprawki zabezpieczeń. Aktualizacje są stosowane automatycznie do wdrożeń na żywo.
- Metryki możliwości obserwowania — każde wdrożenie emituje liczbę wywołań interfejsu API według kodu stanu i percentylów czasu odpowiedzi. Modele uzupełniania czatu emitują również liczniki tokenów wejściowych i wyjściowych, percentyle czasu do pierwszego tokenu (TTFT) oraz całkowite percentyle czasu odpowiedzi pogrupowane według czasu.
Rozliczenia i limit przydziału
Rozliczanie zarządzanych zasobów obliczeniowych odbywa się godzinowo dla każdego SKU akceleratora, a przepustowość na GPU stanowi podstawową jednostkę rozliczeniową. Automatyczne skalowanie i skalowanie do zera dostosowują koszty do rzeczywistego ruchu, dzięki czemu naliczanie opłat zostaje natychmiast wstrzymane, gdy liczba instancji zostaje zmniejszona.
Limit przydziału jest przyznawany dla każdego SKU akceleratora w danym regionie w ramach procesu przydziału limitu w Foundry i jest oddzielny od limitu przydziału maszyn wirtualnych platformy Azure. Azure maszyny wirtualne to oferta typu infrastruktura jako usługa (IaaS) z regionalnymi jednostkami SKU; zarządzane zasoby obliczeniowe to oferta PaaS, która prowadzi do przetwarzania globalnego i przetwarzania stref danych. Nie można zastosować istniejącego limitu przydziału maszyn wirtualnych Azure do zarządzanego wdrożenia obliczeniowego.
Zarządzane zasoby obliczeniowe są obecnie dostępne dla wdrożenia globalnego. Aby uzyskać informacje o oszacowaniach stawek, zobacz kalkulator cen Azure.
Wprowadzenie
Aby rozpocząć wdrażanie zarządzanych zasobów obliczeniowych, zobacz Wdrażanie modeli typu open source przy użyciu zarządzanych zasobów obliczeniowych.
Porównanie opcji wdrażania
Używaj bezserwerowego interfejsu API , jeśli jest to możliwe. W poniższej tabeli porównaliśmy możliwości między dwiema opcjami wdrażania:
Note
Natychmiastowy dostęp (wersja zapoznawcza) nie jest opcją wdrożenia w tym porównaniu. Wywołuje obsługiwane modele po nazwie bez tworzenia bezserwerowego interfejsu API ani zarządzanego wdrożenia zasobów obliczeniowych.
| Możliwości | Bezserwerowe API | Zarządzane obliczenia |
|---|---|---|
| Które modele można wdrożyć? | Wszystkie modele Foundry, w tym modele Foundry sprzedawane przez Azure i wybrane modele od partnerów oraz społeczności | Modele open source i modele partnerów z katalogu modeli, NVIDIA NIM oraz modele branżowe |
| Zasób wdrożenia | Zasób usługi Foundry | Projekt odlewni |
| Wymaga centrum sztucznej inteligencji | Nie | Nie |
| Opcje przetwarzania danych | Regionalna, strefa danych, globalna | Global |
| Sieć prywatna | Tak | Tak |
| Filtrowanie zawartości | Wbudowane i dostosowywalne | Niedostępna w publicznej wersji zapoznawczej |
| Uwierzytelnianie bez klucza | Tak (Microsoft Entra ID i uwierzytelnianie oparte na kluczach) | Tak (Microsoft Entra ID i uwierzytelnianie oparte na kluczach) |
| Fakturowanie | Użycie tokenu lub aprowizowanie jednostek przepływności | Na godzinę dla każdego SKU akceleratora |
Wskazówka
Aby uzyskać szczegółowe informacje o cenach, zobacz Plan i zarządzanie kosztami Microsoft Foundry.
Powiązana zawartość
- Typy wdrożenia dla modeli Microsoft Foundry
- Wdróż modele Microsoft Foundry w portalu Foundry
- Wdrażaj modele przy użyciu Azure CLI i Bicep
- Modele Foundry sprzedawane przez platformę Azure
- Modele Foundry od partnerów i społeczności
- omówienie modeli Microsoft Foundry
- Zarządzane zasoby obliczeniowe w Microsoft Foundry