Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Microsoft Foundry Models ist der Hub zum Entdecken und Bereitstellen einer breiten Palette von KI-Modellen für generative KI-Anwendungen. Um ein Modell für Rückschlussanforderungen verfügbar zu machen, stellen Sie es bereit. Foundry bietet je nach Modelltyp und Infrastrukturbedarf zwei Bereitstellungsoptionen.
Tip
Sie müssen nicht immer eine Bereitstellung erstellen. Mit sofortigem Zugriff (Vorschau) können Sie unterstützte Modelle anhand ihres Namens aufrufen und sofort Inferenz ausführen – keine Bereitstellung erforderlich.
Bereitstellungsoptionen
Foundry bietet zwei Bereitstellungsoptionen:
- Serverlose API – Für Foundry Models, einschließlich foundry Models, die von Azure verkauft werden, und wählen Sie Modelle aus Partnern und Community aus. Diese Option ist der bevorzugte und fähigste Bereitstellungspfad. Sie umfasst die Typen Standard, bereitgestellter Durchsatz, Batch und Entwicklerbereitstellung.
- Verwalteter Compute (Vorschau) – Für Open-Source-, Partner- und benutzerdefinierte Modelle, die auf dedizierter GPU-Kapazität ausgeführt werden, die Foundry für Sie verwaltet.
Foundry wählt die entsprechende Bereitstellungsoption basierend auf dem ausgewählten Modell aus.
Wenn Sie nur ein unterstütztes Modell ausprobieren müssen, können Sie die Bereitstellung vollständig überspringen und den Sofortzugriff (Vorschau) verwenden, der Modelle anhand des Namens aufruft, ohne eine Serverless-API oder eine verwaltete Computebereitstellung zu erstellen.
Einen vollständigen Funktionsvergleich finden Sie unter Bereitstellungsoptionsvergleich.
Serverlose API
Die serverlose API ist die bevorzugte Bereitstellungsoption in Foundry. Sie unterstützt die breiteste Palette von Funktionen und Bereitstellungstypen.
Welche Modelle verwenden serverlose API-Bereitstellungen?
Alle Foundry Models, einschließlich der über Azure verkauften Foundry Models und ausgewählter Modelle von Partnern und der Community, verwenden serverlose API-Bereitstellungen. Von Azure angebotene Foundry-Modelle umfassen alle Azure OpenAI-Modelle sowie ausgewählte Modelle führender Anbieter, die über Ihr Azure-Abonnement abgerechnet werden, durch Azure-Service-Level-Agreements abgedeckt sind und von Microsoft unterstützt werden. Modelle von Partnern und Communitys, die serverlose API-Bereitstellungen verwenden, umfassen Anthropic Modelle und spezifische Modelle von Partnern wie Mistral, Cohere und Meta.
Serverlose API-Funktionen
Unterstützung serverloser API-Bereitstellungen:
- Mehrere Bereitstellungstypen (oder Bereitstellungs-SKUs) – Global Standard, Data Zone Standard, Standard (einzelne Region), bereitgestellt, Batch und mehr. Jeder Typ steuert, wo Daten verarbeitet werden und wie Sie bezahlen. Ausführliche Informationen finden Sie unter Bereitstellungstypen für Microsoft Foundry-Modelle.
- Flexibilität bei der Datenverarbeitung – Wählen Sie regionale, Datenzone (USA, EU oder APAC) oder globale Verarbeitung basierend auf Ihren Complianceanforderungen aus.
- Inhaltsfilter – Integrierte Azure KI Inhaltssicherheit-Filter mit anpassbaren Konfigurationen.
- Schlüssellose Authentifizierung – Microsoft Entra ID (empfohlen) und schlüsselbasierte Authentifizierung.
- Private Netzwerke – Virtuelle Netzwerkintegration für sicheren Zugriff.
- Bereitgestellter Durchsatz – Reservieren der Kapazität mit bereitgestellten Durchsatzeinheiten (PTUs) für eine vorhersagbare Leistung mit geringer Latenz. Ausführliche Informationen finden Sie unter "Bereitgestellter Durchsatz".
Ressourcenanforderungen
Serverlose API-Bereitstellungen sind verfügbar in:
- Foundry-Ressourcen – Der primäre Ressourcentyp für neue Foundry-Projekte. Kein KI-Hub erforderlich.
- Azure OpenAI-Ressourcen – Wenn Sie Azure OpenAI-Ressourcen verwenden, zeigt der Modellkatalog nur Azure OpenAI-Modelle für die Bereitstellung an. Upgrade auf eine Foundry-Ressource für den Zugriff auf den vollständigen Satz von Foundry Models.
Informationen zu den ersten Schritten mit der Bereitstellung serverloser API finden Sie unter Bereitstellen Microsoft Foundry Models im Foundry-Portal oder Bereitstellen von Modellen mithilfe von Azure CLI und Bicep.
Bereitstellung verwalteter Rechenkapazität (Vorschau)
Note
Verwaltete Rechenkapazität in Foundry ist derzeit als öffentliche Vorschau verfügbar. Diese Vorschauversion wird ohne Vereinbarung zum Servicelevel bereitgestellt und sollte nicht für Produktionsworkloads verwendet werden. Manche Features werden möglicherweise nicht unterstützt oder sind nur eingeschränkt verwendbar. Weitere Informationen finden Sie unter Supplementale Nutzungsbedingungen für Microsoft Azure Previews.
Verwaltete Rechenleistung in Foundry (Vorschau) ist eine verwaltete GPU-Plattform-as-a-Service (PaaS), die Open-Source-Modelle und Modelle mit benutzerdefinierten Gewichten auf dedizierten GPU-Kapazitäten hostet. Sie greifen auf verwaltete Compute-Bereitstellungen über denselben Foundry-Projektendpunkt wie auf andere Bereitstellungstypen zu, ohne virtuelle Maschinen, Cluster oder Serving-Laufzeiten selbst verwalten zu müssen. Foundry dimensioniert die Bereitstellung, stellt die Beschleuniger bereit und hält die Laufzeitumgebung mit Patches auf dem neuesten Stand.
Von Bedeutung
Verwaltete Rechenleistung unterstützt Open-Source-, Partner-, Branchen- und benutzerdefinierte Modelle. Verwaltete Computebereitstellungen werden auf dem einheitlichen Foundry-Projektendpunkt bereitgestellt, wobei die gleiche Authentifizierung, Netzwerk- und SDK-Oberfläche verwendet wird.
Welche Modelle verwenden verwaltete Rechenressourcen?
Sie können Modelle aus der Hugging Face-Sammlung mithilfe verwalteter Rechenressourcen bereitstellen. Dazu gehören:
- Qwen-Modelle
- NVIDIA Nemotron Modelle
- Ausgewählte Metamodelle
- Ausgewählte Mistralmodelle
Microsoft Foundrys Katalog umfasst eine große und wachsende Auswahl an Open Source- und Partnermodellen. Informationen zum aktuellen Katalog finden Sie im Modellkatalog.
Verwaltete Computefunktionen
Verwaltete Rechenleistung (Vorschau) unterstützt:
-
Einheitlicher Foundry-Endpunkt und Authentifizierung — Verwenden Sie denselben Projektendpunkt, dieselben API-Schlüssel, Microsoft Entra ID und dieselbe private Netzwerkkonfiguration wie bei Pay-per-Token- und Bereitstellungen mit bereitgestelltem Durchsatz. Inferenzrouten verwenden
<endpoint>/managed-deployments/<deployment-name>/. Mit Chatvervollständigungen kompatible Laufzeiten funktionieren auch auf der Standardroute/openai/v1/mit dem OpenAI-SDK. - Dimensionierung von Modellinstanzen — Bereitstellungen werden modellzentriert dimensioniert. Sie müssen keine SKUs für virtuelle Maschinen auswählen, da Foundry die GPUs pro Instanz anhand von Modellgröße, Architektur, Kontextlänge sowie danach auswählt, ob die Arbeitsauslastung auf geringe Latenz oder hohen Durchsatz optimiert ist.
- Optimierte Rückschlusslaufzeiten – Microsoft kuratierte vLLM-, SGLang- und NVIDIA NIM-Container mit fortlaufender Batchverarbeitung und Tensor-Parallelität.
- Acceleratorfamilien – A100 (80 GB), H100 (80 GB) und MI300X (192 GB).
- Automatische Skalierung und Herunterskalieren auf null — Automatisch basierend auf Live-Datenverkehr skalieren oder manuell skalieren. Konfigurieren Sie ein Leerlaufzeitlimit so, dass das Deployment auf null skaliert, wenn kein Datenverkehr mehr eingeht, sodass die Abrechnung sofort stoppt.
- Von Microsoft verwaltete Laufzeiten – Microsoft ist für die Bereitstellung der Laufzeiten, Basis-Containerimages und Sicherheitspatches verantwortlich. Updates werden automatisch auf aktive Bereitstellungen angewendet.
- Observability-Metriken – Jede Bereitstellung gibt die Anzahl der API-Aufrufe nach Statuscode und Perzentilen der Antwortzeit aus. Modelle zur Chatvervollständigung geben außerdem die Anzahl der Eingabe- und Ausgabetoken, TTFT-Perzentile (Time-to-First-Token) und Perzentile der gesamten Antwortzeit aus, und zwar nach der Zeit gruppiert.
Abrechnung und Kontingent
Die Abrechnung der verwalteten Rechenleistung erfolgt stündlich pro Beschleuniger-SKU, wobei der Durchsatz pro GPU die zugrunde liegende Abrechnungseinheit bildet. Automatische Skalierung und Skalierung auf null passen die Kosten dem tatsächlichen Datenverkehr an, sodass die Abrechnung sofort endet, wenn die Instanzen herunterskaliert werden.
Das Kontingent wird pro Beschleuniger-SKU und pro Region über den Foundry-Kontingentprozess gewährt und ist vom Azure-VM-Kontingent getrennt. Virtuelle Azure-Computer sind ein Infrastructure-as-a-Service-(IaaS-)Angebot mit regionalen SKUs; verwaltete Rechenleistung ist ein PaaS-Angebot, das auf globale Verarbeitung und Data-Zone-Verarbeitung ausgerichtet ist. Vorhandenes Azure VM-Kontingent kann nicht auf eine verwaltete Computebereitstellung angewendet werden.
Verwaltete Rechenkapazität ist derzeit für globale Bereitstellungen verfügbar. Preisschätzungen finden Sie im Azure Preisrechner.
Get started
Informationen zu den ersten Schritten mit der verwalteten Computebereitstellung finden Sie unter Bereitstellen von Open Source-Modellen mit verwaltetem Compute.
Vergleich der Bereitstellungsoptionen
Verwenden Sie serverlose API , wenn möglich. In der folgenden Tabelle werden die Funktionen in den beiden Bereitstellungsoptionen verglichen:
Note
Der Sofortige Zugriff (Vorschau) ist in diesem Vergleich keine Bereitstellungsoption. Es ruft unterstützte Modelle anhand ihres Namens auf, ohne eine Serverless-API oder eine verwaltete Compute-Bereitstellung zu erstellen.
| Fähigkeit | Serverlose API | Verwaltete Rechenleistung |
|---|---|---|
| Welche Modelle können bereitgestellt werden? | Alle Foundry Models, einschließlich der von Azure angebotenen Foundry Models und ausgewählter Modelle von Partnern und der Community | Open-Source- und Partnermodelle aus dem Modellkatalog, NVIDIA NIM und Industriemodellen |
| Bereitstellungsressource | Foundry-Ressource | Gießereiprojekt |
| Erfordert AI-Zentrum | No | No |
| Datenverarbeitungsoptionen | Regional, Datenzone, global | Global |
| Privates Netzwerk | Ja | Ja |
| Inhaltsfilterung | Integriert und anpassbar | In der öffentlichen Vorschau nicht verfügbar |
| Schlüssellose Authentifizierung | Ja (Microsoft Entra ID und schlüsselbasiert) | Ja (Microsoft Entra ID und schlüsselbasiert) |
| Abrechnung | Tokenverwendung oder bereitgestellte Durchsatzeinheiten | Pro Stunde pro Beschleuniger-SKU |
Tip
Ausführliche Preisinformationen finden Sie unter Planen und Verwalten von Kosten für Microsoft Foundry.
Verwandte Inhalte
- Deployment-Typen für Microsoft Foundry Models
- Bereitstellen von Microsoft Foundry Models im Foundry-Portal
- Modelle mit Azure CLI und Bicep bereitstellen
- Foundry Models von Azure vertrieben
- Foundry-Modelle von Partnern und aus der Community
- Übersicht über Microsoft Foundry Models
- Verwaltete Rechenleistung in Microsoft Foundry