Bereitstellen eines fein abgestimmten Modells für das Schlussfolgern

Nachdem Ihr Modell optimiert wurde, können Sie das Modell bereitstellen und in Ihrer eigenen Anwendung verwenden.

Wenn Sie das Modell bereitstellen, stellen Sie das Modell für die Ableitung zur Verfügung, und dies verursacht eine stündliche Hostinggebühr. Fein abgestimmte Modelle können jedoch ohne Kosten in Microsoft Foundry gespeichert werden, bis Sie bereit sind, sie zu verwenden.

Azure OpenAI bietet Auswahlmöglichkeiten von Bereitstellungstypen für fein abgestimmte Modelle in der Hostingstruktur, die unterschiedlichen Geschäfts- und Nutzungsmustern entspricht: Standard, Global Standard (Vorschau) und Provisioned Throughput (Vorschau). Erfahren Sie mehr über Bereitstellungstypen für fein abgestimmte Modelle und die Konzepte aller Bereitstellungstypen.

Bereitstellen Ihres optimierten Modells

Wichtig

Um Modelle bereitzustellen, müssen Sie der Rolle Foundry Owner oder einer beliebigen Rolle mit der Aktion Microsoft.CognitiveServices/accounts/deployments/write zugewiesen werden.

Wichtig

Die Foundry-RBAC-Rollen wurden kürzlich umbenannt. Foundry User, Foundry Owner, Foundry Account Owner und Foundry Project Manager wurden zuvor Azure KI-Benutzer, Azure KI-Besitzer, Azure KI-Kontobesitzer und Azure AI Project Manager benannt. Möglicherweise werden die vorherigen Namen an einigen Stellen weiterhin angezeigt, während der Umbenennungsrollout ausgeführt wird. Die Rollen-IDs und Kernberechtigungen bleiben durch die Umbenennung unverändert.

Um Ihr benutzerdefiniertes Modell bereitzustellen, wählen Sie das bereitzustellende benutzerdefinierte Modell aus, und wählen Sie dann "Bereitstellen" aus.

Das Dialogfeld " Modell bereitstellen " wird geöffnet. Geben Sie im Dialogfeld Ihren Bereitstellungsnamen ein, und wählen Sie dann "Erstellen" aus, um die Bereitstellung Ihres benutzerdefinierten Modells zu starten.

Screenshot, der zeigt, wie Sie ein benutzerdefiniertes Modell im Foundry-Portal bereitstellen.

Sie können den Fortschritt Ihrer Bereitstellung im Bereich "Bereitstellungen " im Gießereiportal überwachen.

Das Portal unterstützt keine regionsübergreifende Bereitstellung. Verwenden Sie stattdessen das Python SDK oder die REST-API.

Wichtig

Nach der Bereitstellung eines angepassten Modells wird die Bereitstellung gelöscht, wenn sie zu irgendeinem Zeitpunkt länger als 15 Tage inaktiv bleibt. Die Bereitstellung eines angepassten Modells ist inaktiv , wenn das Modell vor mehr als 15 Tagen bereitgestellt wurde und während eines kontinuierlichen Zeitraums von 15 Tagen keine Chat-Fertigstellungen oder Antwort-API-Aufrufe an das Modell vorgenommen wurden.

Das Löschen einer inaktiven Bereitstellung löscht das zugrunde liegende angepasste Modell nicht und wirkt sich auch nicht darauf aus. Das angepasste Modell kann jederzeit erneut bereitgestellt werden.

Wie in Azure OpenAI in Microsoft Foundry Models pricing beschrieben, entstehen jedem angepassten (fein abgestimmten) Modell, das bereitgestellt wird, stündliche Hostingkosten, unabhängig davon, ob Chatabschlusse oder Antwort-API-Aufrufe an das Modell getätigt werden. Weitere Informationen zum Planen und Verwalten von Kosten mit Azure OpenAI finden Sie unter Plan und Verwalten von Kosten für Azure OpenAI.

Verwenden Sie Ihr bereitgestelltes, fein abgestimmtes Modell

Nachdem Ihr benutzerdefiniertes Modell bereitgestellt wurde, können Sie es wie jedes andere bereitgestellte Modell verwenden. Sie können die Playgrounds im Foundry-Portal verwenden, um mit Ihrer neuen Bereitstellung zu experimentieren. Sie können weiterhin dieselben Parameter mit Ihrem benutzerdefinierten Modell verwenden, wie temperature und max_tokens, genau wie bei anderen bereitgestellten Modellen.

Screenshot des Bereichs

Promptzwischenspeicherung

Die Azure OpenAI-Optimierung unterstützt Prompt-Caching bei ausgewählten Modellen. Mit der Eingabeaufforderungszwischenspeicherung können Sie die gesamte Anforderungslatenz und die Kosten für längere Eingabeaufforderungen reduzieren, die identischen Inhalt am Anfang der Eingabeaufforderung aufweisen. Weitere Informationen zum Eingabeaufforderungszwischenspeichern finden Sie in den ersten Schritten mit der Eingabeaufforderungszwischenspeicherung.

Bereitstellungstypen

Azure OpenAI-Feintuning unterstützt die folgenden Bereitstellungsarten.

Standard

Standardbereitstellungen bieten ein Pay-per-Token-Abrechnungsmodell, bei dem die Datenresidenz auf die bereitgestellte Region beschränkt ist.

Modelle Ost-US2 Nord-Mittel-USA Schweden Zentral
o4-mini
GPT-4.1
GPT-4.1-mini
GPT-4.1-nano
GPT-4o
GPT-4o-mini

Globaler Standard

Optimierte Global Standard-Bereitstellungen bieten Kosteneinsparungen. Benutzerdefinierte Modellgewichtungen werden jedoch möglicherweise vorübergehend außerhalb der Region Ihrer Azure OpenAI-Ressource gespeichert.

Globale Standardbereitstellungen stehen in allen Azure OpenAI-Regionen für die folgenden Modelle zur Verfügung:

  • o4-mini
  • GPT-4.1
  • GPT-4.1-mini
  • GPT-4.1-nano
  • GPT-4o
  • GPT-4o-mini

Screenshot der Benutzererfahrung der globalen Standardbereitstellung mit einem optimierten Modell

Entwicklerebene

Für Entwickler feinabgestimmte Bereitstellungen bieten eine ähnliche Umgebung wie Global Standard ohne stündliche Hostinggebühr, bieten jedoch keine SLA zur Verfügbarkeit an. Entwicklerbereitstellungen sind für die Modellkandidatenbewertung und nicht für die Produktionsverwendung konzipiert.

Entwicklerbereitstellungen stehen in allen Azure OpenAI-Regionen für die folgenden Modelle zur Verfügung:

Modelle Verfügbarkeit
o4-mini Alle Regionen
GPT-4.1 Alle Regionen
GPT-4.1-mini Alle Regionen
GPT-4.1-nano Alle Regionen

Bereitgestellter Durchsatz

Modelle Nord-Mittel-USA Schweden Zentral
GPT-4.1
GPT-4o
GPT-4o-mini

Für Bereitgestellten Durchsatz optimierte Bereitstellungen bieten vorhersagbare Leistung für latenzsensitive Agents und Anwendungen. Sie verwenden dieselbe regionale bereitgestellte Durchsatzkapazität (PTU) wie Basismodelle. Wenn Sie also bereits über ein regionales PTU-Kontingent verfügen, können Sie Ihr abgestimmtes Modell in Supportregionen bereitstellen.

Bereinigen Sie Ihre Bereitstellung

Um eine Bereitstellung zu löschen, verwenden Sie die Bereitstellungen – REST-API löschen und eine HTTP DELETE an die Bereitstellungsressource senden. Wie beim Erstellen von Bereitstellungen müssen Sie die folgenden Parameter einschließen:

  • Azure Abonnement-ID
  • Azure Ressourcengruppenname
  • Azure OpenAI-Ressourcenname
  • Name der zu löschenden Bereitstellung

Nachfolgend sehen Sie das REST-API-Beispiel zum Löschen einer Bereitstellung:

curl -X DELETE "https://management.azure.com/subscriptions/<SUBSCRIPTION>/resourceGroups/<RESOURCE_GROUP>/providers/Microsoft.CognitiveServices/accounts/<RESOURCE_NAME>/deployments/<MODEL_DEPLOYMENT_NAME>?api-version=2024-10-21" \
  -H "Authorization: Bearer <TOKEN>"

Sie können eine Bereitstellung auch im Foundry-Portal löschen oder Azure CLI verwenden.

Nächste Schritte