Claude-Modelle in Microsoft Foundry

Anthropics Claude-Modelle bringen fortschrittliche Konversations-KI-Fähigkeiten in Microsoft Foundry und bieten Sprachverständnis und Sprachgenerierung auf dem neuesten Stand der Technik für intelligente Anwendungen. Claude-Modelle zeichnen sich durch komplexe Gründe, Codegenerierung und multimodale Aufgaben wie Bildanalyse aus. In diesem Artikel werden die verfügbaren Claude-Modelle beschrieben, wie sie gehostet und in Rechnung gestellt werden, unterstützte APIs, Funktionen, Kontingente und bewährte Methoden.

Informationen zum Bereitstellen und Aufrufen eines Claude-Modells finden Sie unter Bereitstellen und Verwenden von Claude-Modellen in Microsoft Foundry.

Wichtig

Die in diesem Artikel markierten Elemente (Vorschau) sind aktuell als öffentliche Vorschau verfügbar. Diese Vorschauversion wird ohne Vereinbarung zum Servicelevel bereitgestellt und sollte nicht für Produktionsworkloads verwendet werden. Manche Features werden möglicherweise nicht unterstützt oder sind nur eingeschränkt verwendbar. Weitere Informationen finden Sie unter Supplementale Nutzungsbedingungen für Microsoft Azure Previews.

Wie Claude Modelle gehostet und in Rechnung gestellt werden

Microsoft Foundry bietet Claude Modelle in zwei Versionen an:

  • Version 1: Gehostet auf Anthropic-Infrastruktur; diese Modelle werden auf der Infrastruktur Anthropic (außerhalb von Azure) ausgeführt.
  • Version 2: Gehostet auf Azure; diese Modelle werden auf Azure Infrastruktur end-to-End ausgeführt und sind alle allgemein verfügbar (GA).

Nicht alle Modelle sind in beiden Versionen verfügbar. Die Lebenszyklusstufe eines Modells, z. B. "Vorschau" oder "Allgemein verfügbar", kann sich zwischen den beiden Versionen unterscheiden. Informationen zum Verfügbarkeits- und Lebenszyklusstatus pro Modell finden Sie unter Verfügbare Claude-Modelle.

Einen Vergleich beider Hostingoptionen hinsichtlich Datenresidenz, SLAs, Supportoptionen, Compliance und Kaufprozess finden Sie unter Vergleich von in Azure gehosteten und von Anthropic gehosteten Claude-Modellen.

Hinweis

Sie greifen in Microsoft Foundry über Foundry-Modelle von Partnern und der Community auf Claude-Modelle zu. Modelle von Partnern und Communitys, die Anthropic verkaufen und betreiben, sind Nicht-Microsoft Produkte unter den Produktbedingungen.

Claude-Modelle in Foundry erfordern ein Azure-Marketplace-Abonnement und werden über Claude Consumption Units (CCU) abgerechnet. Stellen Sie sicher, dass Sie über die erforderlichen Berechtigungen zum Abonnieren von Modellangeboten verfügen, bevor Sie die Bereitstellung ausführen. Preisdetails finden Sie in der Abrechnung von Claude Consumption Units (CCU) in Microsoft Foundry.

Verfügbare Claude Modelle

In der folgenden Tabelle wird die Modellverfügbarkeit für beide Versionen von Claude-Modellen in Foundry verglichen. Ausführliche Informationen zu den Features, auf die in der Tabelle verwiesen wird, finden Sie im Abschnitt "Funktionen und erweiterte Features" .

Warning

1M Context Beta auf Claude Sonnet 4.5 wurde am 30. April 2026 eingestellt.

Ab dem 1. Mai 2026:

  • Anfragen mit mehr als 200K Token, die den context-1m-2025-08-07 Beta-Header auf Sonnet 4.5 enthalten, führen zu einem Fehler.
  • Anfragen mit 200K Token oder weniger bleiben unberührt, selbst wenn der Header vorhanden ist.

Entfernen Sie zum Migrieren den context-1m-2025-08-07 Beta-Header aus Ihren Anfragen. Für Workloads, die 1M-Kontext erfordern, migrieren Sie zu Claude Sonnet 4.6 (wobei 1M-Kontext allgemein verfügbar ist) oder zu Claude Opus 4.6 oder Claude Opus 4.7 für Workloads mit höherer Intelligenz.

Modell Availability Kontextfenster/ Max. Ausgabe Wichtige Funktionen Am besten geeignet für:
claude-mythos-5 1
  • Gehostet auf der Anthropic-Infrastruktur: Gated Research – Vorschau
1M / 128K
  • Biologie und Lebenswissenschaften
  • Cybersicherheit (defensive Anwendungsfälle priorisiert): Erkennung von Sicherheitsrisiken, Überwachung der Angriffsfläche, rotes Teaming, Bedrohungserkennung
  • Autonomes Codieren
  • Agenten mit langer Laufzeit
claude-fable-5
  • Gehostet auf der Anthropic-Infrastruktur: Vorschau
1M / 128K
  • Adaptives Denken
  • Schlussfolgern über gesamte Codebasen und mehrtägige Projektkontexte
  • Längere unabhängige Arbeit als jedes vorherige Claude-Modell
  • Selbstüberprüfung
  • Orchestrierung von Unteragenten
  • Ablehnung stop_reason der Schutzrichtlinien für duale Verwendung2
  • Siehe Siehe Einführung von Claude Fable 5 und Claude Mythos 5
  • Cybersecurity
  • Autonomes Codieren
  • Agenten mit langer Laufzeit
  • Codieren und Agents mit tieferer Begründung für Unternehmensworkflows
claude-mythos-preview 1
  • Gehostet auf der Anthropic-Infrastruktur: Gated Research – Vorschau
1M / 128K
  • Cybersicherheit (defensive Anwendungsfälle priorisiert)
  • Autonomes Codieren
  • Agenten mit langer Laufzeit
claude-opus-5
  • Gehostet auf Azure: GA
  • Gehostet auf der Anthropic-Infrastruktur: GA
1M / 128K
  • Adaptives Denken mit xhigh und max Leistungsstufen
  • Schlussfolgern über gesamte Codebasen und mehrtägige Projektkontexte
  • Steuerung des Aufwands pro Zug3
  • Mitten im Gespräch3role:"system"
  • Tokenbudgets 3 (task_budget)
  • Neuerungen in Claude Opus 5
  • Near-Fable-Intelligenz für Codierung mit langem Zeithorizont und komplexe Agent-basierte Orchestrierung
  • Agenten mit langer Laufzeit
  • Unternehmensworkflows
  • Finanzanalyse
  • Computerverwendung
claude-opus-4-8
  • Gehostet auf Azure: GA
  • Gehostet auf der Anthropic-Infrastruktur: GA
1M / 128K
  • Adaptives Denken mit Aufwandsebene xhigh
  • Schlussfolgern über gesamte Codebasen und mehrtägige Projektkontexte
  • Hochauflösende Bildeingabe (bis zu 2576px / 3,75MP)
  • Siehe Migration zu Claude Opus 5
  • Codierung
  • Agenten mit langer Laufzeit
  • Finanzanalyse
  • Cybersecurity
  • Computerverwendung
claude-opus-4-7
  • Gehostet auf der Anthropic-Infrastruktur: GA
1M / 128K
  • Codierung
  • Unternehmensworkflows
  • Agenten mit langer Laufzeit
  • Multimodale Begründung
  • Finanzanalyse
  • Cybersecurity
claude-opus-4-6
  • Gehostet auf der Anthropic-Infrastruktur: GA
1M / 128K
  • Adaptives Denken
  • Bild- und Texteingabe
  • Computerverwendung
  • Erweiterte Toolverwendung (Suche, programmgesteuertes Aufrufen, Beispiele)
  • Siehe Migration zu Claude Opus 5
  • Codierung
  • Unternehmens-Agenten
claude-opus-4-5
  • Gehostet auf der Anthropic-Infrastruktur: GA
200K / 64K
  • Erweitertes Denken
  • Bild- und Texteingabe
  • Computerverwendung
  • Erweiterte Toolverwendung (Suche, programmgesteuertes Aufrufen, Beispiele)
  • Siehe Migration zu Claude Opus 5
  • Codierung
  • Agenten
  • Computerverwendung
  • Unternehmensworkflows
claude-sonnet-5
  • Gehostet auf Azure: GA
  • Gehostet auf der Anthropic-Infrastruktur: GA
1M / 128K
  • Adaptives Denken
  • xhigh Leistungsstufe
  • Schlussfolgern über gesamte Codebasen und mehrtägige Projektkontexte
  • Hochauflösende Bildeingaben (bis zu 2576 px / 3,75 MP) sind standardmäßig aktiviert.
  • Mitten im Gespräch3role:"system"
  • Tokenbudgets 3 (task_budget)
  • Neuerungen in Claude Sonnet 5
  • Codierung
  • Agenten mit langer Laufzeit
  • Finanzanalyse
  • Cybersecurity
  • Computerverwendung
claude-sonnet-4-6
  • Gehostet auf der Anthropic-Infrastruktur: GA
1M / 128K
  • Codierung
  • Agenten
  • Unternehmensworkflows
claude-sonnet-4-5
  • Gehostet auf der Anthropic-Infrastruktur: GA
200K / 64K
  • Agenten und komplexe, langfristige Aufgaben
  • Workloads mit hohem Volumen
claude-haiku-4-5
  • Gehostet auf Azure: GA
  • Gehostet auf der Anthropic-Infrastruktur: GA
200K / 64K
  • Erweitertes Denken
  • Bild- und Texteingabe
  • Codierung
  • Agenten

1Claude Mythos 5 und Claude Mythos Preview sind nur als Gated Research Preview verfügbar. Der Zugang zu den Modellen wird ausschließlich nach alleinigem Ermessen von Anthropic gewährt und für Anwendungsfälle der defensiven Cybersicherheit priorisiert. Lesen Sie die Claude Mythos Preview-Systemkarte und die Claude Mythos 5-Systemkarte für Hinweise zum verantwortungsvollen Gebrauch.

2Claude Fable 5 wendet zusätzliche Eingabe-/Ausgabeklassifizierer an, die Anforderungen ablehnen können, deren Inhalt Richtlinien für die Dual-Use-Schutzrichtlinien auslöst. Wenn eine Ablehnung auftritt, gibt die Anforderung eine erfolgreiche Antwort (200) mit einem Weigerungsindikator stop_reason: "refusal" anstelle von modellgenerierten Inhalten zurück. Sie werden nicht für Eingabetoken in Rechnung gestellt, die abgelehnt werden.

3 Steuerungen für den Aufwand pro Wechsel, Mid-conversation und Token-Budgets sind derzeit im Beta-Stadium.

API-Übersicht

In der folgenden Tabelle sind die APIs aufgeführt, mit denen Sie sowohl mit den auf Azure gehosteten als auch mit den auf der Anthropic-Infrastruktur gehosteten Versionen der Claude-Modelle in Foundry interagieren können.

Verwenden Sie die Anthropic SDKs und die folgenden Claude-APIs:

Tipp

Die auf der Anthropic-Infrastruktur gehostete Version der Claude-Modelle in Foundry unterstützt mehr APIs als die in dieser Tabelle aufgeführten. Sie können sie auf der Seite "API-Übersicht" der Claude-API sehen.

API Description
Nachrichten1 (POST /v1/messages) Kernnachrichten-API: Senden Einer strukturierten Liste von Eingabenachrichten mit Text- oder Bildinhalten, einschließlich Streamingantworten. Das Modell generiert die nächste Nachricht in der Unterhaltung.
Tokenzählung (POST /v1/messages/count_tokens) Tokenanzahl-API: Zählen Sie die Anzahl der Token in einer Nachricht, bevor Sie sie an Claude senden.

1Sie können die Nachrichten-API aus dem anthropic Python-Paket, dem @anthropic-ai/foundry-sdk JavaScript-Paket oder direkt über REST aufrufen. Der Bereitstellungsendpunkt folgt dem Shape https://<resource-name>.services.ai.azure.com/anthropic/v1/messages, und REST- und JavaScript-Clients verwenden den anthropic-version: 2023-06-01 Header.

Funktionen und erweiterte Features

Claude-Modelle in Foundry stellen Kernfunktionen für die Verarbeitung, Analyse und Generierung von Inhalten sowie Werkzeuge bereit, mit denen Claude mit externen Systemen interagieren, Code ausführen und automatisierte Aufgaben erledigen kann. Claudes API-Oberfläche ist in fünf Bereiche unterteilt:

Die folgenden Abschnitte und Tabellen fassen die Funktionen zusammen, die in den Versionen der Claude-Modelle in Foundry verfügbar sind, die auf Azure gehostet bzw. auf der Anthropic-Infrastruktur gehostet werden. Sofern nicht angegeben, gilt eine Funktion für beide Versionen.

Tipp

Die auf der Anthropic-Infrastruktur gehostete Version der Claude-Modelle in Foundry unterstützt mehr Funktionen als in diesen Tabellen aufgeführt sind. Sie können die vollständige Liste der Funktionen auf Claude Platform Docs anzeigen: Übersicht über Features.

Weitere Informationen zu den verfügbaren Funktionen und erweiterten Features für Claude-Modelle in Foundry finden Sie im Microsoft Entwicklerblog.

Modellfunktionen

Möglichkeiten zur Steuerung von Claude und dessen direkten Ausgaben, einschließlich Antwortformat, Tiefe der Argumentation und Eingabemodalitäten.

Funktion Description
Streamen von Nachrichten Beim Erstellen einer Message legen Sie "stream": true fest, um die Antwort mithilfe von Server-Sent Events (SSE) inkrementell zu streamen.
Denken Erweiterte Denkfähigkeiten für komplexe Aufgaben, die Transparenz über Claudes schrittweisen Denkprozess bieten, bevor die endgültige Antwort ausgegeben wird. Siehe Denken und Aufwand für thinking Parameterwerte pro Modell.
Adaptives Denken Lassen Sie Claude dynamisch entscheiden, wann und wie viel zu denken ist. Diese Funktion ist der einzige Denkmodus in Claude 4.7 und späteren Modellen. Verwenden Sie den effort Parameter, um die Tiefe des Denkens zu steuern.
Aufwand Steuern Sie, wie viele Token Claude bei der Beantwortung verwendet, und gehen Sie dabei einen Kompromiss zwischen der Ausführlichkeit der Antworten und der Tokeneffizienz ein. Siehe Denken und Aufwand für effort Parameterwerte pro Modell.
Zitate Stütze die Antworten von Claude auf Quellen, einschließlich der Inhaltsblöcke für Suchergebnissesearch_result.
Bilder und Visionen Verarbeiten und Analysieren von Inhalten aus Bildern. Gehostet auf Azure Bereitstellungen akzeptieren nur base64-codierte oder URL-basierte Images.
PDF-Unterstützung Verarbeiten und Analysieren von Text und visuellen Inhalten aus PDF-Dokumenten. Stellen Sie PDF-Dateien als Base64 oder URL bereit.
1M-Kontextfenster Bis zu 1 Million Token für die Verarbeitung großer Dokumente, umfangreicher Codebasen und langer Unterhaltungen. Der Support unterliegt der Modellberechtigung.
Strukturierte Ausgaben Beschränken Sie claudes Antworten auf ein bestimmtes JSON-Schema, indem Sie zwei ergänzende Features verwenden: JSON-Ausgaben (den output_config.format Parameter) für strukturierte Antworten und strenge Toolverwendung (strict: true) für überprüfte Tooleingaben. Für Hosted on Azure-Bereitstellungen unterstützen strukturierte Ausgaben auch den Legacy-Parameter für JSON-Ausgaben (den output_format-Parameter).

Denken und Bemühen

Das Feature "Denken " ermöglicht bestimmte Werte für den thinking Parametertyp, je nach Modell, wie in der folgenden Tabelle beschrieben. Der Typ adaptive konfiguriert die Funktion für adaptives Denken, sodass das Modell anhand der Abfragekomplexität und der Aufwandsstufe entscheiden kann, ob es nachdenken soll. Beispiel: thinking={"type": "adaptive"}

Modell adaptive enabled disabled
claude-mythos-5 Yes No No
claude-fable-5 Yes No No
claude-mythos-preview Yes Yes No
claude-opus-5 Yes No Yes1
claude-opus-4-8 Yes No Yes
claude-opus-4-7 Yes No Yes
claude-opus-4-6 Yes Yes Yes
claude-sonnet-5 Yes No Yes
claude-sonnet-4-6 Yes Yes Yes

1 Denken kann nur disabled werden mit Aufwand high oder niedriger

Die Funktion „Effort“ ermöglicht bestimmte effort Stufen für jedes Modell, wie in der folgenden Tabelle beschrieben. Die xhigh Ebene erzeugt dasselbe Ergebnis wie max.

Modell low medium high xhigh max
claude-mythos-5 Yes Yes Yes Yes No
claude-fable-5 Yes Yes Yes Yes No
claude-opus-5 Yes Yes Yes Yes Yes
claude-opus-4-8 Yes Yes Yes Yes Yes
claude-opus-4-7 Yes Yes Yes Yes Yes
claude-opus-4-6 Yes Yes Yes No Yes
claude-sonnet-5 Yes Yes Yes Yes Yes
claude-sonnet-4-6 Yes Yes Yes No Yes

Werkzeuge

Lassen Sie Claude Aktionen im Web oder in Ihrer Umgebung ergreifen. Dieses Feature besteht aus integrierten Tools, die Claude durch tool_useaufruft. Die Plattform führt serverseitige Tools aus, und Sie implementieren und ausführen clientseitige Tools.

Funktion Description
Toolverwendung mit clientgesteuerten Tools Benutzerdefinierte Tools sowie Anthropic-definierte bash, text editor, computer use und memory. Weitere Informationen zu diesen Tools finden Sie unter Bash, Text-Editor, Computerverwendung und Arbeitsspeicher.
Websuche Entdecken Sie aktuelle reale Daten aus dem Web, um Claudes Wissen zu erweitern. Bei Azure Bereitstellungen wird nur die web_search_20250305 Toolversion unterstützt.
Abruf aus dem Web Abrufen und Durchführen einer eingehenden Analyse von vollständigen Inhalten aus angegebenen Webseiten und PDF-Dokumenten und Erweitern des Kontexts von Claude mit Live-Webinhalten. Auf Foundry erfordert der Web-Fetch eine gehostete Bereitstellung unter „Hosted on Anthropic infrastructure“. Bei Azure Bereitstellungen wird nur die web_fetch_20250910 Toolversion unterstützt.

Werkzeuginfrastruktur

Entdecken, koordinieren und skalieren Sie den Einsatz von Tools.

Funktion Description
Detailliertes Tool-Streaming Das Streamtool verwendet Parameter ohne Pufferung oder JSON-Überprüfung, wodurch die Latenz für große Parameter reduziert wird. Erfordert die anthropic-beta Kopfzeile fine-grained-tool-streaming-2025-05-14.
MCP-Connector Stellen Sie eine direkte Verbindung mit Remote-MCP-Servern über die Nachrichten-API ohne einen separaten MCP-Client her.
Toolsuche Skalieren Sie auf Tausende von Tools, indem Sie Tools bei Bedarf mithilfe der regex- und BM25-basierten Suche dynamisch ermitteln und laden, die Kontextnutzung optimieren und die Genauigkeit der Toolauswahl verbessern. Für auf Azure gehostete Bereitstellungen werden sowohl die tool_search_tool_regex_20251119- als auch die tool_search_tool_bm25_20251119-Toolversionen unterstützt. Die Legacyalias tool_search_tool_bm25 und tool_search_tool_regex werden ebenfalls akzeptiert.

Context-Management

Steuern und Optimieren des Kontextfensters von Claude für lange laufende Sitzungen.

Funktion Description
Automatisches Zwischenspeichern von Eingabeaufforderungen Vereinfachen Sie das Zwischenspeichern von Eingabeaufforderungen in einen einzelnen API-Parameter. Das System speichert automatisch den letzten cachefähigen Block Ihrer Anfrage im Cache und verschiebt den Cache-Punkt nach vorn, wenn Unterhaltungen länger werden.
Prompt-Zwischenspeicherung (5 Min.) Geben Sie Claude mehr Hintergrundwissen und Beispielausgaben, um Kosten und Latenz zu reduzieren.
Prompt-Caching (1 Stunde) Erweiterte 1-Stunden-Cachedauer für weniger häufig zugegriffene, aber wichtige Kontexte, ergänzt den standardmäßigen 5-Minuten-Cache.
Kontextbearbeitung Verwalten Sie den Unterhaltungskontext automatisch mit konfigurierbaren Strategien, einschließlich Löschen von Toolergebnissen und Verwalten von Denkensblöcken. Erfordert den Anthropic-Beta-Header context-management-2025-06-27.
Tokenzählung Mithilfe der Tokenzählung können Sie die Anzahl der Token in einer Nachricht ermitteln, bevor Sie sie an Claude senden, wodurch Sie fundierte Entscheidungen zu Ihren Eingabeaufforderungen und ihrer Nutzung treffen können.

Dateien und Objekte

Verwalten Sie die Dokumente und Daten, die Sie Claude zur Verfügung stellen.

Funktion Description
Datei-API Derzeit nur bei „Gehosteten“ Bereitstellungen auf Anthropic-Infrastruktur verfügbar. Laden Sie Dateien hoch und verwalten Sie sie, um sie mit Claude zu verwenden, ohne Inhalte mit jeder Anforderung erneut hochzuladen. Unterstützt PDFs, Bilder und Textdateien.

Agentensupport

Bereitstellungstypen und Regionen

Claude-Modelle in Foundry sind für die folgenden Bereitstellungstypen in bestimmten Azure Regionen verfügbar:

  • Globaler Standard: Alle Claude-Modelle (gehostet auf Azure und gehostet auf Anthropic Infrastruktur).
  • Data Zone Standard (US):Gehostet auf Azure Versionen von claude-opus-5, claude-opus-4-8und claude-sonnet-5.

Die genauen Azure Regionen, in denen Claude-Modelle für die Bereitstellung verfügbar sind, finden Sie unter Region verfügbarkeit nach Bereitstellungstyp.

Kontingente und Zinslimits

In diesem Abschnitt wird erläutert, wie Bereitstellungen das Kontingent teilen und welche Ratenbeschränkungen für sie gelten. Die Verwaltung auf Abonnementebene verwaltet das Bereitstellungskontingent. Ressourcen und Regionen teilen das Kontingent, anstatt es für jede Ressource oder Region separat zuzuweisen.

  • Alle Global-Standard-Bereitstellungen desselben Modells und derselben Version in einem Abonnement greifen in allen Regionen auf einen gemeinsamen Kontingentpool zu.
  • Alle Data Zone Standard-Bereitstellungen desselben Modells und derselben Version in einem Abonnement greifen innerhalb derselben Datenzone (z. B. US) auf einen gemeinsamen Kontingentpool zu.

Weitere Informationen zur Kontingentverwaltung für Gießereimodelle finden Sie unter Microsoft Kontingente und Grenzwerte für Gießereimodelle.

cachebewusstes ITPM

Claude-Modelle in Foundry messen Geschwindigkeitslimits in Anforderungen pro Minute (RPM), nicht zwischengespeicherte Eingabetoken pro Minute (ITPM) und Ausgabetoken pro Minute (OTPM) für jedes Modell.

Bei den meisten Claude-Modellen zählen nur nicht zwischengespeicherte Eingabetoken zu Ihren ITPM-Ratengrenzwerten. Diese Token umfassen:

  • Eingabetoken – Token in der Anforderung nach dem letzten Cache-Haltepunkt (nicht zwischengespeicherte Eingaben).

  • Cacheerstellungseingabetoken – Token, die in den Cache geschrieben werden, umfasst:

    • Cache write 5m TPM – Token, die in den 5‑Minuten-Prompt-Cache geschrieben werden.
    • Cache write 1h TPM – Token, die in den 1‑Stunden-Prompt-Cache geschrieben werden.

Tipp

Die Gesamtzahl der Eingabetoken ist die Summe von Eingabetoken, Cacheerstellungseingabetoken und Cache-Lesetoken (die Token, die aus dem Cache gelesen werden). Die Cache-Leseeingabetoken zählen jedoch nicht zu ITPM. OTPM zählt auch nicht in Richtung ITPM.

Weitere Informationen zu Ratelimits und Cache finden Sie unter Claude API Docs: Rate limits.

Preisbeschränkungen nach Abonnementtyp

Ihr Azure Abonnementtyp bestimmt Ihre Tariflimits. Die Spalten Version 2: Gehostet auf Azure und Version 1: Gehostet auf der Anthropic-Infrastruktur geben an, ob für diese Kombination aus Modell und Bereitstellungstyp ein Kontingent verfügbar ist. Ja bedeutet, dass Kontingent verfügbar ist. N/A bedeutet, dass die Modell- und Versionskombination kein Kontingent für diesen Bereitstellungstyp aufweist.

In der folgenden Tabelle sind Die Ratenbeschränkungen aufgeführt. Um Ihr Kontingent über die Standardgrenzwerte hinaus zu erhöhen, senden Sie eine Anforderung über das Anforderungsformular zur Erhöhung des Kontingents.

Nutzungsbasierte Abrechnung

Modell Bereitstellungstyp Version 2: Gehostet auf Azure Version 1: Gehostet auf Anthropic-Infrastruktur RPM ITPM OTPM
claude-fable-5 Globaler Standard N/A Yes 0 0 0
claude-opus-5 Globaler Standard Yes Yes 40 40,000 8.000
claude-opus-5 Data Zone Standard (US) Yes N/A 40 40,000 8.000
claude-opus-4-8 Globaler Standard Yes Yes 40 40,000 8.000
claude-opus-4-8 Data Zone Standard (US) Yes N/A 40 40,000 8.000
claude-opus-4-7 Globaler Standard N/A Yes 40 40,000 8.000
claude-opus-4-6 Globaler Standard N/A Yes 40 40,000 8.000
claude-opus-4-5 Globaler Standard N/A Yes 40 40,000 8.000
claude-sonnet-5 Globaler Standard Yes Yes 40 40,000 8.000
claude-sonnet-5 Data Zone Standard (US) Yes N/A 40 40,000 8.000
claude-sonnet-4-6 Globaler Standard N/A Yes 80 80.000 16.000
claude-sonnet-4-5 Globaler Standard N/A Yes 80 80.000 16.000
claude-haiku-4-5 Globaler Standard Yes Yes 80 80.000 16.000

Verantwortungsvolle KI-Überlegungen

Berücksichtigen Sie bei der Verwendung von Claude-Modellen in Gießerei die folgenden verantwortungsvollen KI-Praktiken:

Bewährte Methoden

Befolgen Sie die folgenden bewährten Methoden beim Arbeiten mit Claude-Modellen in Foundry:

Prompt Engineering

  • Klare Anweisungen: Geben Sie bestimmte und detaillierte Eingabeaufforderungen an.
  • Kontextverwaltung: Verwenden Sie das verfügbare Kontextfenster effektiv.
  • Rollendefinitionen: Verwenden Sie Systemmeldungen, um die Rolle und das Verhalten des Assistenten zu definieren.
  • Strukturierte Eingabeaufforderungen: Verwenden Sie eine konsistente Formatierung, um bessere Ergebnisse zu erzielen.

Kostenoptimierung

So optimieren Sie Ihre Nutzung und vermeiden Sie eine Begrenzung der Rate:

  • Implementieren der Wiederholungslogik: Umgang mit 429-Antworten mit exponentiellem Backoff.
  • Batch-Anfragen: Kombinieren Sie nach Möglichkeit mehrere Anweisungen.
  • Tokennutzung überwachen: Verfolgen Sie Ihren Tokenverbrauch und Anforderungsmuster.
  • Verwenden Sie geeignete Modelle: Verwenden Sie das kostengünstigste Modell für Ihren Anwendungsfall. Siehe Verfügbare Claude Modelle.