Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
GÄLLER FÖR: AI Gateway-tier (förhandsvisning)
Important
AI Gateway-nivån är för närvarande i offentlig förhandsversion. Under offentlig förhandsvisning finns AI Gateway-nivån tillgänglig i följande regioner:
- United States - East US 2
- Europa - Sverige Centrala
I denna quickstart skapar du en AI Gateway-tier (förhandsvisning) instans, lägger till en chattmodell, anropar gatewayen, skapar en runtime-åtkomstnyckel och visar telemetri.
AI Gateway-nivån från Azure API Management är en dedikerad nivå för AI-arbetsbelastningar. Den stödjer hantering av trafik till modeller – från Microsoft Foundry, Azure OpenAI, AWS Bedrock, Google Vertex, OpenAI, Anthropic eller andra leverantörer – samt verktyg skapade från befintliga MCP-servrar, OpenAPI-definitioner eller kopplingar. AI Gateway-nivån etableras snabbt, vanligtvis inom en minut.
Tid att slutföra det: cirka 20–30 minuter. Du skapar: en gateway, en chattmodell, en runtime-åtkomstnyckel och en lyckad begäran om chattslutförande.
Anmärkning
AI Gateway-nivån finns i offentlig förhandsversion. Förhandsgranskningsfunktioner tillhandahålls utan serviceavtal och bör inte användas för produktionsarbetsbelastningar om inte din organisation accepterar förhandsvisningsvillkoren.
Förutsättningar
- Ett Azure-konto med Microsoft Entra ID. Tillgången till AI Gateway-förhandsvisningen är för närvarande begränsad till Azure-användare som loggar in med Microsoft Entra ID.
- En Azure-prenumeration och behörighet att skapa resurser i en resursgrupp (till exempel rollen Bidragsgivare).
- Tillgång till minst en stödd modellleverantör, såsom en distribuerad modell i Microsoft Foundry eller Azure OpenAI.
- Om din leverantör kräver en API-nyckel, ha nyckeln tillgänglig.
- För att anropa gatewayen, använd curl (ingen installation) eller ett OpenAI SDK – Python 3.9 eller senare, eller Node.js 18 eller senare, med paketet
openai.
1. Logga in på AI Gateway-tierportalen
AI Gateway-tierportalen är en fristående webbupplevelse – du använder inte Azure-portalen.
- Gå till AI Gateway-tierportalen på
ai.gateway.azure.com. - Välj Logga in och autentisera med Microsoft Entra ID.
Använd portalen för att hantera modeller, MCP-servrar, runtime-åtkomstnycklar, policyer och övervakning, baserat på dina Entra ID-behörigheter. Runtime-anropare loggar inte in på portalen – de ringer gatewayen med runtime-åtkomstnycklar som du skapar senare.
2. Skapa en gateway
I portalen, välj Create gateway. För att använda en befintlig gateway istället, välj den och hoppa till nästa steg.
Ange ett namn. Namnet blir en del av körtidsslutpunkten:
https://<gateway>.azure-api.netVälj din prenumeration och en stödd förhandsgranskningsregion (East US 2 eller Sweden Central).
Ange eventuellt resursgrupp under Avancerat. Som standard skapar portalen en åt dig.
Välj Skapa. Aktiveringen tar vanligtvis under en minut.
Gatewayen är en dedikerad resurs i din Azure-prenumeration. Du väljer inte kapacitet eller lägger till skalenheter innan du lägger till modeller. För automatisering är API-versionen för förhandsgranskningshantering 2026-05-01-preview; körningsbegäranden använder värdnamnet för gatewayen, inte Azure Resource Manager.
3. Lägg till en modell
Det snabbaste sättet att skapa en modell är att importera den från Microsoft Foundry-konton.
Under Home>Konfigurera din gateway, välj Get Started-alternativet eller öppna installationssidan direkt vid rutten
/settings/start.
Välj en eller flera prenumerationer för att skanna. Eventuellt, använd ett resursgruppfilter för att begränsa resultaten.
Gå igenom de upptäckta kontona. Distributioner grupperas efter deras moderkonto i Foundry (Azure-resursen). Urvalet sker per konto: när du väljer ett konto importerar guiden alla dess modelldistributioner.
Välj en backend-autentiseringsmetod för denna import:
-
Nyckelbaserad (standard). Gatewayen lagrar kontots API-nyckel och skickar den i
api-keyheadern. Trollkarlen hämtar nyckeln vid importtillfället. - Hanterad identitet (Microsoft Entra ID). Gatewayen autentiseras med sin hanterade identitet. Om gatewayen inte har någon hanterad identitet aktiverar guiden en systemtilldelad identitet. Om en redan finns väljer du vilken identitet du vill använda. Guiden tilldelar identiteten rollen Foundry User på varje markerat konto.
-
Nyckelbaserad (standard). Gatewayen lagrar kontots API-nyckel och skickar den i
Välj Importera.
När du väljer Importera kör guiden en verifieringskontroll för varje valt konto innan den skapar något. Denna kontroll bekräftar att autentiseringen är korrekt konfigurerad och att modellnamn inte krockar med modeller som redan finns på gatewayen. Konton som klarar kontrollen importeras; konton som misslyckas hoppas över med en varning direkt i gränssnittet, och resten av körningen fortsätter.
För att ansluta en icke-Foundry-leverantör (AWS Bedrock, Google Vertex, OpenAI eller Anthropic), välj istället Lägg till en anpassad modell. Se Hantera modeller och verktyg.
Anropare skickar modellnamnet inom model fältet för OpenAI-kompatibla förfrågningar. Denna snabbstart använder gpt-5.6-sol; ersätt den med den modell du registrerade.
Tip
För att prova modellen direkt, öppna Upptäck-sidan och välj modellen för att anropa den i den inbyggda lekplatsen. Lekplatsen använder gatewayens inbyggda nyckel, så du kan utforska och testa tillagda modeller eller verktyg innan du skapar en runtime-åtkomstnyckel.
4. Kalla på portalen
Gatewayen exponerar API:et som backendmodellen stödjer. Modeller från OpenAI-kompatibla leverantörer — såsom Microsoft Foundry, Azure OpenAI, AWS Bedrock, Google Vertex och OpenAI — levereras på en OpenAI-kompatibel endpoint. Peka valfri OpenAI-klient mot gatewayens bas-URL, skicka en api-key-rubrik och ange modellnamnet i fältet model. Anthropic-modeller använder istället Anthropic Messages API; se Hantera modeller och verktyg.
För ett snabbt test, använd gatewayens inbyggda nyckel – samma nyckel som Discover-lekplatsen använder. Kopiera den från sidan Nycklar , som listar den inbyggda nyckeln tillsammans med API-nycklar som ger runtime-åtkomst till varje tillgång i gatewayen. För dina egna applikationer, skapa istället en runtime-åtkomstnyckel (se nästa avsnitt).
Sätt dessa värden en gång:
export AI_GATEWAY_BASE_URL="https://<gateway>.azure-api.net/default/models/openai/v1"
export AI_GATEWAY_API_KEY="<gateway-key>"
Tip
Kopiera den exakta bas-URL:en från din gateways översiktssida istället för att bygga den för hand.
Ring första samtalet med den klient du väljer:
curl "$AI_GATEWAY_BASE_URL/chat/completions" \
-H "Content-Type: application/json" \
-H "api-key: $AI_GATEWAY_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"messages": [
{ "role": "system", "content": "You are a helpful assistant." },
{ "role": "user", "content": "Give me three benefits of using an AI gateway." }
]
}'
För att strömma tokens som serverskickade händelser, lägg till "stream": true i förfrågan.
Varje svar från slutpunkten /chat/completions använder OpenAI Chat Completions-formatet, beroende på vilken OpenAI-kompatibel leverantör som stöder modellen.
Ett icke-strömmande samtal ger en chattavslutning:
{
"id": "chatcmpl-...",
"object": "chat.completion",
"model": "gpt-5.6-sol",
"choices": [
{
"index": 0,
"message": { "role": "assistant", "content": "1. Centralized governance ...\n2. ...\n3. ..." },
"finish_reason": "stop"
}
],
"usage": { "prompt_tokens": 24, "completion_tokens": 61, "total_tokens": 85 }
}
Med streaming aktiverat returnerar chat.completion.chunk gatewayen händelser:
{
"id": "chatcmpl-...",
"object": "chat.completion.chunk",
"model": "gpt-5.6-sol",
"choices": [
{ "index": 0, "delta": { "content": "Hello" }, "finish_reason": null }
]
}
Samma grund-URL används också för OpenAI Responses API:t på /responses.
Om en förfrågan misslyckas returnerar gatewayen en standard HTTP-statuskod:
| Status | Meaning | Vad du bör kontrollera |
|---|---|---|
| 400 | Ogiltig begäran | Kolla i önsketexten. |
| 400 | Blockeras av innehållssäkerhet eller ett IP-filter, eller nekas av backend | En innehållssäkerhetspolicy kan blockera en prompt eller ett svar; Kontrollera också eventuella IP-filterpolicys. För hanterad identitet tilldelar du rollen Foundry User till gateway-identiteten på serverdelsresursen. Se Använd hanterad identitet för backend-autentisering. |
| 401 | Saknad eller ogiltig runtime-åtkomstnyckel | Skicka nyckeln i api-key headern och bekräfta att nyckeln är aktiv. |
| 404 | Okänd modell | Bekräfta model att värdet matchar ett modellnamn på sidan Modeller . |
| 429 | Strypt av en prisbegränsningspolicy eller backend | Granska principer för begränsning av token- och begärandefrekvens, och respektera svarshuvudet Retry-After. |
| 5xx | Backend-fel | Bekräfta att backend-leverantören är frisk och att leverantörslegitimationen är giltig. |
OpenAI-SDK:erna skapar typade undantag för dessa statuskoder, så din befintliga felhantering fungerar:
from openai import AuthenticationError, RateLimitError, APIStatusError
try:
response = client.chat.completions.create(
model="gpt-5.6-sol",
messages=[{"role": "user", "content": "Hello"}],
)
except AuthenticationError:
... # 401 — check the api-key header and that the key is active
except RateLimitError:
... # 429 — back off and honor the Retry-After header
except APIStatusError as e:
... # inspect e.status_code for 400, 403, 404, or 5xx
5. Skapa en runtime-åtkomstnyckel
Applikationer autentiserar sig mot gatewayen med en runtime-åtkomstnyckel istället för den inbyggda nyckeln. Skapa en separat nyckel för varje applikation och miljö.
- Välj Nycklar.
- Välj Skapa API-nyckel.
- Ange ett namn, till exempel
quickstart-client. - Välj Skapa.
- Kopiera nyckelvärdet och förvara det säkert. Du kan också se den igen senare på sidan Nyckelr .
Skapa runtime-åtkomstnycklar på gateway-nivå. Dessa nycklar ger tillgång till varje modell och verktyg i gatewayen. Behandla dem som hemligheter. Lagra nycklar i en hemlig butik för ansökningar, rotera dem regelbundet och återkalla nycklar som inte längre behövs. För att anropa gatewayen med en runtime-åtkomstnyckel, sätt AI_GATEWAY_API_KEY till nyckelns värde i anropen som visades tidigare.
6. Se telemetri
Nivån för AI Gateway genererar OpenTelemetry-mått för tokenanvändning. För att se dem, konfigurera först en telemetridestination och skicka sedan förfrågningar:
- Konfigurera en telemetridestination för gatewayen, såsom Application Insights. Se Styra, säkra och verka.
- Skicka en eller flera förfrågningar via gatewayen, så som tidigare visats i Call the gateway.
- Öppna din telemetridestination för att granska tokenanvändning. Om du använder Application Insights erbjuder portalen en inbyggd instrumentpanel för tokenförbrukning.
Eftersom telemetri bara skickas ut efter att du anslutit en destination, konfigurera övervakning innan du förlitar dig på den. Tokenanvändning är för närvarande den enda emitterade metriken; Loggar, spår och andra mätvärden för modeller och verktyg kommer snart. Anropare använder åtkomstnycklar för körning på gatewaynivå, så att du kan övervaka trafiken utan att exponera autentiseringsuppgifter för leverantören för klientapplikationer. För att konfigurera en telemetridestination, läs Styr, säkra och driva.
Rensa resurser
När du är klar, radera alla resurser du inte längre behöver. Ta bort AI Gateway-tier-instansen, leverantörstestdistributioner och runtime-åtkomstnycklar som du skapade endast för utvärdering.