Visão geral dos níveis do AI Gateway (prévia)

APLICA-SE A: camada do gateway de IA (versão preliminar)

Importante

A camada AI Gateway está atualmente em versão prévia pública. Durante a prévia pública, o nível AI Gateway está disponível nas seguintes regiões:

  • Estados Unidos - Leste dos EUA 2
  • Europa - Suécia Central

O AI Gateway tier (prévia) do Gerenciamento de API do Azure é um gateway totalmente gerenciado para cargas de trabalho de IA. Ele oferece às equipes um único lugar para publicar, proteger, governar e observar o acesso a modelos de IA e ferramentas do Protocolo de Contexto de Modelo (MCP).

A camada do AI Gateway está em versão prévia pública. Recursos de pré-visualização, regiões, limites de serviço e APIs podem mudar antes da disponibilidade geral. Preços e modelo de negócios serão anunciados mais adiante na prévia.

O que é o nível do AI Gateway?

A camada AI Gateway é um gateway gerenciado para aplicações que fazem chamadas a modelos e ferramentas. As aplicações chamam um endpoint do gateway em vez de acessar diretamente o backend de cada provedor ou ferramenta. Para cada requisição, o gateway:

  1. Autentica a chave de acesso de runtime no cabeçalho api-key.
  2. Avalia as políticas que se aplicam ao modelo ou ferramenta alvo.
  3. Encaminha a requisição para o backend selecionado — com base no campo model para modelos, ou no nome da ferramenta no caso de ferramentas — usando as credenciais do backend que você configurou.
  4. Retorna a resposta e emite telemetria — registros e métricas do OpenTelemetry, como contagem de tokens e latência.

Por que usá-la

O nível AI Gateway oferece às equipes da plataforma um limite de runtime governado para aplicativos, modelos e ferramentas. Use-o para:

  • Coloque um ponto de extremidade de gateway na frente dos provedores de IA suportados.
  • Mantenha as credenciais dos provedores ocultas das aplicações.
  • Gerencie modelos, servidores MCP, chaves de acesso em tempo de execução, políticas e monitoramento.
  • Aplique controles de governança, como limites de taxa de token, limites de taxa de solicitação, segurança de conteúdo e filtros de IP.
  • Publique ferramentas MCP aprovadas para agentes de IA.
  • Descubra e utilize modelos e ferramentas disponíveis por meio de um catálogo de autoatendimento.
  • Faça login para gerenciar o gateway com o Microsoft Entra ID.

Escolha seu caminho

Início rápido

Novo no nível do Gateway de IA? Crie um gateway, adicione um modelo e faça sua primeira ligação em cerca de 20–30 minutos.

Gerenciar modelos e ferramentas

Adicione Foundry e modelos personalizados e publique servidores de ferramentas MCP por trás de um único endpoint gerenciado.

Governar, proteger e operar

Aplique políticas, identidade, rede e monitoramento para executar em produção.

Conceitos principais

Gateway

Um gateway é a fronteira de tempo de execução e gerenciamento do tráfego de IA. É um recurso dedicado ao Azure que você pode provisionar em cerca de um minuto, sem unidades de escala para planejar. Os aplicativos chamam um único ponto de extremidade de gateway com uma chave de acesso em tempo de execução, em vez de chamar diretamente cada provedor ou back-end de ferramenta. Você gerencia os modelos, ferramentas, políticas, chaves e identidade em um só lugar.

Diagrama de aplicações, agentes e agentes de programação fazendo chamadas à camada do AI Gateway, que autentica a chave de execução, aplica políticas e emite telemetria antes de encaminhar solicitações para provedores de modelos e backends de ferramentas MCP.

Models

Um modelo é o modelo de um provedor que você publica pelo gateway. As aplicações o selecionam pelo nome no campo model da solicitação. Todos os provedores compatíveis com OpenAI (Microsoft Foundry, Azure OpenAI, AWS Bedrock, Google Vertex e OpenAI) compartilham um único endpoint, .../models/openai/v1. O gateway faz o roteamento com base em uma correspondência exata de model, portanto dê a cada modelo um nome exclusivo. A Anthropic usa um provedor personalizado com passthrough da API de Mensagens em .../models/anthropic/v1/messages. O gateway contém credenciais de backend, então as aplicações nunca lidam com chaves de provedor.

Servidores e ferramentas MCP

Um servidor MCP é um endpoint governado (.../toolservers/<server-name>/mcp) que os agentes chamam para acessar ferramentas. Ele federa um ou mais backends de três fontes: um servidor MCP remoto (por URL), uma especificação OpenAPI ou um conector embutido (mais de 1.000 aplicativos SaaS, sem servidor para hospedar). As operações de cada backend se tornam ferramentas. Você escolhe como o gateway autentica cada backend: Nenhum, API Key, OAuth 2.0 ou Identidade Gerenciada.

Policies

Uma política é uma proteção em tempo de execução que você configura em forma de cartão no portal, sem XML.

Policy O que controla
Segurança de conteúdo Verificações de segurança para sugestões e respostas.
Filtro IP Chamadas em tempo de execução originadas de intervalos de rede de clientes aprovados.
Limite de taxa de token Taxa de transferência de tokens no último minuto.
Limite de taxa de solicitação Volume de solicitações durante o último minuto.

Chaves de identidade e acesso

Administradores fazem login para gerenciar o gateway usando o Microsoft Entra ID. Os aplicativos se autenticam com chaves de acesso de tempo de execução - crie essas chaves na página Chaves do portal (Criar chave de API) e envie-as no cabeçalho api-key. Uma chave tem escopo de gateway: ela dá acesso a todos os modelos e ferramentas. Para backends, o gateway usa identidade gerenciada quando disponível (para que nenhum segredo seja armazenado) ou uma chave de provedor que você fornece. Emita uma chave por aplicativo e ambiente, e conceda a cada identidade o mínimo de privilégios.

Catálogo de autoatendimento

Desenvolvedores descobrem modelos e ferramentas em um catálogo de autoatendimento – cada um com detalhes de conexão e exemplos – fixam favoritos e pulam para qualquer lugar com a paleta de comandos Ctrl+K (⌘K no macOS).

Disponibilidade regional

Durante a prévia pública, o nível AI Gateway está disponível nas seguintes regiões do Azure.

Geografia Região
Estados Unidos Leste dos EUA 2
Europa Suécia Central

A disponibilidade por região pode variar conforme a assinatura, a nuvem, a capacidade, o sinalizador de recurso e a inscrição na versão prévia. Se sua região-alvo não estiver disponível no portal ou nas ferramentas de implantação, selecione outra região de pré-visualização suportada ou entre em contato com seu representante da Microsoft.

Escolha a região que melhor se encaixa nos seus usuários, aplicativos, backends de IA e dependências de rede. Se o gateway encaminha para o OpenAI do Azure, o Microsoft Foundry, pontos de extremidade de modelo, APIs ou servidores MCP, considere também esses locais. A residência de dados depende do caminho completo da requisição, não apenas da região do gateway. Revise onde cada componente é implantado, incluindo o gateway, backends de IA, ferramentas, destinos de log, identidades gerenciadas e aplicações clientes.

Perguntas frequentes

Quando devo usar o tier do AI Gateway em vez de ligar diretamente para os provedores?

Use o nível AI Gateway quando quiser um endpoint governado diante de muitos modelos e ferramentas: chaves centrais de runtime em vez de credenciais de provedor em cada aplicação, políticas compartilhadas (limites de tokens e requisições, segurança de conteúdo, filtros IP), telemetria unificada e um catálogo de autoatendimento. Se você chama um único modelo a partir de uma única aplicação e não precisa de governança ou credenciais centrais, ligar diretamente para o provedor pode ser mais simples.

Devo importar do Foundry ou adicionar um modelo personalizado?

Importe do Foundry quando seu modelo for executado em um recurso do Microsoft Foundry ou do OpenAI do Azure (Serviços de IA do Azure); o assistente localiza as implantações desse recurso para você. Adicione um modelo personalizado para AWS Bedrock, Google Vertex, OpenAI, Anthropic ou qualquer outro endpoint compatível com OpenAI, onde você mesmo insira o endpoint e os nomes dos modelos. Veja Gerenciar modelos e ferramentas.

O nível Gateway de IA está pronto para uso em produção?

A camada AI Gateway está em prévia pública: a disponibilidade é oferecida em regime de melhor esforço, sem acordo de nível de serviço (SLA), e as APIs, os fluxos de trabalho do portal, a telemetria, os limites, as regiões e os preços podem sofrer alterações. Cotas de pré-visualização podem limitar o número de modelos, ferramentas e chaves de acesso em tempo de execução, além da sua taxa de transferência de solicitações e tokens; limites específicos serão publicados antes da disponibilidade geral. Comece com cargas de trabalho não críticas, pilotos controlados e planos claros de retrocesso.

Como os preços são tratados durante a prévia?

Preços e modelo de negócios para o nível AI Gateway serão anunciados mais adiante na prévia. Você também pode pagar por recursos relacionados que utiliza com o gateway, como provedores de modelos, Application Insights, plataformas de rede e observabilidade.

Quais regiões estão disponíveis?

A camada AI Gateway está disponível nas regiões East US 2 e Sweden Central. Consulte a disponibilidade regional.

Como são processados os meus dados?

Você escolhe para onde vai a telemetria. Com o Application Insights, ele permanece na sua assinatura do Azure. Outros destinos OpenTelemetry (OTLP) seguem sua configuração e os termos do provedor. Telemetria utiliza as convenções semânticas do OpenTelemetry GenAI (o gen_ai.* prefixo). A residência dos dados depende do caminho completo da requisição, então coloque o gateway, os backends e os destinos de telemetria em regiões aprovadas e envolva as equipes de segurança e privacidade.

A camada do AI Gateway suporta rede privada?

Sim. O Link Privado de entrada e a integração de saída com rede virtual fazem parte da versão prévia pública. Veja Configurar rede privada para configuração, DNS e limitações.

Qual versão da API devo usar para automação?

Use a versão 2026-05-01-previewda API de gerenciamento de pré-visualização. Valide a automação antes de uma implementação ampla porque a API está em prévia.