Visão geral dos níveis do AI Gateway (pré-visualização)

APLICA-SE A: escalão do AI Gateway (pré-visualização)

Importante

O escalão AI Gateway encontra-se atualmente em versão de pré-visualização pública. Durante a pré-visualização pública, o nível AI Gateway está disponível nas seguintes regiões:

  • Estados Unidos - East US 2
  • Europa - Suécia Central

O AI Gateway tier (pré-visualização) do API Management do Azure é um gateway totalmente gerido para cargas de trabalho de IA. Oferece às equipas um único local para publicar, proteger, governar e observar o acesso a modelos de IA e ferramentas do Model Context Protocol (MCP).

O nível AI Gateway está em pré-visualização pública. Funcionalidades de pré-visualização, regiões, limites de serviço e APIs podem mudar antes da disponibilidade geral. Os preços e o modelo de negócio serão anunciados mais tarde na pré-visualização.

O que é o nível do AI Gateway?

O nível AI Gateway é um gateway gerido para aplicações que invocam modelos e ferramentas. As aplicações chamam um endpoint de gateway em vez de chamarem diretamente o backend de cada fornecedor ou ferramenta. Para cada solicitação, o gateway:

  1. Autentica a chave de acesso do runtime no cabeçalho api-key.
  2. Avalia as políticas que se aplicam ao modelo ou ferramenta alvo.
  3. Encaminha o pedido para o backend selecionado – pelo model campo para modelos, ou pelo nome da ferramenta para ferramentas – usando as credenciais do backend que configuraste.
  4. Devolve a resposta e emite telemetria — registos e métricas do OpenTelemetry como contagem de tokens e latência.

Porquê utilizar

O nível AI Gateway oferece às equipas da plataforma um limite de execução governado para aplicações, modelos e ferramentas. Utilize-o para:

  • Coloque um único endpoint de gateway perante os fornecedores de IA suportados.
  • Mantenha as credenciais do fornecedor ocultas das candidaturas.
  • Gerir modelos, servidores MCP, chaves de acesso em tempo de execução, políticas e monitorização.
  • Aplique controlos de governação, como limites de taxa de token, limites de taxa de pedido, segurança de conteúdos e filtros IP.
  • Publique ferramentas MCP aprovadas para agentes de IA.
  • Descubra e utilize modelos e ferramentas disponíveis através de um catálogo de autoatendimento.
  • Inicie sessão para gerir o gateway com o Microsoft Entra ID.

Escolhe o teu caminho

Início rápido

Ainda não conhece o nível AI Gateway? Crie um gateway, adicione um modelo e faça a sua primeira chamada dentro de cerca de 20–30 minutos.

Gerir modelos e ferramentas

Adicione Foundry e modelos personalizados, e publique servidores de ferramentas MCP atrás de um único endpoint governado.

Governar, proteger e operar

Aplique políticas, gestão de identidades, rede e monitorização para executar em produção.

Conceitos-chave

Gateway

Um gateway é o limite de runtime e gestão do tráfego de IA. É um recurso dedicado ao Azure que podes provisionar em cerca de um minuto, sem unidades de escala para planear. As aplicações invocam um único endpoint de gateway com uma chave de acesso em tempo de execução, em vez de invocarem diretamente cada fornecedor ou backend de ferramenta. Geres os modelos, ferramentas, políticas, chaves e identidade num só lugar.

Diagrama de aplicações, agentes e agentes de código que invocam a camada de AI Gateway, que autentica a chave de tempo de execução, aplica políticas e emite telemetria antes de encaminhar pedidos para fornecedores de modelos e backends das ferramentas MCP.

Modelos

Um modelo é o modelo de um fornecedor que publica através do gateway. As aplicações selecionam-no pelo nome no campo do model pedido. Todos os fornecedores compatíveis com OpenAI (Microsoft Foundry, Azure OpenAI, AWS Bedrock, Google Vertex e OpenAI) partilham um único endpoint, .../models/openai/v1. O gateway faz o encaminhamento com base numa correspondência exata de model, por isso, atribua a cada modelo um nome único. A Anthropic utiliza um fornecedor personalizado com passagem direta através da API Messages em .../models/anthropic/v1/messages. O gateway contém credenciais de backend, por isso as aplicações nunca lidam com as chaves do fornecedor.

Servidores e ferramentas MCP

Um servidor MCP é um endpoint gerido (.../toolservers/<server-name>/mcp) que os agentes invocam para aceder às ferramentas. Federa um ou mais backends de três fontes: um servidor MCP remoto (por URL), uma especificação OpenAPI ou um conector incorporado (mais de 1.000 aplicações SaaS, sem servidor para alojar). As operações de cada backend tornam-se ferramentas. Escolhe como o gateway autentica cada backend: Nenhum, Chave API, OAuth 2.0 ou Identidade Gerida.

Políticas

Uma política é um mecanismo de salvaguarda em tempo de execução que configura como um cartão no portal - sem XML.

Policy O que controla
Segurança dos Conteúdos Verificações de segurança para avisos e respostas.
Filtro IP Chamadas em tempo de execução provenientes de intervalos de rede de clientes aprovados.
Limite de taxa de token Taxa de processamento de tokens numa janela móvel de um minuto.
Limite da taxa de pedidos Solicite volume durante um minuto móvel.

Chaves de identidade e acesso

Os administradores iniciam sessão para gerir o gateway usando o Microsoft Entra ID. As aplicações autenticam-se com chaves de acesso em tempo de execução – cria essas chaves na página de Chaves do portal (Criar chave API) e envia-as no api-key cabeçalho. Uma chave está associada ao gateway: dá acesso a todos os modelos e ferramentas. Para os serviços de back-end, o gateway utiliza identidade gerida, quando disponível (pelo que não são armazenados segredos), ou uma chave do fornecedor fornecida por si. Emitir uma chave por aplicação e ambiente, e conceder a cada identidade o menor privilégio.

Catálogo de autosserviço

Os programadores descobrem modelos e ferramentas num catálogo de self-service – cada um com detalhes de ligação e exemplos – colocam favoritos e saltam para qualquer lado com a paleta de comandos Ctrl+K (⌘K no macOS).

Disponibilidade regional

Durante a pré-visualização pública, o nível AI Gateway está disponível nas seguintes regiões do Azure.

Geografia Região
Estados Unidos E.U.A. Leste 2
Europa Suécia Central

A disponibilidade regional pode variar consoante a subscrição, a nuvem, a capacidade, o sinalizador de funcionalidade e a inscrição na pré-visualização. Se a sua região-alvo não estiver disponível no portal ou nas ferramentas de implementação, selecione outra região de pré-visualização suportada ou contacte o seu representante da Microsoft.

Escolha a região que melhor se adequa aos seus utilizadores, aplicações, backends de IA e dependências de rede. Se o gateway encaminhar o tráfego para o Azure OpenAI, o Microsoft Foundry, pontos finais de modelos, APIs ou servidores MCP, considere também esses locais. A residência dos dados depende do caminho completo do pedido, não apenas da região do gateway. Analise onde cada componente é implementado, incluindo o gateway, backends de IA, ferramentas, destinos de registo, identidades geridas e aplicações clientes.

Perguntas frequentes

Quando devo usar o nível AI Gateway em vez de ligar diretamente para os provedores?

Use o escalão AI Gateway quando quiser um endpoint controlado para vários modelos e ferramentas: chaves centrais de runtime em vez de credenciais dos fornecedores em cada aplicação, políticas partilhadas (limites de token e de pedidos, segurança de conteúdo, filtros de IP), telemetria unificada e um catálogo de autoatendimento. Se chamar um único modelo a partir de uma única aplicação e não precisar de governação ou credenciais centrais, ligar diretamente ao fornecedor pode ser mais simples.

Devo importar do Foundry ou adicionar um modelo personalizado?

Importe a partir do Foundry quando o seu modelo é executado num recurso do Microsoft Foundry ou do Azure OpenAI (Azure AI Services); o assistente descobre as implementações desse recurso por si. Adicione um modelo personalizado para AWS Bedrock, Google Vertex, OpenAI, Anthropic ou qualquer outro endpoint compatível com OpenAI, onde introduza o endpoint e os nomes dos modelos por si próprio. Veja Gerir modelos e ferramentas.

O escalão do AI Gateway está preparado para produção?

O escalão do AI Gateway está em pré-visualização pública: a disponibilidade é assegurada numa base de melhor esforço, sem contrato de nível de serviço (SLA), e as APIs, os fluxos de trabalho do portal, a telemetria, os limites, as regiões e os preços podem mudar. As quotas da pré-visualização podem limitar o número de modelos, ferramentas e chaves de acesso do runtime, bem como a taxa de pedidos e de tokens; os limites específicos serão publicados antes da disponibilidade geral. Comece com cargas de trabalho não críticas, pilotos controlados e planos de retrocesso claros.

Como é que os preços são tratados durante a pré-visualização?

Os preços e o modelo de negócio do escalão AI Gateway serão anunciados mais tarde durante a fase de pré-visualização. Também pode pagar por recursos relacionados que utiliza com o gateway, como fornecedores de modelos, Application Insights, plataformas de redes e de observabilidade.

Que regiões estão disponíveis?

O escalão AI Gateway está disponível em East US 2 e Sweden Central. Ver disponibilidade regional.

Como são processados os meus dados?

Escolhes para onde vai a telemetria. Com o Application Insights, fica na sua subscrição do Azure. Outros destinos OpenTelemetry (OTLP) seguem a sua configuração e os termos do fornecedor. A telemetria utiliza as convenções semânticas do OpenTelemetry GenAI (o gen_ai.* prefixo). A residência de dados depende do percurso completo do pedido, por isso coloque o gateway, os backends e os destinos de telemetria em regiões aprovadas e envolva as suas equipas de segurança e privacidade.

O escalão AI Gateway suporta rede privada?

Yes. A integração com o Private Link de entrada e a rede virtual de saída fazem parte da pré-visualização pública. Consulte Configurar rede privada para configuração, DNS e limitações.

Que versão da API devo usar para automação?

Use a versão 2026-05-01-previewda API de gestão de pré-visualizações. Valide a automação antes de uma implementação em larga escala, porque a API está em versão de pré-visualização.