Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O Foundry Local no Azure Local traz inferência de IA para o seu ambiente Azure Local. Implemente e execute modelos de IA num cluster Kubernetes compatível com Arc, com operações nativas do Kubernetes. Mantenha o processamento de dados no local, onde os seus dados são gerados.
Este modelo de implementação foi concebido para organizações que necessitam de controlo local, inferência de baixa latência e integração com operações Kubernetes existentes no Azure Local.
O Foundry Local no Azure Local é uma das duas opções para executar modelos de IA localmente. Foi concebido para organizações que necessitam de inferência em escala empresarial em infraestrutura local, com operações nativas do Kubernetes e gestão do Azure Arc. Se quiser incorporar IA numa aplicação cliente que corra em hardware do utilizador final, veja Foundry Local. Com essa opção, os dados ficam no dispositivo, a aplicação pode funcionar offline e não precisas de subscrição do Azure.
Importante
- O Foundry Local está disponível em pré-visualização. As versões pré-visualizadas fornecem acesso antecipado a funcionalidades que estão em implementação ativa.
- Funcionalidades, abordagens e processos podem mudar ou ter capacidades limitadas antes da disponibilidade geral (GA).
Solicitação de acesso à implementação
A implementação do Foundry Local no Azure Local está atualmente disponível mediante pedido durante a pré-visualização. Para começar, envie o formulário de pedido de pré-visualização: Solicitar acesso à versão de pré-visualização.
Capacidades chave
As seguintes capacidades destacam o que pode fazer com o Foundry Local no Azure Local.
- Execute cargas de trabalho de inferência de IA no Azure Local com operações nativas de Kubernetes.
- Implemente e gere modelos através de recursos personalizados em vez de cablagem manual de serviço.
- Use padrões REST compatíveis com OpenAI para integração de aplicações.
- Suporta implementações suportadas por CPU e GPU com base na carga de trabalho e no perfil de hardware.
- Escalone a inferência em clusters Kubernetes com vários nós para utilização simultânea e suporte a modelos com muitos parâmetros.
- Operar em ambientes desconectados onde a conectividade à internet não esteja disponível, com um modelo de implementação consistente com cenários conectados.
- Proteja o acesso ao endpoint com chaves de API, autenticação com o Microsoft Entra ID e padrões de API de gateway com TLS ativado.
- Sincronize os metadados do catálogo de modelos para que as equipas possam descobrir e implementar modelos suportados de forma consistente.
Resumo da arquitetura
O Foundry Local no Azure Local corre num cluster Kubernetes habilitado para Arc e é implementado como uma extensão Azure Arc. Utiliza um plano de controlo baseado em operador para a gestão do ciclo de vida do modelo. A um nível elevado:
- O operador de inferência Kubernetes observa o estado do cluster e reconcilia os recursos do modelo.
- Um recurso modelo define metadados do modelo. Os modelos podem vir do catálogo da Foundry ou do seu próprio registro.
- Um recurso ModelDeployment define o objetivo de execução, como o perfil de escalonamento e a exposição do endpoint.
- A plataforma pode sincronizar os metadados do catálogo de modelos no cluster para maior descoberta e consistência de versões.
- O tráfego de inferência é exposto através de serviços internos ou da API Gateway do Kubernetes, protegido com chave de API, validação de tokens do Entra ID, autenticação e TLS.
O diagrama seguinte mostra como estes componentes funcionam em conjunto. Um cluster Kubernetes habilitado com Arc executa a extensão e o operador de inferência Foundry Local, que gere os recursos de modelos e de implementação de modelos. As aplicações chamam pontos finais de inferência protegidos através da API de gateway, utilizando chaves de API ou tokens do Entra ID.
Para contexto da plataforma Azure, veja Kubernetes habilitado por Azure Arc e O que é Azure Local?.
Para diferenças de arquitetura em implementações desconectadas, veja Arquitetura de ambiente desconectado.
Como funciona
O Foundry Local no Azure Local está instalado como uma extensão do Azure Arc e inclui estes componentes essenciais:
- Operador de inferência: Operador Kubernetes que o Foundry Local no Azure Local utiliza para instalar e gerir componentes de inferência e reconciliar alterações no ciclo de vida do modelo.
- CRDs de Modelo e Implantação de Modelo: Recursos declarativos que definem modelos disponíveis e implementações ativas.
- Sincronização de catálogo: Traz metadados do catálogo de modelos para o cluster para que possa selecionar e implementar modelos suportados de forma consistente.
- Autenticação de chaves API: Protege os endpoints de inferência ao exigir chaves API do estilo bearer-token para os pedidos.
- Autenticação Entra ID: Valida tokens web JSON do Azure Active Directory através do motor sidecar de identidade da Microsoft para controlo de acesso baseado em identidade, como alternativa às chaves API.
- TLS e API de gateway: Protege o tráfego em trânsito e permite acesso externo controlado através da API do gateway.
Para operações desconectadas, consulte Foundry Local on Azure Local in disconnected environments overview para conhecer os componentes e o comportamento que diferem das implementações conectadas.
Trabalhe com o Foundry Local habilitado pelo Azure Arc através de APIs REST ou diretamente através dos recursos Kubernetes. Para mais informações, consulte Inference API endpoints e payload.
Âmbito dos pré-requisitos
Para usar o Foundry Local no Azure Local, planeie estes pré-requisitos a um nível geral:
- Ambiente Azure Local com capacidade de cluster Kubernetes dimensionada para os teus modelos-alvo.
- Ligação Arc para gestão do Kubernetes e operações de ciclo de vida com base em extensões.
- Perfil de computação apropriado (apenas CPU ou nós com GPU) e drivers e plugins validados para cenários de GPU.
- Acesso operacional em Kubernetes e permissões a nível de cluster para instalar a extensão Azure Arc e gerir recursos personalizados.
- Configuração de rede e de segurança da API de gateway, gestão de certificados e tratamento de chaves de API.
Para ambientes desconectados, use os pré-requisitos dedicados e as instruções de configuração em Plan para implementar o Foundry Local em Azure Local em ambientes desconectados e Deploy Foundry Local como uma extensão Azure Arc num ambiente desconectado.
Regiões suportadas
O Foundry Local está disponível como uma extensão Azure Arc nas seguintes regiões:
- Leste da Austrália
- Canadá Central
- Índia Central
- E.U.A. Central
- E.U.A. Central - EUAP
- E.U.A. Leste
- E.U.A. Leste 2
- E.U.A. Leste 2 - EUAP
- Leste do Japão
- Coreia Central
- Europa do Norte
- E.U.A. Centro-Sul
- Sudeste Asiático
- Sul do Reino Unido
- Europa Ocidental
- E.U.A. Oeste
- E.U.A. Oeste 2
- E.U.A. Oeste 3
Cargas de trabalho suportadas
O Foundry Local no Azure Local suporta cargas de trabalho de inferência de IA tais como:
- Inferência de IA generativa: Cenários ao estilo chat e geração de texto através de padrões de pedido compatíveis com OpenAI, utilizando o motor de ONNX-GenAI predefinido (CPU ou GPU) ou o motor vLLM (apenas GPU) para cenários de alto rendimento.
- Inferência preditiva de IA: Modelo não generativo que serve para classificação, pontuação ou outras tarefas de previsão determinística.
- Execução de CPU e GPU: Metas de implementação flexíveis baseadas nos requisitos de desempenho e custo.
- Padrões de serviço multimodelo: Múltiplas implementações de modelos geridas declarativamente dentro do mesmo cluster.
Quando utilizar
Use o Foundry Local no Azure Local quando precisar:
- Mantém a inferência e o processamento de dados no local para questões de soberania ou requisitos regulamentares.
- Reduza a latência de ida e volta servindo modelos perto de aplicações e fontes de dados.
- Padronizar a disponibilização de IA com operações nativas do Kubernetes nos fluxos de trabalho da plataforma já existentes.
- Utilize padrões de gestão ligados ao Azure ao executar inferência na infraestrutura local.
- Escale a inferência de IA entre múltiplos nós num cluster Kubernetes para acesso concorrente e modelos maiores.
- Executa inferências de IA em ambientes desconectados ou isolados, sem ligação à internet.