Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Inferência local de IA é o processo de rodar um modelo de IA treinado em uma infraestrutura que você ou sua organização controlam. O principal cenário do Windows Server é a inferência distribuída: um servidor modelo compatível com OpenAI roda no Windows Server, e clientes remotos enviam requisições para seu endpoint pela rede. Por exemplo, o Visual Studio Code em uma estação de trabalho com Windows 11 pode enviar prompts para o servidor e receber a saída gerada.
As organizações utilizam inferência distribuída para dar a múltiplos clientes acesso ao cálculo compartilhado do modelo, enquanto controlam para onde as requisições e saídas viajam. Esse controle depende da localização do endpoint, caminho da rede, configuração do cliente, aquisição de modelos, diagnósticos e outros serviços na solução.
Este artigo ajuda administradores e desenvolvedores do Windows Server a decidir quando usar inferência local e identificar as considerações de infraestrutura para essa escolha.
Como a inferência de IA funciona no Windows Server
Usando inferência local de IA no Windows Server, aplicativos e ferramentas remotas conectam-se ao endereço de rede do servidor modelo, enviam requisições e recebem respostas. Os clientes não carregam nem executam o modelo localmente.
Essa topologia confere ao Windows Server um papel distinto. O servidor centraliza a capacidade de computação e GPU, o armazenamento e hospedagem do modelo, o acesso à rede, as operações de serviço e o gerenciamento de capacidade para múltiplos clientes. Os administradores operam o serviço compartilhado e sua infraestrutura, enquanto os desenvolvedores configuram os clientes para a URL base do endpoint, identificador de modelo, API suportada e método de autenticação.
A solução contém estes elementos:
- Cliente remoto: Um aplicativo, ferramenta de desenvolvimento ou ferramenta administrativa que envia prompts ou outros comandos de modelo pela rede. Os clientes podem rodar no Windows 11, Windows Server ou em outra plataforma suportada.
- Interface: Um SDK ou API HTTP que define formatos de requisição e resposta. Muitos runtimes compartilhados expõem, por exemplo, APIs compatíveis com OpenAI.
- Modelo e servidor de modelo: o ambiente de runtime orientado a servidor que carrega um modelo treinado, agenda as solicitações de inferência e retorna a saída por meio do ponto de extremidade.
- Infraestrutura do Windows Server: O host físico ou máquina virtual, processador, memória, armazenamento, recursos da GPU, rede e ferramentas de gerenciamento que suportam e expõem a carga de trabalho compartilhada.
Um endpoint implementa um ou mais formatos de API que os clientes usam, mas compatibilidade não significa que todo endpoint suporte todas as capacidades. Os clientes podem exigir rotas específicas, identificadores de modelo, comportamento de streaming, chamadas de ferramentas ou funções, métodos de autenticação ou campos de requisição. Confirme tanto os requisitos do cliente quanto as capacidades do endpoint antes de conectá-los.
A inferência embutida tem uma fronteira diferente. A aplicação carrega e executa o modelo no mesmo dispositivo, frequentemente no processo da aplicação, em vez de chamar um servidor modelo. O Windows ML fornece essa estrutura de inferência de aplicações para modelos ONNX. O Foundry Local também direciona fluxos de trabalho no dispositivo. O SDK Local do Foundry incorpora o tempo de execução em uma aplicação, e sua interface de linha de comando gerencia modelos e um serviço local em um único dispositivo. Essas opções podem rodar em hardware do Windows Server, mas elas não fornecem sozinhas um serviço de inferência distribuído que os administradores operam centralizadamente para múltiplos clientes.
Escolha sua abordagem de inferência
Escolha uma abordagem baseada em onde a inferência é executada, quantos clientes precisam do modelo e quem opera o tempo de execução. Use o Windows Server como um endpoint compartilhado para centralizar modelos e computar para clientes remotos. Essa abordagem adiciona requisitos de rede, segurança, capacidade e disponibilidade. Alternativamente, use inferência embarcada ou no dispositivo no Windows Server quando um aplicativo ou dispositivo deve ser responsável pelo tempo de execução e pelo ciclo de vida do modelo.
| Approach | Melhor ajuste | Modelo operacional | Limites importantes |
|---|---|---|---|
| Ponto de extremidade do Windows Server | Múltiplas aplicações ou ferramentas remotas que consomem um serviço modelo gerenciado por uma equipe central de operações | Um servidor modelo no Windows Server é responsável pelo carregamento do modelo, agendamento de requisições, concorrência e a API. Clientes remotos usam a URL base do endpoint, identificador de modelo e configurações de autenticação que sua organização aprova. | O produto que você selecionar determina a instalação em tempo de execução, implantação em endpoints, suporte à API e características de escala. Este artigo assume que o endpoint existe e que os clientes podem alcançá-lo. |
| Windows ML | Aplicativos Windows que rodam modelos ONNX no mesmo dispositivo | O aplicativo utiliza o Runtime ONNX que o Windows suporta, seja como um componente de sistema compartilhado ou autônomo com o aplicativo. Provedores de execução opcionais utilizam os recursos disponíveis de CPU, GPU ou NPU. | Windows ML é um framework de inferência de aplicações, não um endpoint de servidor de modelos compatível com OpenAI. Os requisitos de provedor de execução, driver, hardware e modelo variam. |
| Foundry local | Aplicações e fluxos de trabalho de desenvolvimento que precisam de inferência no próprio dispositivo, em um único dispositivo, e de um catálogo de modelos selecionado | A aplicação normalmente executa inferência em processo através do SDK. A CLI local da Foundry pode gerenciar modelos e um serviço local no dispositivo. | O Foundry Local pode ser executado em hardware de servidor, mas não foi projetado para inferência multiusuário em servidor. Ele não oferece enfileiramento de solicitações concorrentes, processamento em lote contínuo nem compartilhamento eficiente de GPU para muitos clientes simultâneos. |
As abordagens não são mutuamente exclusivas em toda a organização. Uma aplicação pode incorporar um modelo ONNX via Windows ML, um desenvolvedor pode usar o Foundry Local em uma estação de trabalho, e ferramentas de desenvolvimento remoto e aplicativos empresariais podem usar um endpoint compartilhado no Windows Server. Trate cada caminho como uma carga de trabalho separada, com seu próprio modelo, hardware, segurança e requisitos de suporte.
Planeje infraestrutura do Windows Server para inferência de IA
Arquitetura do modelo, contagem de parâmetros, quantização, comprimento do contexto, concorrência de requisições e metas de latência determinam o processamento e a memória necessários. Alguns modelos rodam em CPU, enquanto outros workloads se beneficiam da aceleração por GPU. Uma GPU não é pré-requisito para toda solução de inferência.
Para uma carga de trabalho em um host físico do Windows Server, o runtime pode usar hardware e APIs que o Windows Server e o fornecedor de hardware suportam. Para uma carga de trabalho em uma máquina virtual Hyper-V, selecione uma opção de virtualização de GPU apropriada. O plano para aceleração de GPU no Windows Server compara acesso direto ao host, Atribuição Discreta de Dispositivos (DDA), particionamento da GPU e cenários de contêineres do Windows. A partição da GPU está disponível no Windows Server 2025 ou versões posteriores e é uma opção opcional de infraestrutura.
Também planeje para estes recursos:
- Memória e memória da GPU: Considere o modelo carregado, contexto e requisitos de cache, requisições concorrentes e outros processos no host.
- Armazenamento: Fornecer controles de capacidade e acesso para arquivos de modelos, pacotes em tempo de execução, logs e dados temporários. A aquisição de modelos pode exigir uma conexão de rede externa mesmo quando a inferência é executada localmente.
- Rede: Para um endpoint compartilhado, estime a largura de banda e a latência entre clientes e o endpoint. Defina quais redes e hosts podem acessar o serviço.
- Disponibilidade e capacidade: Decida como os clientes se comportam quando o endpoint está indisponível ou operando em capacidade maxima. Valide a concorrência e a taxa de transferência com modelos e solicitações representativos antes do uso em produção.
Segure e opere inferência de IA no Windows Server
A colocação local não fornece uma barreira de segurança por si só. Defina o limite dentro do qual os prompts, dados recuperados, arquivos de modelo, saídas, logs e diagnósticos devem permanecer, e então verifique cada componente contra esse limite.
Proteger o tráfego de rede com configurações TLS aprovadas, autenticar e autorizar clientes, restringir o acesso a endpoints com controles de rede e armazenar credenciais em um armazenamento secreto aprovado. Não coloque credenciais em arquivos fonte ou configurações de ferramentas que outros usuários possam ler. Revise licenças modelo e fontes de aquisição antes de implantar arquivos modelo.
Valide a saída do modelo antes de confiar nela. Mantenha supervisão humana adequada para ações ou decisões de impacto.
Gerencie a infraestrutura do Windows Server por meio das ferramentas de administração já estabelecidas, incluindo o Windows Admin Center quando ele suporta as operações necessárias. Siga a documentação do runtime para o ciclo de vida do modelo e as operações específicas do endpoint. No mínimo, planeje monitorar a saúde dos endpoints, a latência das solicitações, a taxa de transferência, as falhas, o uso de CPU e memória, a utilização e o uso de memória da GPU, quando aplicável, e a capacidade de armazenamento. Métricas disponíveis e operações de gerenciamento variam conforme o tempo de execução, portanto este artigo não prescreve uma única implementação de observabilidade.
Cenários comuns de inferência local de IA
A inferência local pode suportar cargas de trabalho de desenvolvedores, administradores e aplicações, mantendo o caminho de inferência dentro do limite selecionado pela organização.
- Assistência em programação: Conecte uma ferramenta de desenvolvimento suportada, como o Visual Studio Code no Windows 11, a um endpoint existente no Windows Server para explicação, geração, revisão ou resolução de problemas de código. O código-fonte e os prompts viajam pela rede até esse ponto final, então incluam o caminho da rede, o ponto final e seus operadores no limite dos dados.
- Assistência administrativa: Conecte uma ferramenta administrativa a um modelo que possa explicar ou propor comandos. Revise os comandos gerados e entenda seus efeitos antes de executá-los, especialmente quando mudam o estado do sistema.
- Processamento de documentos: Use uma aplicação para resumir, classificar, extrair ou indexar documentos com um modelo local. A aplicação permanece responsável pela autorização para obter documentos e gerar resultados.
- Aplicações conversacionais: Adicione experiências de chat ou respostas a uma aplicação existente. A aplicação pode combinar um endpoint do modelo com dados corporativos autorizados, mas deve aplicar controles de acesso independentemente do modelo.
Próximos passos para inferência local de IA no Windows Server
- Configure a CLI do GitHub Copilot para inferência local
- Configure o Visual Studio Code para usar um endpoint de modelo local
- Conecte o Intelligent Terminal Preview a um endpoint local do modelo
- Conecte-se a endpoints compatíveis com OpenAI com o Microsoft Agent Framework
- Execute modelos ONNX usando Windows ML
- Integrar SDKs de inferência ao Foundry Local