Inferência de IA no Windows Server

A inferência local de IA é o processo de executar um modelo de IA treinado numa infraestrutura que você ou a sua organização controlam. O cenário principal do Windows Server é a inferência distribuída: um servidor modelo compatível com OpenAI corre no Windows Server, e os clientes remotos enviam pedidos para o seu endpoint através da rede. Por exemplo, o Visual Studio Code numa estação de trabalho Windows 11 pode enviar prompts para o servidor e receber a saída gerada.

As organizações utilizam inferência distribuída para dar a múltiplos clientes acesso ao cálculo partilhado do modelo, controlando para onde os pedidos e saídas viajam. Esse controlo depende da localização do endpoint, do caminho da rede, da configuração do cliente, da aquisição do modelo, dos diagnósticos e de outros serviços na solução.

Este artigo ajuda administradores e programadores do Windows Server a decidir quando usar inferência local e a identificar as considerações de infraestrutura para essa escolha.

Como funciona a inferência de IA no Windows Server

Usando inferência local de IA no Windows Server, aplicações e ferramentas remotas ligam-se ao endereço de rede do servidor modelo, enviam pedidos e recebem respostas. Os clientes não carregam nem executam o modelo localmente.

Esta topologia confere ao Windows Server um papel distinto. O servidor centraliza a capacidade de computação e GPU, o armazenamento e alojamento do modelo, o acesso à rede, as operações de serviço e a gestão de capacidade para múltiplos clientes. Os administradores operam o serviço partilhado e a sua infraestrutura, enquanto os programadores configuram os clientes para a URL base do endpoint, identificador de modelo, API suportada e método de autenticação.

A solução contém estes elementos:

  • Cliente remoto: Uma aplicação, ferramenta de desenvolvimento ou ferramenta administrativa que envia prompts ou outro input de modelo através da rede. Os clientes podem correr no Windows 11, Windows Server ou noutra plataforma suportada.
  • Interface: Um SDK ou API HTTP que define formatos de pedido e resposta. Muitos runtimes partilhados expõem, por exemplo, APIs compatíveis com OpenAI.
  • Servidor de modelos e modelo: O ambiente de execução orientado para o servidor que carrega um modelo treinado, gere pedidos de inferência e devolve o resultado através do ponto de extremidade.
  • Infraestrutura do Windows Server: O anfitrião físico ou máquina virtual, processador, memória, armazenamento, recursos da GPU, rede e ferramentas de gestão que suportam e expõem a carga de trabalho partilhada.

Um endpoint implementa um ou mais formatos de API que os clientes utilizam, mas compatibilidade não significa que todos os endpoints suportem todas as capacidades. Os clientes podem necessitar de rotas específicas, identificadores de modelo, comportamento de streaming, chamadas de ferramentas ou funções, métodos de autenticação ou campos de pedido. Confirme tanto os requisitos do cliente como as capacidades do endpoint antes de os ligar.

A inferência embutida tem um limite diferente. A aplicação carrega e executa o modelo no mesmo dispositivo, muitas vezes no processo da aplicação, em vez de chamar um servidor de modelo. O Windows ML fornece esta estrutura de inferência de aplicações para modelos ONNX. O Foundry Local também direciona fluxos de trabalho no dispositivo. O Foundry Local SDK incorpora o tempo de execução numa aplicação, e a sua interface de linha de comandos gere modelos e um serviço local num só dispositivo. Estas opções podem funcionar em hardware do Windows Server, mas por si só não fornecem um serviço de inferência distribuído que os administradores operam centralizadamente para múltiplos clientes.

Escolha a sua abordagem de inferência

Escolha uma abordagem baseada em onde a inferência é executada, quantos clientes precisam do modelo e quem opera o tempo de execução. Use o Windows Server como endpoint partilhado para centralizar modelos e computar para clientes remotos. Esta abordagem acrescenta requisitos de rede, segurança, capacidade e disponibilidade. Em alternativa, utilize inferência embutida ou no dispositivo no Windows Server quando uma aplicação ou dispositivo deve ser responsável pelo tempo de execução e pelo ciclo de vida do modelo.

Approach Melhor ajuste Modelo operacional Limites importantes
Ponto final do Windows Server Múltiplas aplicações ou ferramentas remotas que consomem um serviço modelo gerido por uma equipa central de operações Um servidor modelo no Windows Server é responsável pelo carregamento dos modelos, agendamento de pedidos, concorrência e a API. Os clientes remotos utilizam a URL base do endpoint, o identificador do modelo e as definições de autenticação que a sua organização aprova. O produto que seleciona determina a instalação em tempo de execução, a implementação dos endpoints, o suporte à API e as características de escala. Este artigo assume que o endpoint existe e que os clientes podem aceder a ele.
Windows ML Aplicações Windows que executam modelos ONNX no mesmo dispositivo A aplicação utiliza o Runtime ONNX que o Windows suporta, seja como componente do sistema partilhado ou autónomo com a aplicação. Os fornecedores de execução opcionais utilizam os recursos disponíveis para CPU, GPU ou NPU. O Windows ML é um framework de inferência de aplicações, não um endpoint de serviço de modelos compatível com OpenAI. Os requisitos de fornecedor de execução, driver, hardware e modelo variam.
Fundição Local Aplicações e fluxos de trabalho de desenvolvimento que requerem inferência local num único dispositivo e um catálogo selecionado de modelos A aplicação normalmente executa inferência em processo através do SDK. A CLI local da Foundry pode gerir modelos e um serviço local no dispositivo. O Foundry Local pode funcionar em hardware de servidor, mas o seu design não visa inferência de servidores multiutilizador. Não oferece enfileiramento de pedidos simultâneos, processamento contínuo em lotes nem partilha eficiente da GPU para muitos clientes simultâneos.

As abordagens não são mutuamente exclusivas em toda a organização. Uma aplicação pode incorporar um modelo ONNX através do Windows ML, um programador pode usar o Foundry Local numa estação de trabalho, e ferramentas de desenvolvimento remoto e aplicações empresariais podem usar um endpoint partilhado no Windows Server. Trate cada caminho como uma carga de trabalho separada, com o seu próprio modelo, hardware, segurança e requisitos de suporte.

Planear a infraestrutura do Windows Server para inferência de IA

A arquitetura do modelo, a contagem de parâmetros, a quantização, o comprimento do contexto, a concorrência dos pedidos e os alvos de latência determinam a computação e a memória necessárias. Alguns modelos funcionam com CPU, enquanto outros beneficiam da aceleração da GPU. Uma GPU não é um pré-requisito para todas as soluções de inferência.

Para uma carga de trabalho num host físico do Windows Server, o runtime pode usar hardware e APIs que o Windows Server e o fornecedor de hardware suportam. Para uma carga de trabalho numa máquina virtual Hyper-V, selecione uma opção de virtualização de GPU apropriada. O plano para aceleração de GPU no Windows Server compara o acesso direto ao host, Atribuição Discreta de Dispositivos (DDA), particionamento da GPU e cenários de contentores do Windows. A partição da GPU está disponível no Windows Server 2025 ou versões posteriores e é uma opção opcional de infraestrutura.

Planeie também estes recursos:

  • Memória e memória da GPU: Tenha em conta o modelo carregado, o contexto e os requisitos de cache, os pedidos simultâneos e outros processos no sistema anfitrião.
  • Armazenamento: Fornecer controlos de capacidade e acesso para ficheiros de modelo, pacotes em tempo de execução, logs e dados temporários. A aquisição de modelos pode exigir uma ligação de rede externa mesmo quando a inferência é executada localmente.
  • Rede: Para um endpoint partilhado, estima a largura de banda e a latência entre os clientes e o endpoint. Defina quais as redes e hosts que podem aceder ao serviço.
  • Disponibilidade e capacidade: Decida como os clientes se comportam quando o endpoint está indisponível ou a operar com capacidade limitada. Validar a concorrência e o rendimento com modelos representativos e pedidos antes da utilização em produção.

Segurar e operar inferência de IA no Windows Server

A colocação local não cria um limite de segurança por si só. Defina o limite dentro do qual os prompts, os dados recuperados, os ficheiros do modelo, as saídas, os registos e os diagnósticos devem permanecer e, em seguida, verifique cada componente em relação a esse limite.

Proteger o tráfego de rede com definições TLS aprovadas, autenticar e autorizar clientes, restringir o acesso aos endpoints com controlos de rede e armazenar credenciais num armazenamento secreto aprovado. Não coloque credenciais em ficheiros fonte ou configurações de ferramentas que outros utilizadores possam ler. Revise as licenças de modelo e as fontes de aquisição antes de implementar ficheiros de modelo.

Valide a saída do modelo antes de confiar nela. Manter uma supervisão humana adequada para ações ou decisões com impacto significativo.

Gere a infraestrutura do Windows Server através das ferramentas de administração já estabelecidas, incluindo o Windows Admin Center quando este suporta as operações necessárias. Siga a documentação do runtime relativa ao ciclo de vida do modelo e às operações específicas do endpoint. No mínimo, planeie observar a saúde do endpoint, latência dos pedidos, throughput, falhas, uso de CPU e memória, utilização da GPU e memória quando aplicável, e capacidade de armazenamento. As métricas disponíveis e as operações de gestão variam consoante o tempo de execução, pelo que este artigo não prescreve uma única implementação de observabilidade.

Cenários comuns de inferência local de IA

A inferência local pode suportar cargas de trabalho para desenvolvedores, administradores e aplicações, mantendo o caminho de inferência dentro do limite selecionado pela organização.

  • Assistência à programação: Ligue uma ferramenta de desenvolvimento suportada, como o Visual Studio Code no Windows 11, a um endpoint existente no Windows Server para explicação, geração, revisão ou resolução de problemas de código. O código-fonte e os prompts circulam pela rede até esse ponto de extremidade, por isso inclua o caminho de rede, o ponto de extremidade e os respetivos operadores no perímetro dos dados.
  • Assistência administrativa: Ligue uma ferramenta administrativa a um modelo que possa explicar ou propor comandos. Revê comandos gerados e compreende os seus efeitos antes de os executares, especialmente quando mudam o estado do sistema.
  • Processamento de documentos: Use uma aplicação para resumir, classificar, extrair ou indexar documentos com um modelo local. A aplicação continua a ser responsável pela autorização relativa aos documentos de origem e à saída gerada.
  • Aplicações conversacionais: Adicione experiências de chat ou respostas a perguntas a uma aplicação existente. A aplicação pode combinar um endpoint do modelo com dados empresariais autorizados, mas deve aplicar controlos de acesso independentemente do modelo.

Próximos passos para inferência local de IA no Windows Server