O que é Foundry Local?

O Foundry Local é uma solução local de IA de ponta a ponta para aplicações de envio que correm inteiramente no dispositivo do utilizador. Fornece um SDK fácil de usar (C#, JavaScript, Rust e Python), um catálogo selecionado de modelos otimizados e aceleração automática por hardware — tudo num pacote leve.

Os dados do utilizador nunca saem do dispositivo, as respostas começam imediatamente sem qualquer latência de rede, e a tua aplicação funciona offline. Não há custos por token nem infraestrutura de backend para manter.

O Foundry Local é uma das duas opções para executar modelos de IA localmente. Use-o para incorporar IA em aplicações clientes nos dispositivos dos utilizadores finais. Os dados ficam no dispositivo, a tua aplicação pode funcionar offline e não precisas de subscrição do Azure. Se precisar de inferência de IA em escala empresarial na sua própria infraestrutura com operações nativas do Kubernetes e gestão de Azure Arc, consulte Foundry Local em Azure Local. Essa opção é implementada em clusters Kubernetes com Arc no Azure Local.

Características

  • Tempo de execução leve — O tempo de execução gere a aquisição de modelos, aceleração de hardware, gestão de modelos e inferência (via ONNX Runtime). O tempo de execução adiciona aproximadamente 20 MB ao seu pacote de aplicações, tornando prático incorporar IA diretamente nas aplicações onde o tamanho importa.

  • Catálogo de modelos selecionados — Um catálogo de modelos de alta qualidade otimizados para uso em dispositivos numa vasta gama de hardware de consumo. O catálogo abrange completações de chats (por exemplo, GPT OSS, Qwen, DeepSeek, Mistral e Phi) e transcrição de áudio (por exemplo, Whisper). Cada modelo passa por extensa quantização e compressão para garantir o melhor equilíbrio entre qualidade e desempenho. Os modelos são versionados, por isso a sua aplicação pode ser fixada numa versão específica ou receber atualizações automaticamente.

  • Aceleração automática de hardware — O Foundry Local deteta o hardware disponível no dispositivo do utilizador e seleciona o melhor fornecedor de execução. Acelera a inferência em GPUs e NPUs quando disponíveis e regressa à CPU de forma fluida — sem necessidade de código de deteção de hardware. As atualizações do fornecedor de execução e dos drivers são geridas automaticamente para garantir um desempenho ótimo em diferentes configurações de hardware.

  • Gestão inteligente de modelos — A Foundry Local gere todo o ciclo de vida dos modelos nos dispositivos dos utilizadores finais. Os modelos descarregam automaticamente à primeira utilização, são armazenados em cache localmente para lançamentos instantâneos subsequentes, e a variante com melhor desempenho é selecionada para o hardware específico do utilizador.

  • API compatível com OpenAI—Suporta formatos de pedido e resposta OpenAI, incluindo o formato OpenAI Responses API. Se a sua aplicação já usa o SDK OpenAI, aponte-a para um endpoint Foundry Local com alterações mínimas no código.

  • Servidor local opcional — Um servidor web compatível com OpenAI para servir modelos a múltiplos processos, integrar-se com ferramentas como o LangChain ou experimentar através de chamadas REST. Para a maioria dos cenários de aplicações embutidas, use o SDK diretamente — ele executa inferência em processo sem a sobrecarga de um servidor separado.

Motivação para a IA no dispositivo

O Foundry Local é ideal para aplicações que necessitam de:

  • Mantém dados sensíveis (áudio, texto, imagem, etc.) no dispositivo do utilizador.
  • Operar em ambientes de conectividade limitada ou offline.
  • Reduzir os custos de inferência na nuvem por token.
  • Fornecer respostas de IA de baixa latência para interações em tempo real.

Introdução

Siga o guia Comece com a Foundry Local para construir a sua primeira aplicação de IA no dispositivo.

Perguntas frequentes

O Foundry Local é um servidor web e uma ferramenta de CLI?

Não. Foundry Local é uma solução de IA local de ponta a ponta com a qual a sua aplicação é enviada. Gere a aquisição de modelos, aceleração de hardware e inferência dentro do processo da sua aplicação através do SDK. O servidor web opcional e a CLI estão disponíveis para fluxos de trabalho de desenvolvimento, mas o produto principal é o runtime local de IA e o SDK que integra diretamente na sua aplicação.

Porque é que a Foundry Local não suporta todos os modelos disponíveis?

O Foundry Local foi concebido para aplicações de produção de transporte marítimo, não para experimentação de modelos de uso geral. O catálogo de modelos é intencionalmente selecionado para incluir modelos otimizados para cenários de aplicação específicos. Os modelos são testados numa variedade de hardware de consumo e suficientemente pequenos para serem distribuídos aos utilizadores finais. Esta abordagem garante que cada modelo do catálogo oferece desempenho fiável quando incorporado na sua aplicação — em vez de oferecer uma vasta seleção de modelos com comportamento imprevisível no dispositivo.

O Foundry Local pode correr num servidor?

O Foundry Local está otimizado para dispositivos com restrições de hardware onde um único utilizador acede ao modelo de cada vez. Embora tecnicamente possas instalá-lo e executá-lo em hardware de servidor, não foi concebido como uma stack de inferência de servidor.

Ambientes de execução orientados para servidor, como vLLM ou Triton Inference Server, são concebidos para cenários com vários utilizadores — gerem a colocação em fila de pedidos concorrentes, o agrupamento contínuo em lotes e a partilha eficiente de GPUs entre vários clientes em simultâneo. O Foundry Local não oferece estas capacidades. Em vez disso, foca-se numa inferência leve para um único utilizador, com deteção automática de hardware, gestão do KV-cache e tratamento do ciclo de vida do modelo que fazem sentido para aplicações cliente.

Se precisar de servir modelos a múltiplos utilizadores simultâneos, use um framework dedicado de inferência de servidor. Use o Foundry Local quando o modelo corre no próprio dispositivo do utilizador final.

O Foundry Local envia prompts ou saídas para a Microsoft?

O Foundry Local executa a inferência inteiramente no dispositivo. Quando a sua aplicação envia prompts para um endpoint Foundry Local, os prompts e as saídas dos modelos são processados localmente.

A Foundry Local ainda pode usar a rede para:

  • Downloads de modelos e componentes — Na primeira execução de um modelo, o Foundry Local descarrega os ficheiros do modelo e pode também descarregar fornecedores de execução para o hardware do utilizador.
  • Diagnósticos opcionais — Se um utilizador reportar um problema, pode optar por partilhar registos.

A utilização do Foundry Local é regida pelos termos e licenças do produto que se aplicam ao software e aos modelos em uso. Se os termos permitirem Microsoft recolher informações de diagnóstico, os detalhes são descritos nesses termos e na Declaração de Privacidade Microsoft.

É necessária uma subscrição do Azure?

Não. O Foundry Local funciona inteiramente em hardware local. Não é necessária subscrição do Azure.

Quais as plataformas suportadas?

O Foundry Local suporta Windows, macOS (Apple Silicon) e Linux.