Idioma

O que são APIs da IA do Windows?

Imagem mostrando os ícones de várias IA APIsdo Windows.

O Windows AI Foundry fornece um conjunto de recursos de IA do Windows AI Foundry APIs e recursos de inferência abstraídos do hardware por meio do Windows ML (machine learning). Elas APIs permitem que você adicione funcionalidades compatíveis sem encontrar, executar ou otimizar seu próprio modelo de machine learning. Os modelos que alimentam Windows AI Foundry são executados localmente em dispositivos de Windows 11 compatíveis, incluindo Copilot+ PCs com NPUs, dispositivos com GPUs compatíveis e dispositivos que atendem às especificações recomendadas da CPU e podem ser executados continuamente em segundo plano.

Hardware com suporte

A IA do Windows APIs está se expandindo além dos PCs Copilot+ para oferecer suporte a uma gama mais ampla de hardware. A tabela a seguir mostra o suporte de hardware atual para cada API.

Observação

Em um Copilot+ PC, o APIs com suporte sempre é executado na NPU. As colunas GPU e CPU descrevem a expansão para dispositivos não Copilot+ – eles não são back-ends alternativos que você pode aceitar em um Copilot+ PC.

API NPU (Copilot+ PC) GPU CPU
Phi Silica ✅ Disponível ✅ Disponível (NVIDIA e AMD) ❌ Sem suporte
OCR (Reconhecimento de Texto) ✅ Disponível ❌ Sem suporte ❌ Sem suporte
Reconhecimento de Fala ✅ Disponível ❌ Sem suporte ✅ Disponível (opcional, removível)
Super resolução de vídeo ✅ Disponível ❌ Sem suporte ✅ Disponível
Super resolução de imagem ✅ Disponível ❌ Sem suporte ❌ Sem suporte
Descrição da Imagem ✅ Disponível ❌ Sem suporte ❌ Sem suporte
Segmentação de imagem ✅ Disponível ❌ Sem suporte ❌ Sem suporte
Apagamento de objeto ✅ Disponível ❌ Sem suporte ❌ Sem suporte
Geração de Imagem ✅ Disponível (opcional, removível) ❌ Sem suporte ❌ Sem suporte

Observação

O suporte a GPU para o Phi Silica está disponível nas séries NVIDIA GeForce RTX 30 e posteriores (6+ GB de VRAM) e AMD Radeon RX 9060 e posteriores (6+ GB de VRAM). A inferência de GPU exige que o Modo de Desenvolvedor seja habilitado (Configurações>>) e o driver de GPU mais recente instalado diretamente do fabricante (consulte Phi Silica — requisitos de driver de GPU). O Reconhecimento de Fala e Super Resolução de Vídeo é executado em qualquer CPU, mas tem o melhor desempenho em dispositivos que atendem às especificações recomendadas (4 núcleos físicos, 3 GHz ou relógio base superior, 32 MB ou mais de cache L3). Consulte as páginas individuais API para obter detalhes e uma verificação em runtime.

Disponibilidade do modelo

A maneira como o modelo de IA subjacente atinge um dispositivo depende de API:

  • Phi Silica — No Copilot+ PCs o modelo é preinstalado na NPU. Nos dispositivos com GPU e CPU, o modelo não vem pré-instalado — ele é baixado quando necessário na primeira vez que seu aplicativo faz uma chamada a EnsureReadyAsync. Os downloads podem ser vários GB e executados em segundo plano por meio de Windows Update. Os usuários finais podem remover ou reinstalar o modelo emComponentes de IA>>. Os aplicativos devem verificar GetReadyState primeiro e exibir uma caixa de diálogo solicitando consentimento antes de disparar o download. Consulte Phi Silica — Disponibilidade do modelo e download para o padrão de UX recomendado.
  • Geração de imagem – é executado somente na NPU, mas o modelo não é pré-instalado devido ao tamanho da instalação. Ele é baixado sob demanda na primeira vez que seu aplicativo chama EnsureReadyAsync, e os usuários podem removê-lo posteriormente em Configurações>Sistema>Componentes de IA. Os aplicativos devem verificar GetReadyState primeiro e exibir uma caixa de diálogo solicitando consentimento antes de disparar o download. Consulte Geração de Imagem – Disponibilidade do modelo e download para o padrão de UX recomendado.
  • Video Super Resolution — O modelo VSR acompanha o SDK do Aplicativo Windows em todas as plataformas de hardware compatíveis. Não há um download de primeira execução, uma etapa de consentimento ou um modelo removível. Consulte Super-resolução de vídeo – Especificações recomendadas da CPU.
  • Speech Recognition — No Copilot+ PCs o modelo é preinstalado na NPU. Em dispositivos com apenas CPU, o modelo não é pré-instalado — ele é baixado sob demanda quando seu aplicativo chama EnsureReadyAsync pela primeira vez, e os usuários podem removê-lo posteriormente em Configurações>Sistema>Componentes de IA. Os aplicativos devem verificar GetReadyState primeiro e exibir uma caixa de diálogo de consentimento antes de iniciar o download na CPU. Consulte Reconhecimento de Fala – Disponibilidade do modelo e download para o padrão de UX recomendado.

Consulte o aplicativo de exemplo de IA APIs do Windows com WinUI para saber como usar Microsoft Foundry on Windows com o WinUI.

Importante

A seguir está uma lista de recursos de IA do Windows e a edição do SDK do Aplicativo Windows em que estão atualmente suportados. Confira a visão geral dos recursos disponíveis APIs mais adiante neste tópico para breves descrições.

[Versão 2.2.2-experimental9 (experimental de junho de 2026)] - Phi Silica na GPU (requer uma compilação do Canal Experimental do Windows Insider)

Versão 1.8.0 (1.8.250907003) - Phi Silica (Recurso de Acesso Limitado), Resumo de Conversa (Inteligência de Texto), Apagamento de Objeto

Versão 1.8 Preview (1.8.0-preview) - Ajuste fino de LoRA para Phi Silica, Tom de regravador de texto (inteligência de texto)

Visualização privada – Pesquisa Semântica

Versão 1.7.1 (1.7.250401001) – Todos os outros APIs

Criar seu primeiro aplicativo com Windows AIAPIs

Dica

Para melhorar a acessibilidade e a legibilidade, esta página exibe imagens estáticas por padrão. Em alguns casos, você pode clicar em uma imagem para ver uma versão animada.

Para criar seu primeiro aplicativo Windows com esses recursosAPIs, examine os pré-requisitos e siga o código de exemplo em Introdução à criação de um aplicativo com Windows AIAPIs.

Em seguida, você pode seguir tutoriais focados para o passo a passo Phi Silica, passo a passo de imagens e passo a passo de reconhecimento de texto.

Experimente o APIs e os modelos no seu computador

AI Dev Gallery é um aplicativo de demonstração, disponível na Microsoft Store, que permite baixar, experimentar e usar rapidamente a IA APIs e os modelos do Windows.

Em AI Dev Gallery, selecione o item de menu da guia IA do WindowsAPIs e, em seguida, selecione o exemplo Phi Silica. Se o modelo já estiver disponível em seu dispositivo, esse exemplo será executado imediatamente. Caso contrário, selecione o Modelo de solicitação para baixar o modelo. Depois de baixado, esse exemplo será ativado. Saiba mais sobre o AI Dev Gallery em O que é o AI Dev Gallery?.

Visão geral dos APIsdisponíveis

Aqui estão alguns recursos prontos para uso que você pode adicionar ao seu aplicativo Windows:

Phi Silica

Importante

O Phi Silica está sendo substituído pelo Aion Instruct, um novo modelo no dispositivo. O Aion Instruct começa a ser distribuído para dispositivos Windows Insider Preview em novembro de 2026 e para dispositivos de varejo em janeiro de 2027, momento em que o Phi Silica será removido. Consulte Introdução ao Phi Silica para obter detalhes de transição e linha do tempo.

Semelhante ao LLM (Modelos de Linguagem Grande), o Phi Silica é um SLM (Small Language Model) desenvolvido pela Microsoft Research para executar tarefas de processamento de idioma em um dispositivo local (consulte Get iniciado com Phi Silica). O Phi Silica foi desenvolvido para dispositivos Windows com uma NPU (Unidade de Processamento Neural) ou uma GPU compatível, permitindo que os recursos de geração de texto e conversação sejam executados com alto desempenho e aceleração por hardware diretamente no dispositivo. Phi Silica não está disponível na China.

Um gif animado mostrando um prompt de chat de IA lendo 'introduza-se' e uma resposta gerada com o recurso Phi Silica.

Reconhecimento de texto

O reconhecimento APIs de texto reconhece texto em imagens e converte documentos digitalizados, arquivos PDF e imagens de câmera em dados editáveis e pesquisáveis no dispositivo. Veja Primeiros passos com o reconhecimento de texto.

Um gif animado mostrando palavras em uma captura de tela sendo reconhecidas com sobreposições de texto que podem ser copiadas para um arquivo ou área de transferência usando o recurso de reconhecimento de texto.

Processamento de imagens

Dimensionar e afiar imagens (Super Resolução de Imagem), identificar objetos dentro de uma imagem (Extrator de Objeto de Imagem), gerar descrições de linguagem natural de imagens (Descrição da Imagem) e remover objetos de imagens (Apagamento de Objeto). Confira a visão geral de imageamento.

Super Resolução de Imagem

A Super Resolução de Imagem APIs habilita o aperfeiçoamento e o escalonamento da imagem.

Um gif animado mostrando uma imagem com uma combinação de palavras e imagens que está sendo afiada e dimensionada usando o recurso de Super resolução de imagem.

Veja também Superresolução de Imagem.

Extrator de objeto de imagem

O Extrator APIs de Objeto de Imagem habilita a identificação de objetos em imagens.

Um gif animado mostrando um homem levantando um pé do chão e selecionando Remover Plano de Fundo para isolar a imagem do homem em um plano de fundo branco usando o recurso Extrator de Objeto de Imagem.

Veja também o Extrator de Objeto de Imagem.

Descrição da imagem

A Descrição da APIs Imagem descreve imagens em linguagem natural.

Observação

Os recursos de Descrição da Imagem não estão disponíveis na China.

Um gif animado mostrando um cachorro dormindo que exibe uma descrição da imagem usando linguagem natural, mostrando um cachorro fofo e de pelo desgrenhado deitado em um sofá descansando confortavelmente, usando o recurso Descrição da imagem.

Veja também a Descrição da Imagem

Apagar Objeto

Você pode usar o Apagamento de Objeto APIs para remover objetos de imagens.

Um gif animado mostrando uma imagem em que o usuário está removendo objetos do uso do recurso Apagar Objeto.

Veja também o Apagamento de Objeto

Recursos planejados

Os seguintes recursos estão planejados, mas ainda não estão disponíveis para uso:

  • Tradução ao vivo (ainda não há suporte). Ajude todos que usam o Windows, incluindo aqueles que são surdos ou com deficiência auditiva, a entender melhor o áudio exibindo legendas de conteúdo falado (mesmo quando o conteúdo de áudio estiver em um idioma diferente do idioma preferido do sistema).

Moderação de conteúdo

Saiba como o conteúdo é moderado pela IA do Windows APIs e como você pode ajustar os filtros de sensibilidade. Consulte a moderação de segurança de conteúdo com a IA APIsdo Windows.

Ao adicionar recursos baseados em modelo, examine o Desenvolvimento responsável de IA generativa no Windows.

Recursos adicionais

Consulte também