Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Agentes e ferramentas com o Foundry Local fazem parte da abordagem de nuvem adaptável da Microsoft. Ele estende os recursos de raciocínio e aterramento de IA para ambientes locais, distribuídos e desconectados que você gerencia por meio de Azure Arc. O aterramento conecta as respostas de um modelo aos seus próprios dados para que as respostas reflitam seu conteúdo privado, em vez de apenas o treinamento do modelo.
Recuperação por meio de agentes é uma extensão do Kubernetes habilitada para Azure Arc e está no centro da plataforma Agentes e Ferramentas com o Foundry Local. Ele fornece uma plataforma de Geração Aumentada por Recuperação (RAG) por meio de agentes na borda. Ele combina uma camada de conhecimento (ingestão de documentos, embeddings, busca vetorial) com uma camada agêntica (agentes de IA, orquestração de conhecimento, servidor do Protocolo de Contexto de Modelo (MCP)) para fornecer assistentes inteligentes de várias etapas fundamentados em seus dados privados no ambiente local.
Importante
A Recuperação por meio de agentes no Foundry Local está no momento em VERSÃO PRÉVIA. Veja os Termos de Uso Complementares para Versões Prévias do Microsoft Azure para obter termos legais que se aplicam aos recursos do Azure que estão em versão beta, versão prévia ou que, de outra forma, ainda não foram lançados em disponibilidade geral.
A recuperação por meio de agentes no Foundry Local tem suporte e validada no Kubernetes habilitado para Azure Arc no Azure Local (anteriormente Azure Stack HCI) e como parte de uma versão prévia para operações desconectadas para Azure Local. Você pode executar a plataforma em ambientes desconectados sem conectividade com a Internet usando um modelo de implantação consistente com cenários conectados. Para ver o que muda em uma implantação desconectada, consulte Operações desconectadas para Agentic Retrieval na visão geral do Foundry Local.
Para obter mais informações, consulte Azure Arc, Kubernetes habilitado para Azure Arc e extensões do Azure Arc.
Visão geral da plataforma
A plataforma é criada com base em três componentes que funcionam juntos:
| Componente | O que faz |
|---|---|
| RAG de agentes local | Orquestração de agentes de IA com bases de conhecimento, fontes de conhecimento e um servidor MCP para raciocínio em várias etapas sobre seus dados. |
| Fontes de conhecimento locais | Pipeline de ingestão, incorporação e recuperação de dados que indexa seus documentos locais em coleções pesquisáveis. |
| Experiência de chat local | Uma interface do usuário de chat interna para interagir com agentes, gerenciar conversas e exibir citações. Nenhum front-end personalizado é necessário. |
Os recursos adicionais da plataforma incluem:
- Ponto de extremidade do modelo de linguagem do Foundry Local (recomendado) - Use um ponto de extremidade do Foundry Local no Azure Local para executar o modelo de linguagem no mesmo cluster conectado ao Azure Arc que a extensão.
- Bring Your Own Model (BYOM) - Conecte um endpoint de modelo de linguagem externo compatível com a API de complementações de chat da OpenAI, como um endpoint implantado no Microsoft Foundry.
- Dois modelos acelerados por GPU para inserção de texto (BGE-M3) e inserção de imagem (CLIP ViT-L/14) em execução localmente em duas GPUs. O docling (analisador de documentos) é executado na CPU.
- Modos de implantação independentes – implante a plataforma completa ou apenas a camada agente ou a camada de conhecimento separadamente.
- Recuperação de imagem – Ingerir e recuperar imagens relevantes como referências contextuais ao lado do texto. A Recuperação agêntica em Foundry Local não é um modelo de linguagem visual (VLM).
- Operações desconectadas – Implantar em ambientes desconectados em Azure Local usando um pacote de expansão importado localmente, sem a conectividade com a Internet necessária no momento da implantação. Para obter mais informações, consulte Visão geral de operações desconectadas para recuperação por meio de agentes no Foundry local.
Componentes da chave
A plataforma inclui três componentes principais que funcionam em conjunto para ajudar você a criar e executar soluções agênticas de RAG com seus dados on-premises.
RAG de agentes local
A camada agente adiciona planejamento, uso de ferramentas e orquestração de conversa à plataforma. Ele permite criar assistentes de IA que gerenciam interações de várias etapas, chamam ferramentas de conhecimento conectadas ao MCP e geram respostas fundamentadas em seus dados privados.
Principais capacidades:
- Execução do agente – os agentes processam consultas de usuário, raciocinando instruções, invocando ferramentas e gerando respostas.
- Orquestração de conhecimento – conecte agentes a uma ou mais fontes de dados por meio de bases de dados de conhecimento e fontes de conhecimento.
- Servidor MCP – um servidor MCP interno com ferramentas de pesquisa, além de suporte para se conectar a servidores MCP externos.
- Gerenciamento de conversa – threads, mensagens e execuções para gerenciar interações de várias etapas com o estado.
Você pode implantar a camada agente junto com a camada de conhecimento ou por si só. Em uma implantação combinada, os agentes consultam coleções indexadas localmente. Em uma implantação apenas com agentes, os agentes se conectam, em vez disso, a servidores MCP externos.
Para obter mais informações, consulte visão geral da camada agêntica.
Fontes de conhecimento locais
A camada de conhecimento fornece um pipeline de ingestão de dados e RAG pronto para uso, que mantém todos os dados no local. Ele manipula todo o ciclo de vida de seus dados, desde a análise de documentos até a pesquisa de vetor.
Principais capacidades:
- Ingestão de dados – analisar, dividir e inserir documentos de compartilhamentos de arquivos locais com configurações de pipeline personalizáveis.
- Coleções – organizam dados vetoriais em agrupamentos lógicos com ciclo de vida independente e controle de acesso baseado em função do Azure (Azure RBAC) por coleção.
- Vários tipos de pesquisa – escolha entre híbrido, vetor, texto e multimodal híbrido para corresponder às suas necessidades de consulta.
- Portal do desenvolvedor – definir configurações de ingestão, ajustar parâmetros de pesquisa e testar consultas por meio de uma interface da Web local.
O acesso é controlado por meio de Azure RBAC para impedir o acesso não autorizado aos dados ingeridos.
Para obter mais informações, consulte a visão geral de coleções e tipos de pesquisa.
Experiência de chat local
A Recuperação por meio de agentes no Foundry Local inclui uma solução de chat integrada que fornece uma interface pronta para uso para interação com agentes. A solução de chat é um aplicativo React estático servido pelo nginx que se comunica com o runtime de agentes por meio da API de Agentes do Foundry.
A solução de chat fornece:
- Gerenciamento de conversa – crie, renomeie, exclua e navegue por conversas em uma barra lateral.
- Respostas em streaming - respostas do assistente em tempo real via Eventos Enviados pelo Servidor (SSE).
- Citações e fontes – exiba as fontes que o agente usou para gerar cada resposta.
- Authentication - integração Entra ID opcional para entrada do usuário, com autorização baseada em token manipulada pelo back-end.
A solução de chat trata apenas da experiência do navegador. Orquestração de modelo, invocação de ferramenta, validação de token e escopo de dados são tratados pelos serviços de runtime e back-end dos agentes.
Para obter mais informações, consulte Solução de chat em Recuperação por meio de agentes no Foundry Local.
Cenários de cliente e casos de uso
Clientes de todos os setores, como manufatura, serviços financeiros, saúde, governo e defesa, geram e armazenam dados valiosos localmente. A regulação, a latência, a continuidade dos negócios ou o grande volume de dados gerados em tempo real geralmente mantêm esses dados fora da grande nuvem pública. Os clientes desejam usar aplicativos de IA generativos para obter insights sobre esses dados locais.
A recuperação agêntica no Foundry Local oferece suporte a recursos de perguntas e respostas e a conversas agênticas de várias etapas, que permitem aos clientes consultar dados on-premises por meio de agentes de IA em cenários como:
Um cliente governamental deseja derivar insights de dados locais confidenciais para habilitar a tomada de decisões mais rápida, resumir grandes conjuntos de dados, criar materiais de treinamento e muito mais.
Um banco regional deseja usar dados que devem permanecer no local devido a restrições regulatórias para casos de uso, como verificações de conformidade, assistência ao cliente e geração personalizada de pitch de vendas.
Um fabricante global deseja criar assistentes de chão de fábrica para reduzir o tempo para solucionar problemas e ajudar na solução de problemas, usando dados que precisam permanecer locais para cumprir as políticas da organização.
Um provedor de saúde deseja implantar um agente que possa raciocinar em vários documentos clínicos, usando bases de dados de conhecimento e ferramentas mcp para correlacionar registros de pacientes, resultados de laboratório e diretrizes de tratamento.
Uma empresa de energia deseja conectar agentes a várias fontes de dados externas (sistemas SCADA, logs de manutenção, dados meteorológicos) por meio de servidores MCP, sem ingerir todos os dados localmente.
Por que usar a recuperação por meio de agentes no Foundry Local?
Use a recuperação por meio de agentes no Foundry Local para:
- Crie agentes inteligentes que orquestram várias fontes de conhecimento, ferramentas e serviços externos usando o servidor MCP interno e a estrutura de base de dados de conhecimento.
- Reduza o tempo de implantação usando uma experiência pronta para uso que acelera o desenvolvimento e a implantação de aplicativos de IA em dados locais.
- Simplifique as operações e o gerenciamento usando uma solução pronta para a empresa que fornece o mesmo padrão de segurança, conformidade e capacidade de gerenciamento que você espera de Microsoft, incluindo o gerenciamento de ciclo de vida e versão de todos os componentes e integração Microsoft Entra para Azure RBAC.
- Remova a necessidade de conjuntos de habilidades de desenvolvedor separados usando experiências de desenvolvedor consistentes com a nuvem.
- Fique por dentro desse espaço em rápida evolução com a inovação contínua da Microsoft, líder em tecnologias de IA e continue focado na entrega de valor de negócios.
Conceitos principais
Analise os seguintes conceitos-chave para Recuperação por meio de agentes no Foundry Local:
A segmentação divide documentos grandes em blocos de texto menores e mais fáceis de gerenciar (partes).
- Tamanho da parte: o agrupamento divide documentos grandes em unidades menores, com configurações como tamanho de parte (por exemplo, 1000-2000 caracteres) e sobreposição de partes (por exemplo, 100-500 caracteres) controlando sua granularidade e continuidade. Partes menores melhoram a precisão de recuperação, mas podem perder o contexto, enquanto partes maiores garantem um contexto abrangente ao custo da precisão.
- Sobreposição de partes: partes sobrepostas mantêm o contexto entre limites, mas aumentam os requisitos de armazenamento e computação.
As configurações ideais de fragmentos dependem do caso de uso, equilibrando precisão, eficiência e desempenho.
A ingestão de dados é um processo de importação e preparação de conteúdo externo, como documentos ou imagens, a ser usado para recuperação. Isso inclui etapas de pré-processamento, como limpeza, formatação e organização de dados.
Os modelos de inserção transformam texto, imagens ou outros dados em vetores numéricos densos (inserções) que capturam significado semântico. Esses vetores representam relações entre entradas, permitindo comparações de similaridade e clustering.
Inferência refere-se ao processo de uso de um modelo treinado para gerar previsões ou saídas com base em novos dados de entrada. Em modelos de linguagem, a inferência envolve tarefas como concluir texto, responder perguntas ou gerar resumos.
Os modelos de linguagem são sistemas de IA treinados para entender, gerar e manipular a linguagem humana. Eles prevêem texto com base na entrada, habilitando tarefas como geração de texto, tradução, resumo e resposta a perguntas. A Recuperação agêntica no Foundry Local oferece suporte a duas opções de endpoint para modelos de linguagem. A opção recomendada é um ponto de extremidade do Foundry Local no Azure Local. Essa opção é executada no mesmo cluster conectado Azure Arc que a extensão. Você também pode usar um endpoint BYOM (Bring Your Own Model) externo que dá suporte a uma API de conclusão de chat compatível com OpenAI, como um implantado no Microsoft Foundry.
Os parâmetros de modelo controlam como o modelo de linguagem gera texto, como criatividade, diversidade e foco de respostas. Os parâmetros comuns incluem Temperatura e Top-p. Os parâmetros de modelo não afetam quais documentos são recuperados, apenas como o modelo gera sua resposta. Para obter mais informações, consulte Parâmetros do tipo de pesquisa na Recuperação agêntica no Foundry Local.
A consulta é a entrada fornecida a um modelo de linguagem para provocar uma resposta ou executar uma tarefa específica. Pode ser uma pergunta, um prompt ou um conjunto de instruções, dependendo do caso de uso.
Geração Aumentada por Recuperação (RAG) combina um sistema de recuperação com um modelo de linguagem generativo para produzir respostas enriquecidas com conhecimento externo. Ele recupera o contexto relevante de um banco de dados ou repositório de documentos para aumentar os recursos de geração do modelo, garantindo informações precisas e atualizadas.
Parâmetros de pesquisa são configurações que controlam como o Agentic Retrieval no Foundry Local recupera, filtra e classifica documentos dos seus dados indexados antes de passá-los para o modelo de linguagem. Esses parâmetros ajudam você a ajustar a relevância, a precisão e o escopo das informações usadas para responder às consultas do usuário. Para obter mais informações, consulte Parâmetros do tipo de pesquisa na Recuperação agêntica no Foundry Local.
Tipo de pesquisa: Um tipo de pesquisa é o método que o Agentic Retrieval no Foundry Local usa para localizar e classificar informações nos seus dados indexados. Ele determina como o sistema recupera conteúdo relevante para responder perguntas do usuário, como correspondência de palavras-chave, uso de similaridade semântica ou combinação de várias abordagens. A recuperação por meio de agentes no Foundry Local dá suporte a diversos métodos de pesquisa para recuperar informações, inclusive pesquisa de texto completo, pesquisa híbrida, pesquisa híbrida multimodal e pesquisa vetorial. Para obter mais informações, consulte Tipos de busca no Agentic Retrieval no Foundry Local.
Os prompts do sistema são instruções predefinidas ou mensagens fornecidas a um modelo de idioma no início de uma conversa ou tarefa para influenciar seu comportamento. Esses prompts definem a função, o tom ou o contexto específico da tarefa do modelo. Por exemplo, "Você é um assistente útil" ou "Forneça explicações técnicas concisas". Ao moldar o contexto inicial, os prompts do sistema garantem que o modelo gere respostas alinhadas com o objetivo ou persona desejado.
O banco de dados vetor é um banco de dados especializado para armazenar inserções de vetor. Ele foi projetado para lidar com vetores de alta dimensão e permite pesquisas de similaridade rápidas e escalonáveis.
Vetorização significa transformar um texto em representações numéricas ou inserções usando um modelo de inserção, como transformadores de frases. Essas inserções capturam o significado semântico do texto, permitindo comparações eficientes e precisas.
Agent é um assistente de IA configurado com instruções, um endpoint do modelo e, opcionalmente, uma base de conhecimento. Os agentes processam consultas de usuário por meio de conversas de vários turnos, invocando ferramentas e fontes de conhecimento, conforme necessário.
A base de dados de conhecimento é um agrupamento de fontes de conhecimento atribuídas a um agente. Quando o agente processa uma consulta, ele pode acessar todas as fontes de conhecimento em sua base de dados de conhecimento.
A fonte de conhecimento é um registro independente de uma conexão de servidor MCP. Cada fonte de conhecimento carrega seus próprios detalhes de conexão (URL, tipo de autenticação). Dois tipos:
remote_mcppara servidores MCP externos eindexed_sources_mcppara o servidor MCP interno com uma referência de origem indexada específica (por exemplo, um nome de coleção).Coleção é um agrupamento lógico de dados vetoriais ingeridos. Cada coleção corresponde a coleções de vetores do Milvus e tabelas do Postgres, e pode ser criada, consultada e excluída de forma independente.
O MCP (Protocolo de Contexto de Modelo) é um protocolo aberto para conectar agentes de IA a ferramentas externas e fontes de dados. A Recuperação agêntica no Foundry Local inclui um servidor MCP integrado com 6 ferramentas de pesquisa e também pode se conectar a servidores MCP externos.
Thread é uma sessão de conversa entre um usuário e um agente. Os threads contêm mensagens ordenadas e têm como escopo um único usuário.
Run é uma execução de um agente em relação a um thread. O agente lê as mensagens do thread, invoca ferramentas e gera uma resposta. Realiza a execução com suporte a streaming via SSE (Server-Sent Events).
O modo de implantação determina quais camadas são implantadas. Opções:
combined(padrão, plataforma completa),agentic(somente agentes, sem ingestão de dados local),knowledge(somente ingestão de dados e RAG, sem agentes).
Comparar com os serviços de IA no Azure
A Recuperação agêntica no Foundry Local é executada na infraestrutura do cliente fora da nuvem pública, o que permite que os clientes pesquisem seus dados em ambiente local usando a Geração Aumentada por Recuperação (RAG). O plano de dados, incluindo todos os dados do cliente e o modelo de idioma, é hospedado localmente.
Por outro lado, os serviços de IA em Azure como Pesquisa de IA do Azure e Microsoft Foundry também fornecem recursos de RAG, mas são hospedados em grandes regiões de nuvem pública. Os clientes precisam levar seus dados e aplicativos para Azure infraestrutura.
A Recuperação agêntica no Foundry Local oferece experiências de interface do usuário para desenvolvedores locais alinhadas às experiências do Foundry.
Dados locais versus nuvem
A Recuperação agêntica no Foundry Local envia à Microsoft apenas metadados do sistema e informações de identificação da organização, como ID da assinatura e nomes de clusters. Todo o conteúdo do cliente, incluindo documentos ingeridos, inserções, configurações de agente e threads de conversa, sempre permanece na infraestrutura local dentro dos limites de rede definidos pelos clientes.
Funções de usuário
A solução Agentic Retrieval in Foundry Local tem quatro funções de usuário distintas:
- Gerenciamento do ciclo de vida da extensão: Os usuários gerenciam o ciclo de vida do Agentic Retrieval na extensão Foundry Local Arc. Essa função inclui tarefas como configurar a infraestrutura necessária, implantar a extensão, executar atualizações, monitorar seu desempenho e lidar com sua eventual exclusão. Normalmente, essas responsabilidades ficam a cargo de um administrador de TI com acesso à infraestrutura subjacente do Azure Local e do AKS (Serviço de Kubernetes do Azure) no Azure Local.
-
Desenvolvimento e avaliação de agentes e pontos de extremidade de chat: os usuários configuram agentes, bases de conhecimento e fontes de conhecimento; fornecem a fonte de dados; personalizam as configurações do pipeline RAG; fornecem prompts personalizados do sistema; avaliam, monitoram e atualizam a solução. Normalmente, essas responsabilidades vão para um engenheiro de prompt ou um desenvolvedor de aplicativos de IA. Requer a função
EdgeRAGDeveloperEntra ID. - Consumindo o ponto de extremidade para consultar os dados locais: os usuários integram o ponto de extremidade de chat em aplicativos de linha de negócios e usam uma interface de chat, personalizada ou integrada, para consultar os dados locais.
-
Administração da Camada Agentic: os usuários configuram e gerenciam bases de dados de conhecimento e fontes de conhecimento usando a API do Gerenciador de Base de Dados de Conhecimento. Essa função inclui o registro de servidores MCP como fontes de conhecimento, atualização da base de dados de conhecimento padrão e vinculação de fontes de conhecimento a ela. Requer a função
EdgeRAGDeveloperEntra ID.