Qu’est-ce qu’une source de connaissances ?

Note

Recherche Azure AI est disponible via le portail Azure, les API REST et les SDK Azure. Il sous-tend également Foundry IQ, la couche de connaissances managée qui transforme le contenu d’entreprise en bases de connaissances réutilisables et prenant en charge les autorisations pour les agents dans le portail Microsoft Foundry.

Note

Certaines fonctionnalités de récupération agentique sont généralement disponibles dans l’API REST 2026-04-01 via l’accès par programmation. Le portail Azure et le portail Microsoft Foundry continuent de fournir un accès en préversion uniquement à toutes les fonctionnalités de récupération agentique. Pour obtenir des conseils sur la migration, notamment une répartition des éléments généralement disponibles et ceux qui restent en version préliminaire, consultez Migrer le code de récupération agentique vers la dernière version.

Si vous choisissez d’utiliser une API REST en préversion, vous pouvez accéder aux fonctionnalités de récupération agentiques qui ne sont pas encore en disponibilité générale. Les fonctionnalités en préversion sont fournies sans contrat de niveau de service et ne sont pas recommandées pour les charges de travail de production. Pour plus d’informations, consultez Conditions d'utilisation supplémentaires pour les versions préliminaires de Microsoft Azure.

Important

Ces fonctionnalités font partie de l’API REST 2026-08-01-preview. La préversion 2026-08-01 vous est concédée sous licence dans le cadre de votre abonnement Azure et est soumise aux conditions applicables aux « préversions » dans les Microsoft Conditions d’utilisation du produit, l’addenda sur la protection des données des produits et des services Microsoft (« DPA ») et les conditions d’utilisation supplémentaires pour les préversions Microsoft Azure.

La préversion 2026-08-01 prend en charge les connexions à d’autres services Microsoft et à des services tiers. L’utilisation de ces services est soumise à leurs conditions respectives et peut entraîner le traitement ou le stockage des données en dehors de la limite de conformité Azure, ainsi que des données entrant dans la limite de conformité Azure.

Vous êtes responsable de l’examen et du test des applications que vous créez dans le contexte de vos cas d’usage spécifiques et de prendre toutes les décisions et personnalisations appropriées. Cela inclut l’implémentation de vos propres atténuations d’IA responsables, telles que les métaprompts, les filtres de contenu ou d’autres systèmes de sécurité, et la garantie que vos applications répondent aux normes de qualité, de fiabilité, de sécurité et de fiabilité appropriées. Pour plus d’informations, consultez la note de transparence Recherche Azure AI.

Une source de connaissances est une ressource de niveau supérieur sur votre service Recherche Azure AI qui définit le contenu utilisé dans un pipeline de récupération agentique. Chaque source de connaissances est indexée ou distante, qui détermine la façon dont le contenu est ingéré, traité et interrogé. Les sources de connaissances sont des composants requis d’une base de connaissances.

Vous pouvez référencer plusieurs sources de connaissances dans une base de connaissances unique. Le moteur de récupération agentique les interroge tous dans une seule requête. Les sous-requêtes sont générées pour chaque source de connaissances et les résultats principaux sont retournés dans la réponse de récupération.

Sources de connaissances prises en charge

Recherche Azure AI prend en charge les sources de connaissances suivantes pour les charges de travail de récupération agentique.

Genre Description Indexé ou distant
Index de recherche Enveloppe un index existant. Indexé
Blob Azure Génère un pipeline d’indexation à partir d’un conteneur Blob. Indexé
Azure SQL (préversion) Génère un pipeline d’indexeur à partir d’une table ou d’une vue Azure SQL. Indexé
Fichier (préversion) Charge les fichiers directement dans Recherche Azure AI. Indexé
OneLake Génère un pipeline d'indexeur à partir d'un lakehouse. Indexé
SharePoint indexé (préversion) Génère un pipeline d’indexeur à partir d’un site SharePoint. Indexé
SharePoint à distance (préversion) Récupère le contenu de SharePoint. Remote
Fabric Data Agent (préversion) Récupère des réponses et des ressources incorporées à partir d’un agent de données Microsoft Fabric. Remote
Fabric Ontology (préversion) Récupère des réponses basées sur des entités et des relations à partir d’une ontologie Microsoft Fabric. Remote
Serveur MCP (préversion) Récupère les résultats dynamiques et soutenus par les outils à partir d’un serveur MCP externe. Remote
Work IQ (préversion) Récupère l’intelligence organisationnelle à partir de Work IQ. Remote
Web Récupère des données d’ancrage en temps réel depuis Microsoft Bing. Remote

Sources de connaissances indexées

Une source de connaissances indexée pointe vers un index de recherche qui répond aux critères de récupération agentique. Le contenu est ingéré dans l’index avant l’heure de la requête via l’un des trois chemins d’accès :

  • Apportez votre propre index : Utilisez une source de connaissances d’index de recherche pour encapsuler un index existant sur votre service de recherche.

  • Chargement direct de fichiers : Utilisez une source de connaissances de fichier pour charger des fichiers directement dans Recherche Azure AI. Le service traite les fichiers et stocke le contenu extrait dans un index de recherche généré, sans pipeline de stockage ou d’indexeur externe requis.

  • Pipeline d’indexeur généré automatiquement : Pour toutes les autres sources de connaissances indexées, Recherche Azure AI crée automatiquement un pipeline d’indexeur complet à partir de votre source de données externe. Cela inclut une source de données, un ensemble de compétences, un indexeur et un index renseignés et segmentés.

Les requêtes s’exécutent localement sur votre service de recherche à l’aide d’un texte intégral (mot clé), d’un vecteur ou d’une requête hybride.

Étant donné qu’une source de connaissances indexée dispose d’un index de recherche sous-jacent, les références dans la réponse peuvent inclure des URL de citation générées par le service (version préliminaire) qui renvoient à leurs documents dans l’index. Les sources de connaissances distantes n’ont pas d’index de stockage. Elles ne retournent donc pas d’URL de citation.

Sources de connaissances distantes

Une source de connaissances distante se connecte directement à une plateforme externe. Le contenu n’est jamais ingéré dans Recherche Azure AI. Au lieu de cela, il est récupéré au moment de la requête via les API natives de chaque plateforme. Le moteur de récupération agentique effectue l’appel d’API et affiche les résultats en même temps que toutes les sources de connaissances indexées dans la même réponse.

Selon la plateforme, les connexions à distance atteignent le contenu via l’Internet public (par exemple Bing) ou au sein de votre locataire Microsoft (par exemple, SharePoint et Fabric).

Classement unifié

Pour les sources de connaissances indexées et distantes, tous les contenus récupérés transitent par le même pipeline de classement. Les résultats sont évalués pour la pertinence, fusionnés entre les requêtes et reclassés avant de retourner dans la réponse de récupération.

Utilisation de sources de connaissances

Les sources de connaissances sont des objets indépendants que vous créez et gérez séparément des bases de connaissances. N'oubliez pas les éléments suivants :

  • Créez une source de connaissances avant de créer une base de connaissances. Les bases de connaissances référencent les sources de connaissances par ID, de sorte que la source de connaissances doit exister en premier.

  • Pour supprimer une source de connaissances, commencez par mettre à jour ou supprimer toutes les bases de connaissances qui le référencent. Vous pouvez ensuite supprimer la source de connaissances.

  • Une source de connaissances et sa base de connaissances doivent exister sur le même service de recherche.

Création de sources de connaissances

La prise en charge de la création dans le portail Azure, le portail Microsoft Foundry, l’API REST et les SDK Azure varient selon le type de source de connaissances. Pour obtenir des instructions par type, consultez les liens dans les sources de connaissances prises en charge.

Ingérer les étiquettes de confidentialité (préversion)

Pour les sources de connaissances Blob, OneLake indexé et SharePoint indexé, vous pouvez ingérer les étiquettes de confidentialité Microsoft Purview en définissant ingestionPermissionOptions de manière à inclure sensitivityLabel. Suivez toutes les conditions préalables avant de définir cette valeur. Une fois synchronisées avec l’index, les étiquettes sont exposées dans les réponses récupérées et utilisées pour appliquer l’accès au niveau du document au moment de la requête. Pour plus d’informations, consultez Appliquer les autorisations au moment de la requête (préversion).

Si votre source de connaissances indexée utilise un index découpé en segments, par exemple avec une vectorisation intégrée ou une compétence personnalisée de fractionnement de texte, vous devez également associer l’étiquette de sensibilité à chaque ligne de segment via les projections d’index dans le jeu de compétences. Sinon, les références de niveau bloc dans les réponses de retrieve ne seront pas renvoyées si elles comportent des étiquettes dans le document source.

Afficher les images intégrées aux documents (version préliminaire)

Pour les sources de connaissances Blob, OneLake indexé et SharePoint indexé, vous pouvez configurer un assetStore dans le ingestionParameters de la source de connaissances afin de conserver les images incorporées dans vos documents sources. Lorsque vous activez également la diffusion d’images pour la base de connaissances, l’action retrieve injecte ces images dans l’invite de synthèse de la réponse afin que le LLM puisse raisonner sur les diagrammes, les graphiques et le contenu extrait des images. Pour plus d’informations, consultez Afficher les images intégrées au document dans la récupération agentique (préversion).

Ne configurez pas assetStore et ingestionPermissionOptions sur la même source de connaissances. La diffusion d’images n’est pas prise en charge lorsque ingestionPermissionOptions est configuré.

Restreindre l’ingestion à un réseau privé (version préliminaire)

À partir de la version de l’API, les sources de connaissances 2026-08-01-preview, SharePoint indexé et Azure SQL indexé prennent en charge l’exécution privée de l’indexeur. Pour les objets blob et les Azure SQL, les liaisons privées partagées approuvées peuvent protéger la connexion source et les dépendances Azure. SharePoint Online n'est pas une cible de liaison privée partagée. Par conséquent, le mode privé s'applique uniquement à ses dépendances de Azure protégées.

Actuellement, la synchronisation privée n’est pas prise en charge pour les sources de connaissances OneLake indexées.

Utilisation de sources de connaissances

Après avoir créé une source de connaissances, référencez-la dans une base de connaissances. La base de connaissances détermine les sources de connaissances à interroger. Les sections suivantes décrivent les options permettant de contrôler les sources incluses et la façon dont le moteur les sélectionne.

Interroger toujours une source de connaissances

Définissez alwaysQuery sur true dans une définition de source de connaissances pour l’inclure dans chaque requête, quel que soit le niveau d’effort de raisonnement appliqué à la récupération.

Utiliser l’effort de raisonnement pour la recherche afin de contrôler l’utilisation des LLM (version préliminaire)

L’effort de raisonnement de récupération contrôle la quantité de traitement LLM appliquée à chaque requête. Toutes les solutions ne bénéficient pas de la planification des requêtes LLM. Si la simplicité et la rapidité priment, utilisez l’option minimal pour ignorer le traitement par LLM. Aux niveaux d'effort low et medium, le LLM planifie et sélectionne les sources de connaissances à interroger, medium ajoutant un passage itératif pour obtenir des résultats plus approfondis. Pour plus d’informations sur chaque niveau, consultez Définir l’effort de raisonnement de récupération (version préliminaire).

Les facteurs suivants entrent en ligne de compte dans la sélection pour les niveaux d’effort low et medium :

  • Le name de la source de connaissances.

  • Le description d’un index (pour les sources de connaissances indexées).

  • retrievalInstructions Spécifié dans la définition de la base de connaissances ou l’action de récupération. Les instructions de récupération guident les sources de connaissances que le LLM sélectionne ou ignore. Ils fonctionnent comme un prompt : vous pouvez définir le niveau de concision, le ton et la mise en forme.