De inspanning voor redenering bij ophalen instellen (preview)

Opmerking

Azure AI Zoeken is beschikbaar via de Azure-portal, REST API's en Azure-SDK's. Het vormt ook een basis voor Foundry IQ, de beheerde kennislaag die bedrijfsinhoud transformeert in herbruikbare, machtigingsbewuste knowledge bases voor agents in de Microsoft Foundry-portal.

Opmerking

Sommige agentische retrievalfuncties zijn algemeen beschikbaar in de REST API van 2026-04-01. Deze functie blijft echter in preview en vereist een PREVIEW REST API. Preview-functies worden aangeboden zonder service level agreement en worden niet aanbevolen voor productieworkloads. Zie Aanvullende gebruiksvoorwaarden voor Microsoft Azure previews voor meer informatie.

Important

Deze functies en functionaliteit maken deel uit van de REST API 2026-08-01-preview. De preview-versie van 2026-08-01 is aan u gelicentieerd als onderdeel van uw Azure-abonnement en is onderworpen aan de voorwaarden die van toepassing zijn op 'Previews' in de Microsoft Productvoorwaarden, de Microsoft Addendum voor producten en services voor gegevensbescherming ("DPA") en de aanvullende gebruiksvoorwaarden voor Microsoft Azure previews.

De preview-versie van 2026-08-01 ondersteunt verbindingen met andere services van Microsoft-services en services van derden. Het gebruik van deze services is onderhevig aan hun respectieve voorwaarden en kan leiden tot gegevensverwerking of opslag buiten de grens van Azure naleving, evenals gegevens die naar de grens van de Azure naleving stromen.

Het is uw verantwoordelijkheid om te beheren of uw gegevens buiten de nalevings- en geografische grenzen van uw organisatie en eventuele gerelateerde implicaties stromen, en dat de juiste machtigingen, grenzen en goedkeuringen worden ingericht.

U bent verantwoordelijk voor het zorgvuldig beoordelen en testen van toepassingen die u bouwt in de context van uw specifieke use cases en het nemen van alle juiste beslissingen en aanpassingen. Dit omvat het implementeren van uw eigen verantwoorde AI-oplossingen, zoals metaprompts, inhoudsfilters of andere veiligheidssystemen, en ervoor zorgen dat uw toepassingen voldoen aan de juiste kwaliteit, betrouwbaarheid, beveiliging en betrouwbaarheidsstandaarden. Zie de Azure AI Zoeken Transparantienotitie voor meer informatie.

Bij agentisch ophalen kunt u het niveau van LLM-verwerking (Large Language Model) specificeren voor de queryplanning en de antwoordformulering. Gebruik de intensiteit van ophaalredenering (preview-versie) om het verwerkingsniveau van de LLM in te stellen, wat van invloed is op de kosten en latentie. Extra LLM-verwerking verbetert de relevantie, maar het duurt ook langer en maakt gebruik van factureerbare LLM-resources.

U kunt deze eigenschap instellen in een kennisbank of een ophaalverzoek. De instelling voor de Knowledge Base bepaalt de standaardinstelling voor alle query's, terwijl de instelling voor het ophaalverzoek deze standaardwaarde per query overschrijft. Als geen van beide instellingen aanwezig is, gebruikt de service low.

Gebruiksondersteuning

Azure-portal Microsoft Foundry-portal .NET SDK Python SDK Java SDK JavaScript SDK REST API
✔️ ✔️ ✔️ ✔️ ✔️ ✔️ ✔️

Voorwaarden

  • Een bestaande knowledge base met ten minste één kennisbron en een modelconfiguratie.

  • Machtiging om knowledge bases bij te werken en er query's op uit te voeren. Configureer sleutelloze verificatie met de rollen Inzender voor zoekservice en Zoekindexgegevenslezer die zijn toegewezen aan uw gebruikersaccount (aanbevolen) of gebruik een beheerders-API-sleutel.

  • Het nieuwste preview-pakket Azure.Search.Documents: dotnet add package Azure.Search.Documents --prerelease

  • Voor sleutelloze verificatie is het Azure.Identity pakket: dotnet add package Azure.Identity

  • Het nieuwste preview-pakket azure-search-documents: pip install --pre azure-search-documents

  • Voor sleutelloze verificatie is het azure-identity pakket: pip install azure-identity

Kies een redeneringsinspanning

Kies een redenering op basis van de gewenste balans tussen latentie, kosten en ophaaldiepte.

Niveaus van inspanning bij redenering

Niveau Beschrijving Aanbeveling Grenzen
minimal Schakelt LLM-gebaseerde queryplanning uit om de laagste kosten en latentie te bieden voor agentische opvragingen. Het geeft directe tekst- en vectorzoekopdrachten uit in de kennisbronnen die in de knowledge base worden vermeld en retourneert de best overeenkomende passages. Omdat alle kennisbronnen in de knowledge base altijd worden doorzocht en er geen queryuitbreiding wordt uitgevoerd, is gedrag voorspelbaar en eenvoudig te beheren. Dit betekent ook dat de alwaysQueryKnowledgeSource eigenschap voor een ophaalaanvraag wordt genegeerd. Gebruik minimal deze functie voor migraties vanuit de zoek-API of wanneer u de planning van query's zelf wilt beheren.
low De standaardmodus voor het ophalen van agentische gegevens, met één pass van op LLM gebaseerde queryplanning en selectie van kennisbronnen. De agentische ophaalengine genereert subquery's en koppelt deze aan de geselecteerde kennisbronnen en voegt vervolgens de resultaten samen. U kunt antwoordsynthese (preview) inschakelen om een geaard antwoord in natuurlijke taal te produceren met inline bronvermeldingen. Gebruik low deze functie als u een balans wilt tussen minimale latentie en diepere verwerking.
  • 5000 antwoordtokens.
  • Maximaal 50 documenten voor semantische rangschikking en 10 documenten als de semantische classificatie L3 gebruikt.
medium Voegt een dieper zoekproces en een verbeterde ophaalstack toe aan agentisch ophalen om de volledigheid te optimaliseren. Na de eerste zoekopdracht evalueert een semantische classificatie met hoge precisie de opgehaalde documenten. Als de eerste resultaten niet voldoende relevant zijn, voert de service één herhaling uit met behulp van een herzien queryplan. Gebruik medium om het nut van door LLM ondersteunde kennisopvraging te maximaliseren.
  • 10.000 antwoordtokens.
  • Maximaal 50 documenten voor semantische rangschikking en 20 documenten als de semantische classificatie L3 gebruikt.
  • Beschikbaar in bepaalde regio's.
auto Begint met een lichte ophaalronde. Als de eerste pas voldoende gronding biedt, retourneert de service het resultaat. Anders gaat het verder met queryplanning met behulp van een LLM, tot maximaal een gemiddelde inspanning. Gebruik auto wanneer u wilt dat de service voor elk verzoek een balans vindt tussen ophaaldiepte en latentie.

Iteratieve zoekopdracht voor mediumherstel

Een middelmatige inspanning voor ophaalredenering biedt iteratieve zoekopdrachten indien de initiële resultaten niet voldoende relevant zijn. Een extra semantisch classificatiemodel wordt aangeroepen om te bepalen of een tweede iteratie nodig is.

De semantische classificatie:

  • Herkent wanneer er voldoende context is om de vraag te beantwoorden.

  • Nieuwe pogingen bij onvoldoende resultaten, gebruikmakend van bestaande informatie voor context. Nieuwe query's kunnen inzoomen op meer gerichte details of de zoekopdracht uitbreiden. In het activiteitenlogboek in het antwoord ziet u de gegenereerde query's die worden gebruikt voor een uitgebreider antwoord.

  • Herscoren met L3-classificatie. Het bereik is identiek aan L2-classificatie, een absoluut bereik van nul tot en met 4,0.

Er is maar één nieuwe poging. Elke iteratie voegt latentie en kosten toe, dus beperkt het systeem het opnieuw proberen tot één poging. Met een tweede iteratie worden invoertokens toegevoegd aan de querypijplijn, wat het totale aantal factureerbare invoertokens verhoogt.

Iteratie kan bestaande kennisbronnen hergebruiken of verschillende bronnen kiezen. De tweede pas selecteert de meest veelbelovende kennisbron om de ontbrekende informatie te verstrekken.

Regioondersteuning voor gemiddeld ophalen

U kunt een gemiddelde herophalingsinspanning instellen als uw zoekservice zich in een van de volgende regio's bevindt:

  • East US 2
  • Oost-VS
  • Zuid-Centraal VS
  • West US 3
  • West US 2
  • West-VS
  • Duitsland - west-centraal
  • Europa - noord
  • Zwitserland - noord
  • Zweden - centraal
  • Spanje - centraal
  • VK Zuid
  • Korea Centraal
  • Japan Oost
  • Azië - zuidoost

De redeneringsinspanning instellen in een knowledge base

Stel retrievalReasoningEffort in een Knowledge Base-definitie in om de standaardwaarde voor de query's vast te stellen. Voor de auto redenering is een modelconfiguratie vereist. In het volgende voorbeeld blijven de bestaande knowledgeSources en models configuratie behouden, worden de redeneringsinspanningen ingesteld autoen wordt de knowledge base bijgewerkt.

using Azure.Identity;
using Azure.Search.Documents.Indexes;
using Azure.Search.Documents.Indexes.Models;
using Azure.Search.Documents.KnowledgeBases.Models;

var endpoint = new Uri("<search-endpoint>");
var credential = new DefaultAzureCredential();
var knowledgeBaseName = "<knowledge-base-name>";

var indexClient = new SearchIndexClient(endpoint, credential);
var knowledgeBase = (
    await indexClient.GetKnowledgeBaseAsync(knowledgeBaseName)).Value;
knowledgeBase.RetrievalReasoningEffort =
    new KnowledgeRetrievalAutoReasoningEffort();
await indexClient.CreateOrUpdateKnowledgeBaseAsync(knowledgeBase);

Naslaginformatie:KnowledgeBase

Als u een ander niveau wilt gebruiken, vervangt u door KnowledgeRetrievalAutoReasoningEffortKnowledgeRetrievalMinimalReasoningEffort, KnowledgeRetrievalLowReasoningEffortof KnowledgeRetrievalMediumReasoningEffort.

from azure.identity import DefaultAzureCredential
from azure.search.documents.indexes import SearchIndexClient
from azure.search.documents.knowledgebases.models import (
    KnowledgeRetrievalAutoReasoningEffort,
)

endpoint = "<search-endpoint>"
credential = DefaultAzureCredential()
knowledge_base_name = "<knowledge-base-name>"

index_client = SearchIndexClient(endpoint, credential)
knowledge_base = index_client.get_knowledge_base(knowledge_base_name)
knowledge_base.retrieval_reasoning_effort = (
    KnowledgeRetrievalAutoReasoningEffort()
)
index_client.create_or_update_knowledge_base(knowledge_base)

Naslaginformatie:KnowledgeBase

Als u een ander niveau wilt gebruiken, vervangt u door KnowledgeRetrievalAutoReasoningEffortKnowledgeRetrievalMinimalReasoningEffort, KnowledgeRetrievalLowReasoningEffortof KnowledgeRetrievalMediumReasoningEffort.

@api-version = 2026-08-01-preview
@knowledge-base-url = {{search-endpoint}}/knowledgebases/{{knowledge-base-name}}

PUT {{knowledge-base-url}}?api-version={{api-version}}
Content-Type: application/json
Authorization: Bearer {{search-access-token}}

{
  "name": "{{knowledge-base-name}}",
  "knowledgeSources": [
    {
      "name": "{{knowledge-source-name}}"
    }
  ],
  "models": [
    {
      "kind": "azureOpenAI",
      "azureOpenAIParameters": {
        "resourceUri": "{{aoai-endpoint}}",
        "authIdentity": null,
        "deploymentId": "{{model-deployment-name}}",
        "modelName": "{{model-name}}"
      }
    }
  ],
  "retrievalReasoningEffort": {
    "kind": "auto"
  }
}

Naslaginformatie:Kennisbanken - Maken of bijwerken

Als u een ander niveau wilt gebruiken, stelt u in retrievalReasoningEffort.kind op minimal, lowof medium.

De redeneringsinspanning instellen in een ophaalaanvraag

Stel retrievalReasoningEffort in een ophaalaanvraag in om de standaardwaarde van de Knowledge Base voor die aanvraag te overschrijven. In het volgende voorbeeld wordt een bericht verzonden, wordt gebruikt low om de auto standaardwaarde uit de vorige sectie te overschrijven en wordt antwoordsynthese (preview) ingeschakeld.

using Azure.Identity;
using Azure.Search.Documents.KnowledgeBases;
using Azure.Search.Documents.KnowledgeBases.Models;

var endpoint = new Uri("<search-endpoint>");
var credential = new DefaultAzureCredential();
var knowledgeBaseName = "<knowledge-base-name>";

var kbClient = new KnowledgeBaseRetrievalClient(
    endpoint, knowledgeBaseName, credential);
var request = new KnowledgeBaseRetrievalRequest
{
    RetrievalReasoningEffort =
        new KnowledgeRetrievalLowReasoningEffort(),
    OutputMode = KnowledgeRetrievalOutputMode.AnswerSynthesis
};

request.Messages.Add(
    new KnowledgeBaseMessage(
        content: new[] {
            new KnowledgeBaseMessageTextContent("What is the return policy?")
        }
    ) { Role = "user" }
);

var result = await kbClient.RetrieveAsync(request);

Naslaginformatie:KnowledgeBaseRetrievalRequest

from azure.identity import DefaultAzureCredential
from azure.search.documents.knowledgebases import KnowledgeBaseRetrievalClient
from azure.search.documents.knowledgebases.models import (
    KnowledgeBaseMessage,
    KnowledgeBaseMessageTextContent,
    KnowledgeBaseRetrievalRequest,
    KnowledgeRetrievalOutputMode,
    KnowledgeRetrievalLowReasoningEffort,
)

endpoint = "<search-endpoint>"
credential = DefaultAzureCredential()
knowledge_base_name = "<knowledge-base-name>"

kb_client = KnowledgeBaseRetrievalClient(
    endpoint,
    credential,
    knowledge_base_name=knowledge_base_name,
)
request = KnowledgeBaseRetrievalRequest(
    messages=[
        KnowledgeBaseMessage(
            role="user",
            content=[
                KnowledgeBaseMessageTextContent(
                    text="What is the return policy?"
                )
            ],
        )
    ],
    retrieval_reasoning_effort=KnowledgeRetrievalLowReasoningEffort(),
    output_mode=KnowledgeRetrievalOutputMode.ANSWER_SYNTHESIS,
)

result = kb_client.retrieve(request)

Naslaginformatie:KnowledgeBaseRetrievalRequest

@api-version = 2026-08-01-preview
@retrieve-url = {{search-endpoint}}/knowledgebases/{{knowledge-base-name}}/retrieve

POST {{retrieve-url}}?api-version={{api-version}}
Content-Type: application/json
Authorization: Bearer {{search-access-token}}

{
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "text",
          "text": "What is the return policy?"
        }
      ]
    }
  ],
  "retrievalReasoningEffort": {
    "kind": "low"
  },
  "outputMode": "answerSynthesis"
}

Naslaginformatie:Kennis ophalen - Ophalen

De ophaalaanvraag retourneert een geaard antwoord op basis van de kennisbronnen die zijn geconfigureerd in de knowledge base.