Agenckie wyszukiwanie w Wyszukiwanie AI platformy Azure

Uwaga

Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.

Uwaga

Niektóre funkcje wyszukiwania agentowego są ogólnie dostępne w interfejsie API REST 2026-04-01 za pośrednictwem dostępu programistycznego. Portal Azure i Microsoft Foundry nadal zapewniają dostęp wyłącznie do wersji zapoznawczej wszystkich funkcji odzyskiwania agentów. Aby uzyskać wskazówki dotyczące migracji, w tym podział informacji o ogólnie dostępnych funkcjach i tych, które pozostają w wersji zapoznawczej, zobacz Migrowanie kodu agenta do najnowszej wersji.

Jeśli zdecydujesz się użyć interfejsu API REST w wersji zapoznawczej, możesz uzyskać dostęp do funkcji wyszukiwania agentowego, które nie są jeszcze ogólnie dostępne. Funkcje w wersji zapoznawczej są udostępniane bez umowy dotyczącej poziomu usług i nie są zalecane w przypadku obciążeń produkcyjnych. Aby uzyskać więcej informacji, zobacz Warunki dodatkowe korzystania z testowych wersji Microsoft Azure.

Important

Te funkcje i możliwości stanowią część interfejsu API REST 2026-08-01-preview. Licencja 2026-08-01-preview jest licencjonowana na Ciebie w ramach subskrypcji Azure i podlega warunkom mającym zastosowanie do "wersji zapoznawczych" w warunkach produktu Microsoft, dodatku Microsoft Products and Services Data Protection ("DPA") oraz uzupełniających warunków użytkowania dla wersji zapoznawczych Microsoft Azure.

Wersja zapoznawcza 2026-08-01 obsługuje połączenia z innymi usługami usługi firmy Microsoft i usługami innych firm. Korzystanie z tych usług podlega odpowiednim warunkom i może spowodować przetwarzanie lub przechowywanie danych poza granicą zgodności Azure, a także dane przepływające do granicy zgodności Azure.

Do Ciebie należy decydowanie o tym, czy dane będą przepływać poza granice zgodności i granice geograficzne organizacji, oraz o wszelkich związanych z tym konsekwencjach, a także zapewnienie odpowiednich uprawnień, ograniczeń i zatwierdzeń.

Odpowiadasz za staranne przeglądanie i testowanie aplikacji, które tworzysz w kontekście konkretnych przypadków użycia, oraz podejmowanie wszelkich odpowiednich decyzji i dostosowań. Obejmuje to implementowanie własnych odpowiedzialnych środków zaradczych dotyczących sztucznej inteligencji, takich jak metaprompty, filtry zawartości lub inne systemy bezpieczeństwa oraz zapewnienie, że aplikacje spełniają odpowiednią jakość, niezawodność, bezpieczeństwo i standardy wiarygodności. Aby uzyskać więcej informacji, zobacz Wyszukiwanie AI platformy Azure Transparency Note.

W Wyszukiwanie AI platformy Azure agentowe pobieranie to proces z wieloma zapytaniami zaprojektowany dla złożonych pytań zadawanych przez użytkowników lub agentów w aplikacjach czatu i Copilot. Jest ona przeznaczona do pobierania wzorców rozszerzonej generacji (RAG) i przepływów pracy agenta do agenta.

Oto, na czym polega wyszukiwanie agentowe:

  • Można użyć dużego modelu językowego (LLM), aby podzielić złożone zapytanie na mniejsze, bardziej ukierunkowane podzapytania, co pozwala lepiej objąć treści własne i zewnętrzne. Podzapytania mogą zawierać historię czatów na potrzeby dodatkowego kontekstu.

  • Uruchamia podzapytania równolegle. Każde podzapytanie jest semantycznie przebudowane, aby zwiększyć poziom najbardziej odpowiednich dopasowań.

  • Łączy najlepsze wyniki w jedną spójną odpowiedź, której model LLM może użyć do wygenerowania odpowiedzi opartych na źródłach.

  • Może zwracać odwołania do źródeł i dziennik aktywności wraz z połączoną zawartością, dzięki czemu można wykorzystać wyłącznie dane źródłowe lub przekazać je do LLM, aby uzyskać pełną odpowiedź.

Ten wysokowydajny proces pomaga generować wysokiej jakości dane ugruntowujące lub odpowiedzi dla aplikacji czatowej, umożliwiając szybkie udzielanie odpowiedzi na złożone pytania.

Dlaczego warto używać wyszukiwania agentowego?

Wyszukiwanie agentowe obsługuje zarówno rozwiązania zarządzane, jak i niestandardowe dla agentów i aplikacji. W portalu Microsoft Foundry zasila ona funkcję Foundry IQ jako zarządzaną warstwę wiedzy dla agentów. Można również tworzyć niestandardowe rozwiązania agentowego wyszukiwania przy użyciu portalu Azure, interfejsu API REST usługi Search lub obsługiwanego zestawu Azure SDK.

Użyj wyszukiwania agentowego, jeśli chcesz zapewnić agentom i aplikacjom najbardziej trafne treści do udzielania odpowiedzi na trudniejsze pytania, korzystając z kontekstu czatu, zasobów własnych i źródeł zewnętrznych.

Wyszukiwanie agentowe zwiększa opóźnienie w porównaniu z potokiem opartym na pojedynczym zapytaniu, ale radzi sobie ze złożonością zapytań, której pojedyncze zapytanie nie jest w stanie obsłużyć. Może na przykład obsługiwać następujące elementy:

  • Pytania zawierające wiele próśb, takie jak „znajdź mi hotel w pobliżu plaży, z transferem z lotniska i w odległości krótkiego spaceru od restauracji wegetariańskich.”

  • Pytania, które zależą od wcześniejszego kontekstu w konwersacji.

  • Zapytania, które zyskują na przeformułowaniu, z wykorzystaniem map synonimów i parafrazowania generowanego przez LLM w celu zwiększenia pokrycia w całej treści.

  • Błędy ortograficzne.

Diagram skomplikowanego zapytania pokazujący, jak agentowe odzyskiwanie obsługuje kontekst domniemany i celowe literówki.

Architektura i przepływ pracy

Proces pozyskiwania poprzez agencję działa w następujący sposób:

  1. Inicjowanie przepływu pracy: Aplikacja wywołuje bazę wiedzy z akcją pobierania, która udostępnia historię zapytań i konwersacji.

  2. Planowanie zapytań: Przy poziomach wysiłku rozumowania podczas wyszukiwania low i medium baza wiedzy wysyła Twoje zapytanie oraz historię rozmowy do modelu LLM, który generuje ukierunkowane podzapytania. Przy minimal nakładzie pracy ten krok jest pomijany, a zapytania są kierowane bezpośrednio do źródeł wiedzy. Nakład wnioskowania domyślnie ma wartość low i jest konfigurowany w bazie wiedzy.

  3. Wykonywanie zapytania: Baza wiedzy wysyła podzapytania do źródeł wiedzy. Wszystkie podzapytania są uruchamiane jednocześnie i mogą być słowami kluczowymi, wektorami lub wyszukiwaniem hybrydowym. Każde podzapytanie przechodzi proces semantycznego ponownego rankingowania w celu znalezienia najbardziej odpowiednich dopasowań. Referencje są wyodrębniane i przechowywane do celów cytowania.

  4. Synteza wyników: System łączy wszystkie wyniki w ujednoliconą odpowiedź. Połączona zawartość zawsze jest zwracana. Referencje źródłowe i dziennik aktywności wykonania są opcjonalne.

Diagram przepływu pracy pobierania agentów przy użyciu przykładowego zapytania.

Components

We wszystkich scenariuszach agentowego wyszukiwania wymagana jest baza wiedzy i co najmniej jedno źródło wiedzy. Inne składniki są opcjonalne i zależą od konfiguracji.

Składnik Usługi Roli
Baza wiedzy Wyszukiwanie AI platformy Azure Orkiestruje pipeline, zarządzając źródłami wiedzy i parametrami zapytań.
Źródło wiedzy Wyszukiwanie AI platformy Azure Definiuje treść używaną w potoku przetwarzania. Może być indeksowany (wspierany przez indeks wyszukiwania w usłudze) lub zdalny (zawartość pobierana w czasie zapytania z platformy zewnętrznej).
Indeks wyszukiwania Wyszukiwanie AI platformy Azure Przechowuje zawartość z możliwością wyszukiwania (tekst i wektory) przy użyciu konfiguracji semantycznej. Określa, które typy zapytań są uruchamiane i które optymalizacje mają zastosowanie. Wymagane tylko dla indeksowanych źródeł wiedzy.
Ranga semantyczna Wyszukiwanie AI platformy Azure Używany wewnętrznie przez potok wyszukiwania agentowego do ponownego szeregowania wyników według trafności (L2 reranking).
LLM (Magister Prawa) Azure OpenAI Planuje zapytania i wybiera źródła wiedzy. Używane tylko przy wysiłku wnioskowania przy pobieraniu low i medium. Pomijane przy wysiłku minimal.

Wymagania dotyczące integracji

Aplikacja steruje potokiem, wywołując bazę wiedzy i obsługując odpowiedź. Potok przetwarzania zwraca dane źródłowe, które można przekazać do modelu LLM w celu generowania odpowiedzi lub wykorzystać je bezpośrednio w interfejsie konwersacyjnym. Aby uzyskać szczegółowe informacje na temat implementacji, zobacz Samouczek: tworzenie kompletnego rozwiązania do autonomicznego pobierania.

Dostępność i cennik

Pobieranie danych agentowych jest dostępne w wybranych regionach. Źródła wiedzy i bazy wiedzy mają również maksymalne limity , które różnią się w zależności od warstwy cenowej i nakładu pracy podczas pobierania.

Fakturowanie

Odczytywanie agenta powoduje obciążenie opłatami przez dwa serwisy.

  • Wyszukiwanie AI platformy Azure obciąża za tokeny wyszukiwania zużyte w trakcie wykonywania podzapytania i rankingu semantycznego. Plan bezpłatny (wartość domyślna) zapewnia miesięczny limit tokenu. Plan standardowy umożliwia korzystanie z cennika z płatnością zgodnie z rzeczywistym użyciem po zużyciu bezpłatnego przydziału. Aby uzyskać więcej informacji, zobacz Włączanie lub wyłączanie rozliczeń za agentów.

  • Azure OpenAI rozlicza za tokeny wejściowe i wyjściowe używane w planowaniu zapytań opartych na LLM i syntezie odpowiedzi. Ceny zależą od rzeczywistego zużycia i są oparte na modelu przypisanym do bazy wiedzy. Opłaty są wyświetlane na rachunku za Azure OpenAI. Aby uzyskać stawki, zobacz cennik Azure OpenAI.

W poniższej tabeli porównujemy rozliczenia kosztów między klasycznym potokiem pojedynczego zapytania a potokiem wielokrotnego zapytania przy użyciu agenta. W klasycznym potoku składnikiem podlegającym opłatom jest semantyczny ranker.

Aspekt Potok klasyczny Powołaniowe pobieranie
Jednostki Oparte na zapytaniach Oparte na tokenach
Koszt na jednostkę Jednolity koszt zapytania Zmienny koszt tokenu (zależy od nakładu pracy umysłowej)
Szacowanie kosztów Szacowanie liczby zapytań Szacowanie użycia tokenu
Bezpłatny zasiłek Miesięczny limit bezpłatnych zapytań Miesięczny bezpłatny przydział tokenów

Przykład: Szacowanie kosztów

Ten przykład pomaga zilustrować proces szacowania kosztów na potrzeby planowania zapytań i wykonywania zapytań, ale nie syntezy odpowiedzi. Koszty mogą być niższe. Aby uzyskać aktualne stawki, zobacz cennik Wyszukiwanie AI platformy Azure i cennik Azure OpenAI.

Aby oszacować koszty planu zapytania w modelu płatności za rzeczywiste użycie w usłudze Azure OpenAI, załóżmy, że gpt-4o-mini:

  • 15 centów za 1 milion tokenów wejściowych.
  • 60 centów za 1 milion tokenów wyjściowych.
  • 2000 tokenów wejściowych dla średniego rozmiaru konwersacji na czacie.
  • 350 tokenów dla średniego rozmiaru planu wyjściowego.

Szacowane koszty rozliczeń związane z wykonywaniem zapytań

Aby oszacować liczbę tokenów pobierania agenta, zacznij od pojęcia, jak wygląda średni dokument w indeksie. Możesz na przykład przybliżyć następujące elementy:

  • 10 000 fragmentów, gdzie każdy fragment jest jednym do dwóch akapitów pliku PDF.
  • 500 tokenów na fragment.
  • Każde podzapytanie ponownie klasyfikuje do 50 fragmentów.
  • Średnio istnieją trzy podzapytania na plan zapytania.

Obliczanie ceny wykonania

  1. Załóżmy, że przeprowadzamy 2000 agentowych pobrań z trzema podzapytaniami na każdy plan. Daje nam to około 6000 łącznych zapytań.

  2. Przerysuj 50 fragmentów na podzapytanie, czyli 300 000 całkowitych fragmentów.

  3. Średni fragment to 500 tokenów, więc łączna liczba tokenów do ponownej oceny wynosi 150 milionów.

  4. Biorąc pod uwagę hipotetyczną cenę 0,022 za token, łączne koszty ponownego rankingowania wynoszą 3,30 USD w dolarach amerykańskich.

  5. Przejście do kosztów planu zapytania: 2000 tokenów wejściowych pomnożonych przez 2000 agentowych pobrań daje 4 miliony tokenów wejściowych, co przekłada się na łącznie 60 centów.

  6. Oszacuj koszty wyjściowe na podstawie średnio 350 tokenów. Jeśli pomnożymy 350 przez 2000 odczytów agentów, otrzymamy łącznie 700 000 tokenów wyjściowych, co daje łączny koszt 42 centów.

Łącząc to wszystko, zapłacisz około 3,30 USD za pobieranie agentów w usłudze Wyszukiwanie AI platformy Azure, 60 centów za tokeny wejściowe w usłudze Azure OpenAI oraz 42 centy za tokeny wyjściowe w usłudze Azure OpenAI, co daje łączną kwotę 1,02 USD za planowanie zapytań. Łączny koszt pełnego wykonania wynosi 4,32 USD.

Porady dotyczące kontrolowania kosztów

  • Przejrzyj dziennik aktywności w odpowiedzi, aby dowiedzieć się, jakie zapytania skierowano do jakich źródeł oraz jakie parametry użyto. Możesz powtórzyć te zapytania względem swoich indeksów i użyć publicznego tokenizatora do oszacowania tokenów i porównania z wykorzystaniem raportowanym przez API. Dokładna rekonstrukcja zapytania lub odpowiedzi nie jest jednak gwarantowana. Czynniki obejmują typ źródła wiedzy, takie jak publiczne dane internetowe lub zdalne SharePoint źródło wiedzy, które jest oparte na tożsamości użytkownika, które może mieć wpływ na reprodukcję zapytań.

  • Zmniejsz liczbę źródeł wiedzy (indeksy); konsolidacja zawartości może obniżyć zakres fan-out i ilość tokenów.

  • Obniż wysiłek związany z rozumowaniem, aby zmniejszyć wykorzystanie LLM podczas planowania i rozszerzania zapytań (wyszukiwanie iteracyjne).

  • Organizuj zawartość, aby można było znaleźć najbardziej istotne informacje z mniejszą liczbą źródeł i dokumentów (na przykład wyselekcjonowanych podsumowań lub tabel).

Jak rozpocząć

Aby utworzyć rozwiązanie wyszukiwania agentowego, możesz użyć portalu Azure, nowego portalu Microsoft Foundry, interfejsów API REST lub równoważnego pakietu SDK platformy Azure.

Następny krok