Az Azure AI Keresés szemantikai rangsora

Megjegyzés

Azure AI Keresés a Azure portálon, REST API-kon és Azure SDK-k keresztül érhető el. Emellett a Foundry IQ-t is támogatja, amely a vállalati tartalmakat újrafelhasználható, engedélytudatos tudásbázisokká alakítja át az Microsoft Foundry portálon található ügynökök számára.

A Azure AI Keresés semantic ranker egy olyan funkció, amely mérhetően javítja a keresési relevanciát, ha Microsoft nyelvértési modelljeit használja a keresési eredmények újraírására. A szemantikai rangsorolót az agentikus lekérésbe is beépítették. Ez a cikk egy magas szintű bevezetés a szemantikai rangsoroló viselkedésének és előnyeinek megértéséhez.

A szemantikai rangsoroló egy prémium szolgáltatás, amelyet használat alapján számlázunk ki, de ingyenesen használhatja, az ingyenes szint szolgáltatási korlátainak függvényében. Ezt a cikket a háttérhez ajánljuk, de ha inkább az első lépéseket szeretné elvégezni, kövesse az alábbi lépéseket.

Mi az a szemantikai rangsor?

A szemantikai rangsoroló olyan lekérdezésoldali képességek gyűjteménye, amelyek javítják a szövegalapú lekérdezések, a vektoros lekérdezések szöveges része és a hibrid lekérdezések kezdeti BM25-rangsorolt vagy RRF-rangsorolt keresési eredményeinek minőségét. A szemantikai rangsorolás háromféleképpen bővíti a lekérdezés-végrehajtási folyamatot:

  • Először is mindig másodlagos rangsort ad hozzá egy kezdeti eredményhalmazhoz, amelyet a BM25 vagy a Reciprocal Rank Fusion (RRF) használatával pontoznak. Ez a másodlagos rangsor többnyelvű, mélytanulási modelleket használ, amelyek a Microsoft Bing technológiáján alapulnak a szemantikailag legrelevánsabb eredmények népszerűsítése érdekében.

  • Másodszor, visszaadja a feliratokat, és opcionálisan válaszokat nyer ki a válaszban, amelyeket megjeleníthet egy keresési oldalon a felhasználó keresési élményének javítása érdekében.

  • Harmadszor, ha engedélyezi a lekérdezés újraírását, az egy kezdeti lekérdezési sztringet több szemantikailag hasonló lekérdezési sztringre bontja ki.

A másodlagos rangsorolás és a "válaszok" a lekérdezési válaszra vonatkoznak. A lekérdezés újraírása a lekérdezési kérelem része.

A szemantikai rangsoroló a következő képességekkel rendelkezik:

Képesség Leírás
L2 rangsorolás A lekérdezés kontextusát vagy szemantikai jelentését használja egy új relevanciapont kiszámításához az előre megadott eredményekhez.
Szemantikai feliratok és kiemelések Szó szerinti mondatokat és kifejezéseket nyer ki olyan mezőkből, amelyek a legjobban összefoglalják a tartalmat, és kiemeli a főbb részeket a könnyű vizsgálat érdekében. Az eredményeket összegző feliratok akkor hasznosak, ha az egyes tartalommezők túl sűrűek a keresési eredmények oldalához. A kiemelt szöveg kiemeli a legrelevánsabb szavakat és kifejezéseket, hogy a felhasználók gyorsan megállapíthassák, miért tekintették relevánsnak a megfelelést.
Szemantikai válaszok Egy szemantikai lekérdezésből visszaadott opcionális és extra alstruktúra. Közvetlen választ ad egy kérdésnek tűnő lekérdezésre. Megköveteli, hogy egy dokumentumnak a válasz jellemzőivel rendelkező szöveggel kell rendelkeznie.
Lekérdezés újraírása A szöveges lekérdezések vagy a vektoros lekérdezések szöveges részének használatával a szemantikai rangsoroló a lekérdezés legfeljebb 10 variánsát hozza létre, esetleg kijavíthatja az elírásokat vagy a helyesírási hibákat, vagy újraformázhatja a lekérdezést a létrehozott szinonimák használatával. Az újraírt lekérdezés a keresőmotoron fut. Az eredményeket BM25 vagy RRF módszerrel értékeli, majd a szemantikai rangsoroló újraértékeli.

A szemantikai rangsoroló működése

A szemantikai rangsoroló lekérdezést és eredményeket használ, majd elküldi őket a Microsoft által üzemeltetett nyelvértelmező modelleknek. Jobb találatokat keres.

Az alábbi ábra a koncepciót ismerteti. Vegye figyelembe a "tőke" kifejezést. Különböző jelentéssel rendelkezik attól függően, hogy a kontextus pénzügyi, jogi, földrajzi vagy nyelvtani. A nyelvi megértés révén a szemantikai rangsoroló észleli a kontextust, és előlépteti a lekérdezési szándéknak megfelelő eredményeket.

A környezet vektoros ábrázolásának ábrája.

A szemantikai rangsorolás sok erőforrást és időt használ. A lekérdezési művelet várt késésén belüli feldolgozás befejezéséhez a rendszer összevonja és csökkenti a szemantikai rangsoroló bemeneteit. Ez a megközelítés segít a lehető leggyorsabban végrehajtani az újrarankálási lépést.

A szemantikai rangsor három lépésből áll:

  1. Bemenetek gyűjtése és összegzése
  2. Pontozza az eredményeket a szemantikai rangsorolóval
  3. Újra értékelt eredmények, feliratok és válaszok kimenete

Hogyan gyűjti és összegzi a rendszer a bemeneteket?

A szemantikai rangsorolásban a lekérdezési alrendszer a keresési eredményeket adja át az összegzési és rangsorolási modellek bemeneteként. Mivel a rangsorolási modellek bemeneti méretkorlátokkal rendelkeznek, és intenzíven dolgoznak fel, a keresési eredményeknek méretezve és strukturálva kell lenniük (összegezve) a hatékony kezelés érdekében.

  1. A szemantikai rangsoroló egy szöveges lekérdezésből származó BM25-rangsorolt eredménnyel kezdődik, vagy egy vektorból vagy hibrid lekérdezésből származó RRF-rangsorolt eredménnyel . Az újrangsorolási gyakorlat csak szöveget használ. Még akkor is, ha az eredmények több mint 50 találatot tartalmaznak, csak az első 50 találat halad a szemantikai rangsorolás felé. A szemantikai rangsorolás általában tájékoztató és leíró mezőket használ.

  2. A keresési eredményekben található dokumentumok esetében az összegző modell legfeljebb 2000 tokent fogad el, ahol egy token körülbelül 10 karakterből áll. A modell a szemantikai konfigurációban felsorolt "cím", "kulcsszavak" és "tartalom" mezőkből állít össze bemeneteket.

  3. A rendszer levágja a túlzottan hosszú karakterláncokat, hogy a teljes hossz megfeleljen az összefoglalási lépés bemeneti követelményeinek. Ez a vágási gyakorlat miatt fontos mezőket hozzáadni a szemantikai konfigurációhoz prioritási sorrendben. Ha nagyon nagy méretű dokumentumokat tartalmaz szöveges mezőkkel, a rendszer semmit sem hagy figyelmen kívül a maximális korlát után.

    Szemantikai mező Tokenkorlát
    "cím" 128 token
    "kulcsszavak" 128 token
    tartalom fennmaradó tokenek
  4. Az összegző kimenet egy összegző szöveg minden dokumentumhoz, amely az egyes mezők legrelevánsabb információit tartalmazza. A rendszer összegző sztringeket küld a rangsorolónak a pontozáshoz, valamint a gépi olvasási szövegértési modelleknek a feliratokhoz és válaszokhoz.

    2024 novemberétől a szemantikai rangsorolónak átadott generált összegző sztringek maximális hossza 2048 token. Korábban 256 token volt.

Az eredmények pontszámának ismertetése

A rendszer az eredményeket a felirat és az összefoglaló karakterlánc minden más tartalma alapján értékeli, amely kitölti a 2048 karakter hosszúságot.

  1. A rendszer a megadott lekérdezéshez képest kiértékeli a feliratok fogalmi és szemantikai relevanciáját.

  2. A rendszer egy @search.rerankerScore-t rendel minden dokumentumhoz a dokumentum szemantikai relevanciája alapján az adott lekérdezéshez. A pontszámok 4 és 0 között (magastól alacsonyig) terjednek, ahol a magasabb pontszám nagyobb relevanciát jelez.

    Pontszám Jelentése
    4.0 A dokumentum rendkívül releváns, és teljes mértékben megválaszolja a kérdést, bár a szakasz a kérdéstől független további szöveget tartalmazhat.
    3.0 A dokumentum releváns, de nem tartalmaz olyan részleteket, amelyek teljessé tennék.
    2.0 A dokumentum kissé releváns; részben vagy csak a kérdés bizonyos aspektusaira válaszol.
    1.0 A dokumentum a kérdéshez kapcsolódik, és egy kis részét megválaszolja.
    0.0 A dokumentum irreleváns.
  3. A rendszer pontszám szerint csökkenő sorrendben listázza az egyezéseket, és tartalmazza őket a lekérdezési válasz adatforgalmában. A hasznos adatok tartalmazzák a válaszokat, az egyszerű szöveget és a kiemelt feliratokat, valamint azokat a mezőket, amelyeket lekérdezhetőként jelölt meg, vagy amelyeket egy kijelölési záradékban megadott.

Megjegyzés

Bármely adott lekérdezés esetében a @search.rerankerScore eloszlása az infrastruktúra szintjén lévő feltételek miatt enyhe eltéréseket mutathat. A modellfrissítések rangsorolása hatással lehet a terjesztésre is. Ezen okok miatt, ha egyéni kódot ír a minimális küszöbértékekhez, vagy beállítja a vektoros és hibrid lekérdezések küszöbértéktulajdonságát , ne tegye túl részletessé a korlátokat.

Szemantikai rangsoroló kimenetei

Az összesítő sztringben a gépi olvasási szövegértési modellek a leginkább reprezentatív részeket találják meg.

A kimenetek a következők:

  • A dokumentum szemantikai felirata . Minden felirat egyszerű szöveges és kiemelt verzióban érhető el, és dokumentumonként gyakran kevesebb, mint 200 szó.

  • Nem kötelező szemantikai válasz, feltéve, hogy megadta a answers paramétert, a lekérdezés kérdésként jelent meg, és egy szakasz található a hosszú sztringben, amely valószínűleg választ ad a kérdésre.

A feliratok és válaszok mindig szó szerinti szövegként jelennek meg az indexből. Ebben a munkafolyamatban nincs olyan generatív AI-modell, amely új tartalmat hoz létre vagy állít össze.

Szemantikai képességek és korlátozások

Mit tehet a szemantikai rangsoroló:

  • Az eredeti lekérdezés szándékához szemantikusan közelebb álló egyezések előléptetése.

  • Sztringek keresése, melyek feliratként és válaszként használhatók. A válasz feliratokat és válaszokat ad vissza, amelyeket megjeleníthet egy keresési eredményoldalon.

Amit a szemantikai rangsoroló nem tud elvégezni, az az, hogy újrafuttatja a lekérdezést a teljes korpuszon, hogy szemantikailag releváns eredményeket találjon. A szemantikai rangsorolás a meglévő eredményhalmazt irányítja át, amely az alapértelmezett rangsorolási algoritmus által elért 50 legjobb eredményből áll. Emellett a szemantikai rangsoroló nem tud új információkat vagy sztringeket létrehozni. A nyelvi modellek feliratokat és válaszokat nyernek ki a tartalomból, így ha az eredmények nem tartalmaznak válaszszerű szöveget, akkor nem hoznak létre egyet.

Bár a szemantikai rangsorolás nem minden esetben előnyös, bizonyos tartalmak jelentősen kihasználhatják képességeiket. A szemantikai rangsoroló nyelvi modelljei az információban gazdag és prózaként strukturált kereshető tartalmakon működnek a legjobban. A leíró tartalmakat tartalmazó tudásbázisok, online dokumentációk vagy dokumentumok a szemantikai rangsoroló képességek által nyújtott legnagyobb hasznot élvezhetik.

Az alapul szolgáló technológia a Bing és a Microsoft Research szolgáltatásból származik, és bővítményfunkcióként integrálva van a Azure AI Keresés infrastruktúrába. A szemantikai rangsoroló kutatásával és AI-befektetésekkel kapcsolatos további információkért lásd: Hogyan támogatja a Bing AI az Azure AI Keresés-et (Microsoft Research Blog).

Az alábbi videó áttekintést nyújt a képességekről.

A szemantikai rangsoroló szinonimatérképeket használ

Ha engedélyezi a keresési index egy mezőjéhez társított szinonimatérképek támogatását, és ezt a mezőt belefoglalja a szemantikai rangsoroló konfigurációjába, a szemantikai rangsoroló automatikusan alkalmazza a konfigurált szinonimákat az újraküldési folyamat során.

Rendelkezésre állás és díjszabás

A szemantikai rangsoroló egyes régiókban érhető el. Használható önálló funkcióként vagy az ügynöki lekérés beépített összetevőjeként. Minden funkció számlázása külön történik.

A szemantikus rangsoroló egy alapértelmezett ingyenes csomagot kínál havi ingyenes kérelemkerettel, valamint egy normál csomagot a használatalapú fizetéshez, miután az ingyenes keret kimerült. További információ: Szemantikai rangsoroló számlázásának engedélyezése vagy letiltása.

A szemantikai rangsorolóra vonatkozó költségek akkor merülnek fel, ha a lekérdezési kérések tartalmazzák queryType=semantic, és a keresési karakterlánc nem üres (például search=pet friendly hotels in New York). Ha a keresési sztring üres (search=*), akkor sem kell fizetnie, még akkor sem, ha a queryType szemantikai értékre van állítva.

Első lépések

  1. Ellenőrizze a regionális rendelkezésre állást.

  2. (Nem kötelező) Váltson a normál számlázási csomagra az ingyenes havi kvótán túli használathoz.

  3. Szemantikai rangsoroló konfigurálása keresési indexben.

  4. Lekérdezések beállítása szemantikai feliratok és kiemelések visszaadásához.

  5. (Nem kötelező) Szemantikai válaszokat ad vissza.