Magazyn wiedzy w usłudze Wyszukiwanie AI platformy Azure

Note

Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.

Note

Magazyny wiedzy to magazyn pomocniczy, który istnieje w usłudze Azure Storage i zawiera dane wyjściowe zestawów umiejętności usługi Wyszukiwanie AI platformy Azure. Są one oddzielone od źródeł wiedzy i baz wiedzy, które są używane w przepływach pracy agentowego pobierania danych.

Magazyn wiedzy to pomocniczy magazyn zawartości wzbogaconej przez sztuczną inteligencję utworzony przez zestaw umiejętności w usłudze Wyszukiwanie AI platformy Azure. W usłudze Wyszukiwanie AI platformy Azure zadanie indeksowania zawsze wysyła dane wyjściowe do indeksu wyszukiwania, ale jeśli dołączysz zestaw umiejętności do indeksatora, opcjonalnie możesz również wysłać dane wyjściowe wzbogacone przez sztuczną inteligencję do kontenera lub tabeli w usłudze Azure Storage. Magazyn wiedzy może służyć do niezależnej analizy lub przetwarzania podrzędnego w scenariuszach bez wyszukiwania, takich jak wyszukiwanie wiedzy.

Dwa wyniki indeksowania, indeks wyszukiwania i magazyn wiedzy, są produktami wzajemnie się wykluczającymi tego samego potoku. Pochodzą one z tych samych danych wejściowych i zawierają te same dane, ale ich zawartość jest ustrukturyzowana, przechowywana i używana w różnych aplikacjach.

Pipeline z umiejętnościami

Fizycznie magazynem wiedzy jest Azure Storage, czyli Azure Table Storage, Azure Blob Storage lub oba te elementy. Każde narzędzie lub proces, który może połączyć się z usługą Azure Storage, może korzystać z zawartości magazynu wiedzy. W usłudze Wyszukiwanie AI platformy Azure nie ma obsługi zapytań w celu pobierania zawartości z magazynu wiedzy.

W przypadku wyświetlania za pośrednictwem witryny Azure Portal magazyn wiedzy wygląda jak każda inna kolekcja tabel, obiektów lub plików. Poniższy zrzut ekranu przedstawia magazyn wiedzy składający się z trzech tabel. Możesz przyjąć konwencję nazewnictwa, taką jak prefiks kstore, aby utrzymać zawartość w spójności.

Umiejętności odczytu i zapisu z drzewa wzbogacania

Zalety magazynu wiedzy

Główne zalety magazynu wiedzy są dwojakie: elastyczny dostęp do treści i możliwość kształtowania danych.

W przeciwieństwie do indeksu wyszukiwania, do którego można uzyskać dostęp tylko za pośrednictwem zapytań w usłudze Wyszukiwanie AI platformy Azure, magazyn wiedzy jest dostępny dla dowolnego narzędzia, aplikacji lub procesu obsługującego połączenia z usługą Azure Storage. Ta elastyczność otwiera nowe scenariusze użytkowania zawartości, która została przeanalizowana i wzbogacona w procesie wzbogacania.

Ten sam zestaw umiejętności, który wzbogaca dane, może również służyć do kształtowania danych. Niektóre narzędzia, takie jak usługa Power BI, działają lepiej z tabelami, natomiast obciążenie nauki o danych może wymagać złożonej struktury danych w formacie obiektu blob. Dodanie umiejętności typu Shaper do zestawu umiejętności zapewnia kontrolę nad kształtem danych. Następnie można przekazać te kształty do projekcji, tabel lub obiektów blob, aby utworzyć fizyczne struktury danych, które są zgodne z zamierzonym użyciem danych.

W poniższym filmie wideo wyjaśniono obie te korzyści i nie tylko.

Definicja magazynu wiedzy

Magazyn wiedzy jest definiowany wewnątrz definicji zestawu umiejętności i ma dwa składniki:

  • Parametry połączenia do usługi Azure Storage

  • Projekcje określające, czy magazyn wiedzy składa się z tabel, obiektów lub plików. Element projekcji jest tablicą. W jednym magazynie wiedzy można utworzyć wiele kombinacji zestawów tabeli-obiekt-pliku.

    "knowledgeStore": {
        "storageConnectionString":"<YOUR-AZURE-STORAGE-ACCOUNT-CONNECTION-STRING>",
        "projections":[
           {
              "tables":[ ],
              "objects":[ ],
              "files":[ ]
           }
        ]
    }
    

Typ projekcji określony w tej strukturze określa typ magazynu używanego przez magazyn wiedzy, ale nie jego strukturę. Pola w tabelach, obiektach i plikach są określane przez dane wyjściowe Umiejętności Shapera, jeśli tworzysz magazyn wiedzy programowo, lub przez Kreatora importu danych, jeśli używasz portalu Azure.

  • tables projekt wzbogaconej zawartości do Table Storage. Zdefiniuj projekcję tabeli, gdy potrzebujesz struktur raportowania tabelarycznego dla danych wejściowych do narzędzi analitycznych lub eksportuj je jako ramki danych do innych magazynów danych. Można określić wiele tables w tej samej grupie projekcji, aby uzyskać podzestaw lub przekrój wzbogaconych dokumentów. W tej samej grupie projekcji relacje tabel są zachowywane, co umożliwia pracę ze wszystkimi nimi.

    Przewidywana zawartość nie jest agregowana ani znormalizowana. Poniższy zrzut ekranu przedstawia tabelę posortowaną według frazy kluczowej z dokumentem nadrzędnym wskazanym w sąsiedniej kolumnie. W przeciwieństwie do pozyskiwania danych podczas indeksowania nie ma analizy językowej ani agregacji zawartości. Formy mnogie i różnice w wielkości liter są uznawane za unikatowe wystąpienia.

    Zrzut ekranu przedstawiający kluczowe frazy i dokumenty w tabeli

  • objects dokument JSON projektu w usłudze Blob Storage. Fizyczna reprezentacja elementu object to hierarchiczna struktura JSON, która reprezentuje wzbogacony dokument.

  • files pliki obrazów projektu w usłudze Blob Storage. Obiekt file to obraz wyodrębniony z dokumentu, przeniesiony bez zmian do usługi Blob Storage. Chociaż ma ona nazwę "files", jest wyświetlana w usłudze Blob Storage, a nie w magazynie plików.

Tworzenie magazynu wiedzy

Użyj witryny Azure Portal, interfejsów API REST lub pakietu zestawu Azure SDK, aby utworzyć magazyn wiedzy. Wszystkie metody wymagają usługi Azure Storage, zestawu umiejętności i indeksatora. Ponieważ indeksatory wymagają indeksu wyszukiwania, należy również podać definicję indeksu.

Interfejsy API REST i zestawy SDK zapewniają pełną kontrolę nad projekcjami: tabelami, obiektami i plikami. Portal Azure automatycznie tworzy magazyn wiedzy jako część wielomodalnego przepływu pracy RAG, który jest ograniczony do projekcji plików wyłącznie do wyodrębnionych obrazów.

Kreator importu danych tworzy magazyn wiedzy tylko dla wielomodalnego scenariusza RAG. Aby rozpocząć, zobacz Szybki start: wyszukiwanie wielomodalne w witrynie Azure Portal.

Nawiązywanie połączenia z aplikacjami

Gdy zawartość wzbogacona istnieje w magazynie, każde narzędzie lub technologia łącząca się z usługą Azure Storage może służyć do eksplorowania, analizowania lub korzystania z zawartości. Poniższa lista to początek:

Cykl życia zawartości

Za każdym razem, gdy uruchamiasz indeksator i zestaw umiejętności, magazyn wiedzy jest aktualizowany, jeśli zestaw umiejętności lub bazowe dane źródłowe uległy zmianie. Wszelkie zmiany pobierane przez indeksator są propagowane przez proces wzbogacania do projekcji w magazynie wiedzy, zapewniając, że przewidywane dane są bieżącą reprezentacją zawartości w źródle danych źródłowych.

Note

Podczas edytowania danych w projekcjach wszelkie zmiany zostaną zastąpione przy następnym wywołaniu potoku, przy założeniu, że dokument w danych źródłowych zostanie zaktualizowany.

Zmiany w danych źródłowych

W przypadku źródeł danych, które obsługują śledzenie zmian, indeksator przetworzy nowe i zmienione dokumenty oraz ominie istniejące dokumenty, które zostały już przetworzone. Informacje sygnatury czasowej różnią się w zależności od źródła danych, ale w kontenerze obiektów blob indeksator analizuje lastmodified datę, aby określić, które obiekty blob muszą być pozyskiwane.

Zmiany w zakresie umiejętności

Jeśli wprowadzasz zmiany w zestawie umiejętności, powinieneś włączyć buforowanie wzbogacanych dokumentów, aby ponownie używać istniejących wzbogaceń tam, gdzie to możliwe.

Bez buforowania przyrostowego indeksator zawsze przetwarza dokumenty według najwyższego punktu odniesienia, bez cofania się. W przypadku obiektów blob indeksator przetwarza obiekty blob sortowane według lastModified, niezależnie od zmian ustawień indeksatora lub zestawu umiejętności. Jeśli zmienisz zestaw umiejętności, wcześniej przetworzone dokumenty nie zostaną zaktualizowane w celu odzwierciedlenia nowego zestawu umiejętności. Dokumenty przetwarzane po zmianie zestawu umiejętności będą używać nowego zestawu umiejętności, co powoduje, że dokumenty indeksowania są mieszanką starych i nowych zestawów umiejętności.

Po aktualizacji zestawu umiejętności i dzięki buforowaniu przyrostowemu indeksator ponownie użyje wszystkich wzbogaceń, które nie są dotknięte zmianą zestawu umiejętności. Wzbogacenia początkowe są pobierane z pamięci podręcznej, podobnie jak wszelkie wzbogacenia, które są niezależne i odizolowane od zmienionych funkcji.

Deletions

Mimo że indeksator tworzy i aktualizuje struktury i zawartość w usłudze Azure Storage, nie usuwa ich. Projekcje nadal istnieją nawet po usunięciu indeksatora lub zestawu umiejętności. Jako właściciel konta magazynowego należy usunąć projekcję, jeśli nie jest już potrzebna.

Dalsze kroki

Magazyn wiedzy oferuje trwałość wzbogaconych dokumentów, przydatną podczas projektowania zestawu umiejętności lub tworzenie nowych struktur i zawartości do użycia przez wszystkie aplikacje klienckie, które mogą uzyskiwać dostęp do konta usługi Azure Storage.

Najprostszym podejściem do programowego tworzenia wzbogaconych dokumentów jest użycie interfejsów API REST.