Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Note
Ta strona obejmuje nową wersję Ekstrakcji Informacji. Aby uzyskać informacje o poprzedniej wersji, zobacz Use Information Extraction (starsza wersja)
Wyodrębnianie informacji przekształca dokumenty bez struktury i tekst w kluczowe szczegółowe informacje ze strukturą przy użyciu zdefiniowanego schematu. Dzięki temu można używać informacji osadzonych w tekście bez struktury, plikach PDF, obrazach lub tabelach bezpośrednio na potrzeby analizy, raportowania lub podrzędnych agentów i aplikacji.
Przykłady wyodrębniania informacji obejmują:
- Wyodrębnianie stron prawnych i warunków z umów.
- Wyodrębnianie pozycji i terminów płatności z faktur.
- Ściąganie kluczowych szczegółów z dokumentacji medycznej i notatek.
Wyodrębnianie informacji jest oparte na funkcji sztucznej inteligencji ai_extract. Wyodrębnianie informacji ma wizualny interfejs użytkownika, który umożliwia dostosowywanie i optymalizowanie działania za pomocą zdefiniowanego schematu do wyodrębniania.
Wyodrębnianie informacji używa domyślnego magazynu do przechowywania tymczasowych przekształceń danych, punktów kontrolnych modelu i metadanych wewnętrznych, które zasilają każdego agenta. Po usunięciu agenta usługa Databricks usuwa wszystkie dane skojarzone z agentem z domyślnego magazynu.
Requirements
- Obszar roboczy zawierający następujące elementy:
- Włączono bezserwerowe obliczenia. Zobacz Wymagania dotyczące obliczeń bezserwerowych.
- Katalog Unity jest włączony. Zobacz Umożliwienie obszaru roboczego dla Unity Catalog.
- Dostęp do zasad użycia bezserwerowego z budżetem niezerowym.
- Ta funkcja jest dostępna tylko w niektórych regionach. Zobacz Dostępność funkcji sztucznej inteligencji.
- W przypadku obszarów roboczych z dodatkiem Rozszerzone zabezpieczenia i zgodność
- Zobacz regionalną pomoc techniczną dotyczącą
ai_extractodpowiedniego standardu zgodności. - Zobacz Zarządzanie wersjami zapoznawczymi usługi Azure Databricks, aby dowiedzieć się, jak włączyć tę funkcję w swoim obszarze roboczym.
- Zobacz regionalną pomoc techniczną dotyczącą
- Możliwość korzystania z
ai_extractfunkcji SQL. - Dane bez struktury, z których chcesz wyodrębnić informacje. Dane muszą być w woluminie lub tabeli Unity Catalogu.
- Aby utworzyć agenta, musisz mieć co najmniej 1 plik w woluminie Unity Catalog lub 1 wiersz w tabeli.
Tworzenie agenta wyodrębniania informacji
Przejdź do Agenci w okienku nawigacji po lewej stronie obszaru roboczego. Kliknij Utwórz agenta>Wyodrębnianie informacji.
Krok 1. Wybierz dane, z których chcesz wyodrębnić informacje
Na stronie Rozpocznij od danych wybierz pliki lub dane, z których chcesz wyodrębnić informacje. Możesz wykonać dowolną z następujących czynności:
- Przeciągnij i upuść jeden lub więcej plików do obszaru przesyłania lub kliknij, aby wybrać pliki do przesłania.
- Kliknij Wybierz wolumin, aby wybrać wolumin Unity Catalog z obsługiwanymi typami plików.
- Kliknij Wybierz tabelę, aby wybrać tabelę Unity Catalog zawierającą dane tekstowe.
Jeśli wybierzesz tabelę, wybierz kolumnę zawierającą dane do wyodrębnienia. Przed kontynuowaniem musisz wybrać kolumnę z obsługiwanym typem, takim jak STRING lub VARIANT. Jeśli tabela nie ma obsługiwanych kolumn, wybierz inną tabelę.
Kliknij pozycję Utwórz agenta. Ten przycisk jest dostępny dopiero po wybraniu prawidłowego źródła danych oraz — w przypadku tabeli — obsługiwanej kolumny.
Krok 2. Konfiguruj i doprecyzuj swój schemat ekstrakcji
Po przeprowadzeniu procesu wyodrębniania informacji, skonfiguruj i doprecyzuj, jakie dane chcesz wyodrębnić z dokumentów.
W obszarze Konfiguracja zdefiniuj schemat wyodrębniania. Istnieje kilka sposobów, aby to zrobić:
- Wprowadź język naturalny opisujący informacje, które chcesz wyodrębnić, a następnie kliknij pozycję Generuj schemat. Ekstrakcja informacji automatycznie generuje dla Ciebie schemat JSON z nazwami pól i definicjami. Edytuj te opisy zgodnie z potrzebami.
- Alternatywnie kliknij opcję "Lub zdefiniuj ręcznie", aby ręcznie zdefiniować schemat:
- Kliknij pozycję Dodaj pole.
- Wprowadź nazwę pola, typ i opis.
- Kliknij przycisk Potwierdź.
- Powtórz dla każdego pola, które chcesz wyodrębnić.
- Kliknij pozycję Zapisz i uruchom wyodrębnianie.
- Możesz również kliknąć pozycję JSON , aby bezpośrednio edytować schemat JSON. Po zakończeniu kliknij przycisk Zastosuj zmiany .
Za każdym razem, gdy zaktualizujesz schemat i klikniesz Zapisz i uruchom ekstrakcję, Information Extraction aktualizuje agenta ekstrakcji, uruchamia ekstrakcję i wyświetla wyniki dla każdego wejścia.
Po lewej stronie przejrzyj przeanalizowany dokument i ekstrakcję przez agenta. Iteruj wyniki wyodrębniania na dwa sposoby. Najpierw podaj w naturalnym języku informacje zwrotne dotyczące co najmniej jednego wejścia, co spowoduje automatyczne dostrojenie opisów po kliknięciu Zapisz i uruchom ekstrakcję. Po drugie ręcznie popraw opisy schematów, które obowiązują po naciśnięciu przycisku Zapisz i uruchom wyodrębnianie.
Użyj wersji, aby porównać lub przywrócić poprzednią konfigurację. Kliknij pozycję Wersje, a następnie kliknij pozycję Porównaj , aby porównać definicję schematu poprzedniej wersji z bieżącą wersją. Kliknij przycisk Przywróć, aby przywrócić poprzednią wersję.
Krok 3. Ocenianie i poprawianie jakości wyodrębniania
Aby zmierzyć, jak dobrze działa agent i poprawić go systematycznie, oceń agenta względem oznaczonego zestawu danych. W ramach oceny każdą ekstrakcję porównuje się ze znaną poprawną odpowiedzią wzorcową (ground truth), dzięki czemu można śledzić dokładność na poziomie pól w kolejnych wersjach i skupić się na polach wymagających poprawy.
Dodawanie zestawu danych oceny
Przed uruchomieniem ewaluacji musisz mieć zestaw danych do ewaluacji w Unity Catalog. Zestaw danych musi być tabelą Unity Catalog z dwiema kolumnami:
-
Kolumna wejściowa z tekstem lub dokumentem do wyodrębnienia. Może to być
STRINGtekst lubVARIANTdane wyjścioweai_parse_document. -
Kolumna wartości referencyjnej z oczekiwanym wynikiem ekstrakcji w postaci ciągu JSON. Każda wartość musi być zgodna ze schematem ekstrakcji agenta i odpowiadać
ai_extractzaawansowanemu schematowi.
Uruchamianie oceny
Aby uruchomić ewaluację agenta ekstrakcji:
- W aplikacji Workbench otwórz listę rozwijaną oceny i kliknij pozycję Uruchom ocenę. Spowoduje to otwarcie okna dialogowego Tworzenie przebiegu oceny .
- W tabeli zbioru danych ewaluacyjnych wybierz tabelę Unity Catalog zawierającą oznaczone przykłady.
- W obszarze Mapowanie kolumn wybierz kolumnę Dane wejściowe zawierające dane wejściowe agenta i kolumnę Ground truth zawierającą oczekiwaną odpowiedź.
- Kliknij pozycję Uruchom ocenę. Ekstrakcja informacji zapisuje bieżącą konfigurację jako nową wersję i przypisuje wynik każdemu wierszowi względem jego wartości referencyjnej.
Przejrzenie wyników oceny
W miarę postępu procesu dokumenty pojawiają się na bieżąco na karcie Dokumenty, a wszelkie niezgodne pola są wyświetlane przy każdym dokumencie. Po zakończeniu uruchomienia funkcja Information Extraction wyświetla kartę Przegląd, która zawiera:
- Karta wyników z ogólną dokładnością pól i dokumentami w pełni poprawnymi. Jeśli istnieje poprzedni przebieg oceny, karta wyników pokazuje zmianę z tego przebiegu.
- Tabela wyników dla poszczególnych pól. Kliknij dowolne pole, aby otworzyć widok szczegółowy, w którym są wyświetlane dokładność, precyzja, czułość i F1. Kliknij Pokaż dokumenty, których przetwarzanie się nie powiodło, aby zobaczyć wszystkie dokumenty, z których nie udało się wyodrębnić tego pola, oraz wynik ich ekstrakcji.
Przejdź do karty Dokumenty , aby sprawdzić poszczególne dokumenty. Każdy wiersz zawiera współczynnik dopasowanych pól i pól, które zostały niezgodne. Użyj listy rozwijanej Pola , aby filtrować dokumenty, które miały określone niedopasowane pole. Kliknij dokument, aby porównać odpowiedź agenta z odpowiedzią referencyjną obok siebie.
Iteruj przez uściślinie schematu, a następnie ponownie kliknij pozycję Uruchom ocenę , aby zobaczyć, jak zmiany miały wpływ na wyniki.
Krok nr 4. Użyj swojego agenta wyodrębniania
Gdy będziesz zadowolony z działania agenta, użyj go do wyodrębnienia informacji.
Kliknij pozycję Użyj agenta w prawym górnym rogu. Możesz wybrać jedną z następujących opcji:
-
Uruchom polecenie w języku SQL, aby użyć agenta do wyodrębnienia informacji ze wszystkich danych. Spowoduje to otwarcie zapytania SQL używanego
ai_extractdo wyodrębniania informacji z woluminu lub tabeli przy użyciu zdefiniowanego schematu. Aby uzyskać więcej informacji na temat używaniaai_extractzapytań SQL, zobaczai_extractfunkcja. - Utwórz potok Lakeflow uruchamiany zgodnie z harmonogramem, aby uruchamiać agenta dla nowych danych. Spowoduje to utworzenie potoku Lakeflow, który aktualizuje tabelę strumieniową na podstawie wyodrębnionych danych. Harmonogram rurociągu można skonfigurować tak, aby był uruchamiany po przybyciu nowych danych. Więcej informacji na temat potoków Lakeflow można znaleźć w artykule Potoki deklaratywne Spark.
Limitations
- Zobacz Ograniczenia
- Agenci wyodrębniania informacji mają maksymalną długość kontekstu tokenów wynoszącą 128k.
- Typy schematów unii nie są obsługiwane.