Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Usługa Content Understanding umożliwia zaimplementowanie klasyfikacji i podziału w ramach żądania operacji analizatora. Klasyfikację zawartości i wyodrębnianie zawartości można wykonać w ramach pojedynczego wywołania interfejsu API.
Globalna koncepcja analyzer obejmuje teraz zarówno pojęcie contentCategories jak i enableSegment do klasyfikacji i podziału danych wejściowych, które przetwarzasz w swojej aplikacji. Ta funkcja analizatora może wykonywać klasyfikację pliku wejściowego jako całości. Może również identyfikować wiele dokumentów lub wiele wystąpień pojedynczego dokumentu w pliku wejściowym.
Począwszy od wersji ogólnie dostępnej, klasyfikacja dokumentów i projektowanie segmentacji wideo są ujednolicone, co pozwala na spójne podejście do przetwarzania danych wejściowych niezależnie od jego modalności. W dokumentacji "klasyfikacja Content Understanding" odnosi się do operacji analizy, które są wymagane do klasyfikowania i dzielenia danych wejściowych (contentCategories i enableSegment).
Przypadki użycia biznesowego
Klasyfikacja usługi Content Understanding umożliwia przetwarzanie złożonych dokumentów i filmów wideo w różnych formatach i szablonach:
- Faktury: kategoryzowanie faktur od wielu dostawców w celu przetworzenia każdej kategorii za pomocą innego analizatora usługi Content Understanding, jeśli jest to konieczne.
- Dokumenty podatkowe: kategoryzuj wiele dokumentów podatkowych na różne rodzaje formularzy podatkowych, takich jak 1040 i 1099.
- Umowy: kategoryzuj długie, nieustrukturyzowane kontrakty, aby usprawnić operacje w celu zrozumienia różnych typów umów i ich konkretnych skutków prawnych.
- Wideo sportowe: Automatycznie podziel sceny, aby podzielić wideo na logiczne fragmenty, takie jak reklamy i rzeczywista zawartość sportowa.
Możliwości klasyfikacji/segmentacji
Usługa Content Understanding umożliwia analizowanie dokumentów z jednym lub wieloma plikami w celu określenia, czy plik wejściowy można sklasyfikować w zdefiniowanej kategorii. Obsługiwane są następujące scenariusze:
Scenariusze dokumentów:
- Klasyfikuj tylko: klasyfikuje plik wejściowy jako całość. Na przykład pojedynczy plik zawierający jeden typ dokumentu, taki jak formularz wniosku o pożyczkę.
- Klasyfikowanie i analizowanie: klasyfikuje i analizuje plik wejściowy, rozsyłając dane wejściowe do żądanego analizatora wyodrębniania.
- Klasyfikuj i segmentuj: Klasyfikuje i segmentuje pojedynczy plik wejściowy, który może zawierać wiele typów lub instancji połączonych dokumentów. Na przykład pakiet wniosku o pożyczkę, który zawiera formularz wniosku o pożyczkę, pasek wynagrodzeń i wyciąg bankowy. Innym przykładem jest kolekcja zeskanowanych faktur w jednym pliku.
- Klasyfikowanie, segmentowanie i analizowanie: po sklasyfikowaniu segmentów należy skierować każdy segment do żądanego analizatora wyodrębniania w celu dalszego wyodrębniania pól.
- Klasyfikator hierarchiczny: Opcjonalna dodatkowa analiza w zależności od kategorii może również być analizą klasyfikatora.
Scenariusze wideo:
-
Tylko segmenty: Podziel wideo na segmenty na podstawie cech zawartości zdefiniowanych w
descriptionpolucontentCategories. Na przykład podzielenie transmisji sportowej na segmenty gry, reklamy i komentarze. - Segmentowanie i analizowanie: Dzielenie wideo na segmenty i kierowanie poszczególnych segmentów do analizatora na potrzeby wyodrębniania pól.
Uwaga / Notatka
Minimalna jednostka klasyfikacji dokumentów to pojedyncza strona. Klasyfikacja wewnątrzstronicowa nie jest obsługiwana.
Tworzenie kategorii klasyfikacji
Klasyfikacja usługi Content Understanding nie wymaga zestawu danych szkoleniowych. W ramach operacji analizy można zdefiniować maksymalnie 200 nazw kategorii i opisów. Domyślnie cały plik jest traktowany jako pojedynczy obiekt zawartości, co oznacza, że plik jest skojarzony z jedną kategorią.
Od wersji GA musisz uwzględnić kategorię other w contentCategories, aby upewnić się, że zawartość może pozostać nieprzypisana do którejkolwiek z zdefiniowanych kategorii.
other Jeśli kategoria nie jest uwzględniona, wszystkie pliki są klasyfikowane w jednej ze zdefiniowanych kategorii. Każda z nazw kategorii zdefiniowanych w obrębie contentCategories może również zawierać description aby podać więcej informacji o definiowanej kategorii.
Dzielenie pliku wejściowego
Jeśli w pliku znajduje się więcej niż jeden dokument, klasyfikator może zidentyfikować różne typy dokumentów, które znajdują się w pliku wejściowym z możliwością dzielenia. Odpowiedź klasyfikatora zawiera zakresy stron dla każdego z zidentyfikowanych typów dokumentów, które znajdują się w pliku. Ta odpowiedź może zawierać wiele wystąpień tego samego typu dokumentu.
Po uruchomieniu analyze operacji zawiera ona właściwość, która zapewnia szczegółową enableSegment kontrolę nad zachowaniem dzielenia. Można również określić numery stron, aby analizować tylko niektóre strony dokumentu wejściowego:
- Aby traktować cały plik wejściowy jako wiele dokumentów połączonych razem dla klasyfikacji, ustaw wartość
enableSegmenttrue. Gdy to zrobisz, usługa zwraca kategorie dla segmentów w pliku wejściowym automatycznie. - Aby traktować cały plik wejściowy jako pojedynczy dokument, ustaw wartość
enableSegmentfalse.
Domyślnie segmenty zaczynają się od granic strony. Wersja 2026-06-01-preview interfejsu API dodaje segmentację na stronie, która może podzielić pojedynczą stronę na wiele segmentów, gdy zawiera zawartość z różnych typów dokumentów. Segmentacja na stronie jest kontrolowana przez oddzielne allowInPageSegments pole, dzięki czemu można wyrazić zgodę na podziały podstron bez zmiany istniejącego enableSegment zachowania. Aby uzyskać więcej informacji, zobacz Ulepszenia klasyfikacji (2026-06-01 preview).
Uwaga / Notatka
W przypadku filmów wideo obsługiwana jest tylko segmentacja. Musisz zdefiniować pojedynczy element contentCategories z enableSegment ustawionym na true.
description Użyj pola, aby określić kryteria dzielenia wideo na segmenty.
Analiza opcjonalna
W przypadku kompletnego kompleksowego przepływu można połączyć kategorie klasyfikatora z istniejącymi analizatorami niestandardowymi i wstępnie utworzonymi analizatorami. Dla każdego obiektu zawartości sklasyfikowanych do kategorii z połączonymi analizatorami usługa automatycznie wywołuje analizę obiektu zawartości przy użyciu odpowiedniego analizatora.
Można na przykład użyć tego linku, aby utworzyć klasyfikatory identyfikujące i analizujące tylko faktury z pliku PDF zawierającego wiele typów formularzy. Ustaw analyzerId na wstępnie utworzony analizator lub analizator niestandardowy, aby kierować i wykonywać wyodrębnianie pól z klasyfikowanych dokumentów lub stron.
Można również pominąć ustawienie dowolnej analyzerId kategorii, ale nie wykonać żadnej analizy zawartości dla podzielonego na kategorie pliku lub segmentu.
Na najwyższej warstwie można również ustawić omitContent na true, aby pominąć oryginalny obiekt zawartości i zwrócić tylko obiekty zawartości z analizy przeprowadzonej na sklasyfikowanych segmentach lub plikach.
Klasyfikator hierarchiczny
Operacja analizatora obsługuje hierarchiczne dzielenie i klasyfikację. W operacji podstawowego analizatora ustaw analyzerId dla każdej kategorii zawartości niestandardowy analizator, który wykonuje dodatkową klasyfikację lub dzielenie. Takie podejście obsługuje scenariusze, takie jak faktury, kontrakty i paragony, w których każda kategoria może wskazywać inną operację analizatora analyzerId , która klasyfikuje różne podtypy dokumentów.
Dane wejściowe dokumentu obsługują pięć poziomów zagnieżdżania, a dane wejściowe wideo obsługują dwa.
Ulepszenia klasyfikacji (wersja zapoznawcza 2026-06-01)
W poprzednich sekcjach opisano zachowanie ga. W tej sekcji opisano możliwości tylko w wersji zapoznawczej, które wymagają wersji 2026-06-01-previewinterfejsu API .
Wersja interfejsu 2026-06-01-preview API obejmuje dwa ulepszenia klasyfikacji i dzielenia dokumentów. Aby użyć tych ulepszeń, użyj wersji zapoznawczej interfejsu API podczas przesyłania żądania analizy.
Important
Te funkcje są dostępne w publicznej wersji zapoznawczej. Funkcje w wersji zapoznawczej są udostępniane bez umowy dotyczącej poziomu usług i nie są zalecane w przypadku obciążeń produkcyjnych.
Wyodrębnianie funkcji opartych na układzie (wersja zapoznawcza)
W interfejsie 2026-06-01-preview API klasyfikator dodaje zaawansowane sygnały klasyfikacji, takie jak funkcje dokumentu oparte na układzie — znaczniki sekcji, nagłówki tabeli, opisy rysunków i inne.
Próbkowanie obsługujące układ poprawia dokładność klasyfikacji w scenariuszach, w których rozróżnianie zawartości jest wysoce nieustrukturyzowane lub rozłożone na stronę. Przykład:
- Strony, które są rozrzedzone w tekście, na przykład obrazy rentgenowskie lub zeskanowane raporty diagnostyczne.
- Strony z dużą liczbą rysunków, na których opis rysunku niesie większość sygnału klasyfikacji.
- Strony, na których nagłówki sekcji kluczy lub nagłówki tabeli są wyświetlane w środku strony.
Nie jest wymagana żadna zmiana konfiguracji. Podczas wywoływania interfejsu API w wersji zapoznawczej klasyfikator automatycznie używa funkcji opartych na układzie.
Segmentacja na stronie (wersja zapoznawcza)
Interfejs 2026-06-01-preview API dodaje segmentację na stronie , która może podzielić pojedynczą stronę na wiele segmentów, gdy strona zawiera zawartość należącą do różnych typów dokumentów.
Segmentacja na stronie jest przydatna w scenariuszach, takich jak:
- Dokumentacja medyczna , w której pojedyncza strona miesza typy zawartości, na przykład sekcję demografii pacjentów, po której następuje kolejność skierowania na tej samej stronie.
- Pakiety podatkowe , w których wiele harmonogramów lub formularzy jest skumulowanych na tej samej stronie, na przykład harmonogramy K-1.
- Pakiety wielo formularzy , w których kolejne formularze nie zawsze zaczynają się na nowej stronie.
Aby włączyć segmentację na stronie, ustaw wartość na allowInPageSegmentstrue wartość podczas tworzenia lub aktualizowania analizatora niestandardowego (nie można ustawić tego pola w żądaniu analizy). Odpowiedź analizatora zawiera zakresy stron dla poszczególnych segmentów, kategorię każdego segmentu, współczynnik ufności i wyrażenie źródłowe identyfikujące położenie ograniczenia segmentu na stronie.
Poniższy przykład przedstawia tablicę segments w odpowiedzi analizy, w której pojedyncza strona jest podzielona na segment karty kredytowej i segment karty tożsamości:
"segments": [
{
"span": {
"offset": 0,
"length": 301
},
"segmentId": "segment1",
"startPageNumber": 1,
"endPageNumber": 1,
"category": "Credit_card",
"confidence": 0.98,
"source": "D(1,1.32,1.49,3.13,1.49,3.13,3.86,1.32,3.86)"
},
{
"span": {
"offset": 301,
"length": 798
},
"segmentId": "segment2",
"startPageNumber": 1,
"endPageNumber": 1,
"category": "Identity_card",
"confidence": 0.99,
"source": "D(1,1.16,4.95,3.82,4.95,3.82,8.52,1.16,8.52)"
}
]
Pola interfejsu API
Następujące pola interfejsu API obsługują segmentację na stronie:
| Pole | Typ | Opis |
|---|---|---|
ContentAnalyzerConfig.allowInPageSegments |
boolean |
Ustaw podczas tworzenia lub aktualizowania analizatora niestandardowego. Gdy truesegmenty mogą obejmować część strony zamiast pełnych stron. |
DocumentContentSegment.segmentId |
string |
Stabilny identyfikator segmentu, taki jak segment1. |
DocumentContentSegment.span |
Span |
offset i length segmentu w tekście zawartości nadrzędnej w formacie Markdown. |
DocumentContentSegment.confidence |
float32 |
Wartość w pliku [0–1]. Współczynnik ufności dla segmentacji i klasyfikacji kategorii. |
DocumentContentSegment.source |
SourceExpression |
Położenie ograniczenia segmentu na stronie jako wyrażenie wielokątne formularza D(pageNumber, x1, y1, x2, y2, x3, y3, x4, y4). Przekaż tę wartość jako element range do analizatora podrzędnego. |
Limity klasyfikatora
Aby uzyskać informacje na temat obsługiwanych formatów dokumentów wejściowych i limitów klasyfikatora, zobacz Limity przydziału i limity usługi.
Najlepsze rozwiązania
Aby poprawić klasyfikację i podzielić jakość, użyj dobrej nazwy i opisu kategorii, aby model mógł zrozumieć kategorie z pewnym kontekstem. Aby uzyskać więcej informacji na temat nazw kategorii i opisów, zobacz Najlepsze rozwiązania.
Najważniejsze korzyści
- Dokładność i niezawodność: Zapewnij dokładną klasyfikację dokumentów, aby zmniejszyć błędy i zwiększyć wydajność.
- Skalowalność: skalowanie przetwarzania dokumentów w poziomie w celu spełnienia wymagań biznesowych.
- Dostosowywalny: dostosuj klasyfikator dokumentów, aby dopasować określone przepływy pracy.
Obsługiwane języki i regiony
Aby uzyskać listę obsługiwanych języków i regionów, zobacz Obsługa języków i regionów.
Prywatność i zabezpieczenia danych
Jeśli używasz usługi Content Understanding, zapoznaj się z zasadami firmy Microsoft dotyczącymi danych klientów. Aby uzyskać więcej informacji, zobacz Dane, ochrona i prywatność.
Treści powiązane
- Spróbuj przetwarzać zawartość dokumentu w programie Content Understanding Studio
- Dowiedz się, jak przetwarzać zawartość dokumentu przy użyciu szablonów analizatora.