Model pro čtení Document Intelligence

Tento obsah se vztahuje na:checkmarkv4.0 (GA) | Předchozí verze:blue-checkmarkv3.1 (GA)blue-checkmarkv3.0 (GA)

Poznámka:

Pokud chcete extrahovat text z externích obrázků, jako jsou popisky, znaky ulice a plakáty, použijte funkci Čtení azure Image Analysis v4.0 optimalizovanou pro obecné (nedokumentované) obrázky s synchronním rozhraním API s vylepšeným výkonem. Tato funkce usnadňuje vkládání OCR ve scénářích uživatelského prostředí v reálném čase.

Model OCR (Document Intelligence Read Optické rozpoznávání znaků) běží s vyšším rozlišením než Azure Vision Read a extrahuje tisk a rukou psaný text z dokumentů PDF a naskenovaných obrázků. Obsahuje také podporu pro extrahování textu z dokumentů Microsoft Wordu, Excelu, PowerPointu a HTML. Rozpozná odstavce, řádky textu, slova, umístění a jazyky. Model pro čtení je podkladovým modulem OCR pro další předem vytvořené modely document intelligence, jako jsou rozložení, obecný dokument, faktura, potvrzení, dokument identity (ID), karta zdravotní pojištění, W2 kromě vlastních modelů.

Co je optické rozpoznávání znaků?

Optické rozpoznávání znaků (OCR) pro dokumenty je optimalizované pro velké textové dokumenty ve více formátech souborů a globálních jazycích. Obsahuje funkce, jako je skenování obrázků dokumentů s vyšším rozlišením pro lepší zpracování menšího a zhuštěného textu; detekce odstavce; a správu vyplnitelných formulářů. Funkce OCR také zahrnují pokročilé scénáře, jako jsou pole s jedním znakem a přesná extrakce klíčových polí běžně zjištěných v fakturách, účtech a dalších předem připravených scénářích.

Možnosti vývoje (v4)

Document Intelligence v4.0: 2024-11-30 (GA) podporuje následující nástroje, aplikace a knihovny:

Funkce Zdroje informací ID modelu
Čtení modelu OCR Document Intelligence Studio
REST API
C# SDK
Python SDK
Java SDK
JavaScript SDK
předpřipravené čtení

Požadavky na vstup (v4)

Podporují se následující formáty souborů.

Model soubor PDF Obrázek:
JPEG/JPG, PNG, BMP, TIFF, HEIF
Office:
Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML
Přečteno
Rozložení
Obecný dokument
Předem sestavený
Vlastní extrakce
Vlastní klasifikace
  • Fotky a skenování: Nejlepších výsledků dosáhnete tak, že poskytnete jednu jasnou fotku nebo vysoce kvalitní skenování na dokument.
  • SOUBORY PDF a TIFF: U souborů PDF a TIFF je možné zpracovat až 2 000 stránek. (S předplatným úrovně Free se zpracovávají pouze první dvě stránky.)
  • Velikost souboru: Velikost souboru pro analýzu dokumentů je 500 MB pro placenou úroveň (S0) a 4 MB pro bezplatnou úroveň (F0).
  • Rozměry obrázku: Rozměry musí být mezi 50 pixely x 50 pixelů a 10 000 pixelů x 10 000 pixelů.
  • Zámky hesel: Pokud jsou soubory PDF uzamčené heslem, musíte zámek před odesláním odebrat.
  • Výška textu: Minimální výška extrahovaného textu je 12 pixelů pro obrázek o velikosti 1024 x 768 pixelů. Tento rozměr odpovídá přibližně textu o velikosti 8 bodů při rozlišení 150 bodů na palec.
  • Trénování vlastního modelu: Maximální počet stránek pro trénovací data je 500 pro vlastní model šablony a 50 000 pro vlastní neurální model.
  • Trénování vlastního modelu extrakce: Celková velikost trénovacích dat je 50 MB pro model šablony a 1 GB pro neurální model.
  • Trénování modelu vlastní klasifikace: Celková velikost trénovacích dat je 1 GB s maximálně 10 000 stránkami. V případě 2024-11-30 (GA) je celková velikost trénovacích dat 2 GB s maximálně 10 000 stránkami.
  • Typy souborů Office (DOCX, XLSX, PPTX):: Maximální limit délky řetězce je 8 milionů znaků.

Začínáme používat model Read (v4)

Zkuste extrahovat text z formulářů a dokumentů pomocí nástroje Document Intelligence Studio. Potřebujete následující prostředky:

  • Předplatné Azure – můžete si ho zdarma vytvořit.

  • instance Document Intelligence na portálu Azure. K vyzkoušení služby můžete použít cenovou úroveň Free (F0). Po nasazení prostředku vyberte možnost Přejít k prostředku a získáte tak svůj klíč a koncový bod.

    Snímek obrazovky s klíči a umístěním koncového bodu na webu Azure Portal

Poznámka:

Sada Document Intelligence Studio v současné době nepodporuje formáty souborů Microsoft Wordu, Excelu, PowerPointu a HTML.

Ukázkový dokument zpracovaný pomocí nástroje Document Intelligence Studio

Snímek obrazovky se zpracováním čtení v nástroji Document Intelligence Studio

  1. Na domovské stránce nástroje Document Intelligence Studio vyberte Číst.

  2. Můžete analyzovat ukázkový dokument nebo nahrát vlastní soubory.

  3. Vyberte tlačítko Spustit analýzu a v případě potřeby nakonfigurujte možnosti Analyzovat:

    Snímek obrazovky tlačítek „Spustit analýzu“ a „Analyzovat“ v nástroji Document Intelligence Studio.

Podporované jazyky a národní prostředí (v4)

Úplný seznam podporovaných jazyků najdete na stránce s modely analýzy dokumentů.

Extrakce dat (v4)

Poznámka:

Soubor Microsoft Word a HTML jsou podporovány ve verzi 4.0. V současné době se nepodporují následující možnosti:

  • Pro každý objekt stránky se nevrací úhel, šířka/výška ani jednotka.
  • U žádného zjištěného objektu nebyl nalezen ohraničovací mnohoúhelník ani ohraničovací oblast.
  • Jako vrácený parametr nebyl vrácen žádný rozsah stránek (pages).
  • Žádný lines objekt.

Prohledávatelné soubory PDF

Funkce prohledávatelného PDF umožňuje převést analogové SOUBORY PDF, jako jsou naskenované soubory PDF, do PDF s vloženým textem. Vložený text umožňuje hloubkové vyhledávání textu v extrahovaném obsahu PDF tak, že překryjí zjištěné textové entity nad soubory obrázků.

Důležité

  • V současné době funkci prohledávatelného PDF podporuje pouze model OCR Read prebuilt-read. Při použití této funkce zadejte modelId jako prebuilt-read. Jiné typy modelů vrací chybu pro tuto verzi Preview.
  • Prohledávatelný PDF je součástí 2024-11-30 modelu GA prebuilt-read bez přidání nákladů na generování prohledávatelného výstupu PDF.

Použití prohledávatelných souborů PDF

Pokud chcete použít prohledávatelný SOUBOR PDF, vytvořte POST požadavek pomocí Analyze operace a zadejte výstupní formát takto pdf:


     POST {endpoint}/documentintelligence/documentModels/prebuilt-read:analyze?_overload=analyzeDocument&api-version=2024-11-30&output=pdf
     {...}
     202

Hlasování o dokončení Analyze operace. Po dokončení operace odešlete požadavek GET na načtení výsledků operace Analyze ve formátu PDF.

Po úspěšném dokončení lze soubor PDF načíst a stáhnout jako application/pdf. Tato operace umožňuje přímé stažení vloženého textového formátu PDF místo formátu JSON s kódováním Base64.


     // Monitor the operation until completion.
     GET /documentModels/prebuilt-read/analyzeResults/{resultId}
     200
     {...}

     // Upon successful completion, retrieve the PDF as application/pdf.
     GET {endpoint}/documentintelligence/documentModels/prebuilt-read/analyzeResults/{resultId}/pdf?api-version=2024-11-30
URI Parameters
Name    In    Required    Type    Description
endpoint    path    True    
string

uri    
The Document Intelligence service endpoint.

modelId    path    True    
string

Unique document model name.

Regex pattern: ^[a-zA-Z0-9][a-zA-Z0-9._~-]{1,63}$

resultId    path    True    
string

uuid    
Analyze operation result ID.

api-version    query    True    
string

The API version to use for this operation.

Responses
Name    Type    Description
200 OK    
file

The request has succeeded.

Media Types: "application/pdf", "application/json"

Other Status Codes    
DocumentIntelligenceErrorResponse

An unexpected error response.

Media Types: "application/pdf", "application/json"

Security
Ocp-Apim-Subscription-Key
Type: apiKey
In: header

OAuth2Auth
Type: oauth2
Flow: accessCode
Authorization URL: https://login.microsoftonline.com/common/oauth2/authorize
Token URL: https://login.microsoftonline.com/common/oauth2/token

Scopes
Name    Description
https://cognitiveservices.azure.com/.default    
Examples
Get Analyze Document Result PDF
Sample request
HTTP
HTTP

Copy
GET https://myendpoint.cognitiveservices.azure.com/documentintelligence/documentModels/prebuilt-invoice/analyzeResults/3b31320d-8bab-4f88-b19c-2322a7f11034/pdf?api-version=2024-11-30
Sample response
Status code:
200
JSON

Copy
"{pdfBinary}"
Definitions
Name    Description
DocumentIntelligenceError    
The error object.

DocumentIntelligenceErrorResponse    
Error response object.

DocumentIntelligenceInnerError    
An object containing more specific information about the error.

DocumentIntelligenceError
The error object.

Name    Type    Description
code    
string

One of a server-defined set of error codes.

details    
DocumentIntelligenceError[]

An array of details about specific errors that led to this reported error.

innererror    
DocumentIntelligenceInnerError

An object containing more specific information than the current object about the error.

message    
string

A human-readable representation of the error.

target    
string

The target of the error.

DocumentIntelligenceErrorResponse
Error response object.

Name    Type    Description
error    
DocumentIntelligenceError

Error info.

DocumentIntelligenceInnerError
An object containing more specific information about the error.

Name    Type    Description
code    
string

One of a server-defined set of error codes.

innererror    
DocumentIntelligenceInnerError

Inner error.

message    
string

A human-readable representation of the error.

In this article
URI Parameters
Responses
Security
Examples

     200 OK
     Content-Type: application/pdf

Parametr Stránky

Kolekce stránek je seznam stránek v dokumentu. Každá stránka je v dokumentu reprezentována postupně a zahrnuje úhel orientace označující, jestli je stránka otočena, a šířku a výšku (rozměry v pixelech). Jednotky stránky ve výstupu modelu se počítají, jak je znázorněno níže:

Formát souboru Vypočítaná jednotka stránky Celkový počet stránek
Obrázky (JPEG/JPG, PNG, BMP, HEIF) Každý obrázek = 1 jednotka stránky Celkový počet obrázků
soubor PDF Každá stránka v PDF = 1 jednotka stránky Celkový počet stran v PDF
formát TIFF Každý obrázek v jednotce TIFF = 1 stránka Celkový počet obrázků ve formátu TIFF
Word (DOCX) Až 3 000 znaků = 1 jednotka stránky, vložené nebo propojené obrázky nejsou podporovány. Celkový počet stránek, každá o délce až 3 000 znaků
Excel (XLSX) Každý list = 1 jednotka stránky, vložené nebo propojené obrázky nejsou podporovány. Celkový počet pracovních listů
PowerPoint (PPTX) Každý snímek = 1 jednotka stránky, vložené nebo propojené obrázky se nepodporují. Celkový počet snímků
jazyk HTML Až 3 000 znaků = 1 jednotka stránky, vložené nebo propojené obrázky nejsou podporovány. Celkový počet stránek o délce až 3 000 znaků každá
    # Analyze pages.
    for page in result.pages:
        print(f"----Analyzing document from page #{page.page_number}----")
        print(f"Page has width: {page.width} and height: {page.height}, measured with unit: {page.unit}")

Použití stránek pro extrakci textu

U velkých vícestrákových dokumentů PDF použijte pages parametr dotazu k označení konkrétních čísel stránek nebo rozsahů stránek pro extrakci textu.

Extrahování odstavců

Model Read OCR ve službě Document Intelligence extrahuje všechny rozpoznané bloky textu v kolekci paragraphs jako objekt nejvyšší úrovně pod analyzeResults. Každá položka v této kolekci představuje blok textu a zahrnuje extrahovaný text jakocontent a ohraničující polygon souřadnice. Informace span ukazují na fragment textu v rámci vlastnosti nejvyšší úrovně content , která obsahuje celý text z dokumentu.

    "paragraphs": [
        {
            "spans": [],
            "boundingRegions": [],
            "content": "While healthcare is still in the early stages of its Al journey, we are seeing pharmaceutical and other life sciences organizations making major investments in Al and related technologies.\" TOM LAWRY | National Director for Al, Health and Life Sciences | Microsoft"
        }
    ]

Extrakce textu, řádků a slov

Model Read OCR extrahuje tištěný a rukopisný text jako lines a words. Model vrací souřadnice ohraničovacího rámečku polygon a confidence pro extrahovaná slova. Kolekce styles zahrnuje všechny rukopisné styly čar, jsou-li rozpoznány, spolu s úseky odkazujícími na přidružený text. Tato funkce se vztahuje na podporované ručně psané jazyky.

V případě Microsoft Wordu, Excelu, PowerPointu a HTML extrahuje model Document Intelligence Read v3.1 a novější verze veškerý vložený text tak, jak je. Texty jsou extrahovány jako slova a odstavce. Vložené obrázky nejsou podporované.

    # Analyze lines.
    if page.lines:
        for line_idx, line in enumerate(page.lines):
            words = get_words(page, line)
            print(
                f"...Line # {line_idx} has {len(words)} words and text '{line.content}' within bounding polygon '{line.polygon}'"
            )

            # Analyze words.
            for word in words:
                print(f"......Word '{word.content}' has a confidence of {word.confidence}")

Extrakce ručně psaného stylu

Odpověď zahrnuje klasifikaci, jestli je každý řádek textu ve stylu rukopisu nebo ne, spolu se skóre spolehlivosti. Další informace najdete vtématu podpora rukou psaného jazyka. Následující příklad ukazuje příklad fragmentu kódu JSON.

    "styles": [
    {
        "confidence": 0.95,
        "spans": [
        {
            "offset": 509,
            "length": 24
        }
        "isHandwritten": true
        ]
    }

Pokud jste povolili funkci doplňku písmo/styl, získáte také výsledek pro písmo/styl jako součást objektu styles.

Další kroky v4.0

Dokončení rychlého startu pro funkci Document Intelligence:

Prozkoumejte naše rozhraní REST API:

Další ukázky najdete na GitHubu:

Tento obsah se vztahuje na:Zaškrtnutív3.1 (GA) | Nejnovější verze:nachová značka zaškrtnutív4.0 (GA) | Předchozí verze:modrá značka zaškrtnutív3.0

Tento obsah se vztahuje na:checkmarkv3.0 (GA) | Nejnovější verze:purple-checkmarkv4.0 (GA)purple-checkmarkv3.1

Důležité

Azure rozhraní API Document Intelligence v3.0 (2022-08-31) dosáhne konce podpory 30. března 2029. Abyste se vyhnuli přerušení provozu, použijte Azure Document Intelligence 2024-11-30 v4.0 pro všechny nové vývojové funkce a migrujte stávající úlohy do Azure Document Intelligence 2024-11-30 v4.0 před tímto datem. Pokyny k migraci najdete v průvodci migrací funkce Document Intelligence.

Poznámka:

Pokud chcete extrahovat text z externích obrázků, jako jsou popisky, znaky ulice a plakáty, použijte funkci Čtení azure Image Analysis v4.0 optimalizovanou pro obecné (nedokumentované) obrázky s synchronním rozhraním API s vylepšeným výkonem. Tato funkce usnadňuje vkládání OCR ve scénářích uživatelského prostředí v reálném čase.

Model OCR (Document Intelligence Read Optické rozpoznávání znaků) běží s vyšším rozlišením než Azure Vision Read a extrahuje tisk a rukou psaný text z dokumentů PDF a naskenovaných obrázků. Obsahuje také podporu pro extrahování textu z dokumentů Microsoft Wordu, Excelu, PowerPointu a HTML. Rozpozná odstavce, řádky textu, slova, umístění a jazyky. Model pro čtení je podkladovým modulem OCR pro další předem vytvořené modely document intelligence, jako jsou rozložení, obecný dokument, faktura, potvrzení, dokument identity (ID), karta zdravotní pojištění, W2 kromě vlastních modelů.

Co je OCR pro dokumenty?

Optické rozpoznávání znaků (OCR) pro dokumenty je optimalizované pro velké textové dokumenty ve více formátech souborů a globálních jazycích. Obsahuje funkce, jako je skenování obrázků dokumentů s vyšším rozlišením pro lepší zpracování menšího a zhuštěného textu; detekce odstavce; a správu vyplnitelných formulářů. Funkce OCR také zahrnují pokročilé scénáře, jako jsou pole s jedním znakem a přesná extrakce klíčových polí běžně zjištěných v fakturách, účtech a dalších předem připravených scénářích.

Možnosti vývoje

Document Intelligence v3.1 podporuje následující nástroje, aplikace a knihovny:

Funkce Zdroje informací ID modelu
Čtení modelu OCR Document Intelligence Studio
REST API
C# SDK
Python SDK
Java SDK
JavaScript SDK
předpřipravené čtení

Document Intelligence v3.0 podporuje následující nástroje, aplikace a knihovny:

Funkce Zdroje informací ID modelu
Čtení modelu OCR Document Intelligence Studio
REST API
C# SDK
Python SDK
Java SDK
JavaScript SDK
předpřipravené čtení

Požadavky na vstup

Podporují se následující formáty souborů.

Model soubor PDF Obrázek:
JPEG/JPG, PNG, BMP, TIFF, HEIF
Office:
Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML
Přečteno
Rozložení
Obecný dokument
Předem sestavený
Vlastní extrakce
Vlastní klasifikace
  • Fotky a skenování: Nejlepších výsledků dosáhnete tak, že poskytnete jednu jasnou fotku nebo vysoce kvalitní skenování na dokument.
  • SOUBORY PDF a TIFF: U souborů PDF a TIFF je možné zpracovat až 2 000 stránek. (S předplatným úrovně Free se zpracovávají pouze první dvě stránky.)
  • Velikost souboru: Velikost souboru pro analýzu dokumentů je 500 MB pro placenou úroveň (S0) a 4 MB pro bezplatnou úroveň (F0).
  • Rozměry obrázku: Rozměry musí být mezi 50 pixely x 50 pixelů a 10 000 pixelů x 10 000 pixelů.
  • Zámky hesel: Pokud jsou soubory PDF uzamčené heslem, musíte zámek před odesláním odebrat.
  • Výška textu: Minimální výška extrahovaného textu je 12 pixelů pro obrázek o velikosti 1024 x 768 pixelů. Tento rozměr odpovídá přibližně textu o velikosti 8 bodů při rozlišení 150 bodů na palec.
  • Trénování vlastního modelu: Maximální počet stránek pro trénovací data je 500 pro vlastní model šablony a 50 000 pro vlastní neurální model.
  • Trénování vlastního modelu extrakce: Celková velikost trénovacích dat je 50 MB pro model šablony a 1 GB pro neurální model.
  • Trénování modelu vlastní klasifikace: Celková velikost trénovacích dat je 1 GB s maximálně 10 000 stránkami. V případě 2024-11-30 (GA) je celková velikost trénovacích dat 2 GB s maximálně 10 000 stránkami.
  • Typy souborů Office (DOCX, XLSX, PPTX):: Maximální limit délky řetězce je 8 milionů znaků.

Začínáme s modelem Read

Zkuste extrahovat text z formulářů a dokumentů pomocí nástroje Document Intelligence Studio. Potřebujete následující prostředky:

  • Předplatné Azure – můžete si ho zdarma vytvořit.

  • Instance služby Document Intelligence na portálu Azure K vyzkoušení služby můžete použít cenovou úroveň Free (F0). Po nasazení prostředku vyberte Přejít k prostředku a získejte klíč a koncový bod.

Snímek obrazovky s klíči a umístěním koncového bodu na webu Azure Portal

Poznámka:

Sada Document Intelligence Studio v současné době nepodporuje formáty souborů Microsoft Wordu, Excelu, PowerPointu a HTML.

Ukázkový dokument zpracovaný pomocí nástroje Document Intelligence Studio

Snímek obrazovky se zpracováním čtení v nástroji Document Intelligence Studio

  1. Na domovské stránce nástroje Document Intelligence Studio vyberte Číst.

  2. Můžete analyzovat ukázkový dokument nebo nahrát vlastní soubory.

  3. Vyberte tlačítko Spustit analýzu a v případě potřeby nakonfigurujte možnosti Analyzovat:

    Snímek obrazovky tlačítek Spustit analýzu a Možnosti analýzy v nástroji Document Intelligence Studio.

Podporované jazyky a národní prostředí

Úplný seznam podporovaných jazyků najdete na stránce s modely analýzy dokumentů.

Extrakce dat

Poznámka:

Soubor Microsoft Word a HTML jsou podporovány ve verzi 4.0. V současné době se nepodporují následující možnosti:

  • Pro každý objekt stránky se nevrací úhel, šířka/výška ani jednotka.
  • U žádného zjištěného objektu nebyl nalezen ohraničovací mnohoúhelník ani ohraničovací oblast.
  • Jako vrácený parametr nebyl vrácen žádný rozsah stránek (pages).
  • Žádný lines objekt.

Prohledávatelný SOUBOR PDF

Funkce prohledávatelného PDF umožňuje převést analogové SOUBORY PDF, jako jsou naskenované soubory PDF, do PDF s vloženým textem. Vložený text umožňuje hloubkové vyhledávání textu v extrahovaném obsahu PDF tak, že překryjí zjištěné textové entity nad soubory obrázků.

Důležité

  • V současné době podporuje funkci prohledávatelného PDF pouze model Read OCR prebuilt-read. Při použití této funkce zadejte modelId jako prebuilt-read. Jiné typy modelů vrací chybu.
  • Prohledávatelný SOUBOR PDF je součástí 2024-11-30prebuilt-read modelu bez přidání nákladů na generování prohledávatelného výstupu PDF.
    • Formát PDF, který lze prohledávat, momentálně jako vstup podporuje jenom soubory PDF.

Použití prohledávatelného PDF

Pokud chcete použít prohledávatelný SOUBOR PDF, vytvořte POST požadavek pomocí Analyze operace a zadejte výstupní formát takto pdf:


    POST /documentModels/prebuilt-read:analyze?output=pdf
    {...}
    202

Hlasování o dokončení Analyze operace. Po dokončení operace odešlete požadavek GET na načtení výsledků operace Analyze ve formátu PDF.

Po úspěšném dokončení lze soubor PDF načíst a stáhnout jako application/pdf. Tato operace umožňuje přímé stažení vloženého textového formátu PDF místo formátu JSON s kódováním Base64.


    // Monitor the operation until completion.
    GET /documentModels/prebuilt-read/analyzeResults/{resultId}
    200
    {...}

    // Upon successful completion, retrieve the PDF as application/pdf.
    GET /documentModels/prebuilt-read/analyzeResults/{resultId}/pdf
    200 OK
    Content-Type: application/pdf

Stránky

Kolekce stránek je seznam stránek v dokumentu. Každá stránka je v dokumentu reprezentována postupně a zahrnuje úhel orientace označující, jestli je stránka otočena, a šířku a výšku (rozměry v pixelech). Jednotky stránky ve výstupu modelu se počítají, jak je znázorněno níže:

Formát souboru Vypočítaná jednotka stránky Celkový počet stránek
Obrázky (JPEG/JPG, PNG, BMP, HEIF) Každý obrázek = 1 jednotka stránky Celkový počet obrázků
soubor PDF Každá stránka v PDF = 1 jednotka stránky Celkový počet stran v PDF
formát TIFF Každý obrázek v jednotce TIFF = 1 stránka Celkový počet obrázků ve formátu TIFF
Word (DOCX) Až 3 000 znaků = 1 jednotka stránky, vložené nebo propojené obrázky nejsou podporovány. Celkový počet stránek o délce až 3 000 znaků každá
Excel (XLSX) Každý list = 1 jednotka stránky, vložené nebo propojené obrázky nejsou podporovány. Celkový počet pracovních listů
PowerPoint (PPTX) Každý snímek = 1 jednotka stránky, vložené nebo propojené obrázky se nepodporují. Celkový počet snímků
jazyk HTML Až 3 000 znaků = 1 jednotka stránky, vložené nebo propojené obrázky nejsou podporovány. Celkový počet stránek o délce až 3 000 znaků každá
    "pages": [
        {
            "pageNumber": 1,
            "angle": 0,
            "width": 915,
            "height": 1190,
            "unit": "pixel",
            "words": [],
            "lines": [],
            "spans": []
        }
    ]
    # Analyze pages.
    for page in result.pages:
        print(f"----Analyzing document from page #{page.page_number}----")
        print(
            f"Page has width: {page.width} and height: {page.height}, measured with unit: {page.unit}"
        )

Výběr stránek pro extrakci textu

U velkých vícestrákových dokumentů PDF použijte pages parametr dotazu k označení konkrétních čísel stránek nebo rozsahů stránek pro extrakci textu.

Odstavce

Model Read OCR ve službě Document Intelligence extrahuje všechny rozpoznané bloky textu v kolekci paragraphs jako objekt nejvyšší úrovně pod analyzeResults. Každá položka v této kolekci představuje blok textu a zahrnuje extrahovaný text jakocontent a ohraničující polygon souřadnice. Informace span ukazují na fragment textu v rámci vlastnosti nejvyšší úrovně content , která obsahuje celý text z dokumentu.

    "paragraphs": [
        {
            "spans": [],
            "boundingRegions": [],
            "content": "While healthcare is still in the early stages of its Al journey, we are seeing pharmaceutical and other life sciences organizations making major investments in Al and related technologies.\" TOM LAWRY | National Director for Al, Health and Life Sciences | Microsoft"
        }
    ]

Text, řádky a slova

Model Read OCR extrahuje tištěný a rukopisný text jako lines a words. Model vrací souřadnice ohraničovacího rámečku polygon a confidence pro extrahovaná slova. Kolekce styles zahrnuje všechny rukopisné styly čar, jsou-li rozpoznány, spolu s úseky odkazujícími na přidružený text. Tato funkce se vztahuje na podporované ručně psané jazyky.

V případě Microsoft Wordu, Excelu, PowerPointu a HTML extrahuje model Document Intelligence Read v3.1 a novější verze veškerý vložený text tak, jak je. Texty jsou extrahovány jako slova a odstavce. Vložené obrázky nejsou podporované.


    "words": [
        {
            "content": "While",
            "polygon": [],
            "confidence": 0.997,
            "span": {}
        },
    ],
    "lines": [
        {
            "content": "While healthcare is still in the early stages of its Al journey, we",
            "polygon": [],
            "spans": [],
        }
    ]
    # Analyze lines.
    for line_idx, line in enumerate(page.lines):
        words = line.get_words()
        print(
            f"...Line # {line_idx} has {len(words)} words and text '{line.content}' within bounding polygon '{format_polygon(line.polygon)}'"
        )

        # Analyze words.
        for word in words:
            print(
                f"......Word '{word.content}' has a confidence of {word.confidence}"
            )

Ručně psaný styl pro řádky textu

Odpověď zahrnuje klasifikaci, jestli je každý řádek textu ve stylu rukopisu nebo ne, spolu se skóre spolehlivosti. Další informace najdete vtématu podpora rukou psaného jazyka. Následující příklad ukazuje příklad fragmentu kódu JSON.

    "styles": [
    {
        "confidence": 0.95,
        "spans": [
        {
            "offset": 509,
            "length": 24
        }
        "isHandwritten": true
        ]
    }

Pokud jste povolili funkci doplňku písmo/styl, získáte také výsledek pro písmo/styl jako součást objektu styles.

Další kroky

Dokončení rychlého startu pro funkci Document Intelligence:

Prozkoumejte naše rozhraní REST API:

Další ukázky najdete na GitHubu:

Migrace úloh v3.0 do verze 4.0 před 30. březnem 2029 Postup migrace najdete v průvodci migrací funkce Document Intelligence.