Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Inteligentní zpracování dokumentů (IDP) převádí nestrukturovaný obsah, jako jsou soubory PDF, soubory DOCX, obrázky a prezentace, na strukturovaná, rozšířená data, která pomůžou podřízeným agentům, aplikacím a analýzám.
Azure Databricks vám nabízí dva způsoby, jak spustit IDP, oba založené na stejných výzkumem vyvinutých AI funkcích:
- Agent Bricks UI: Vizuální zážitek bez kódu pro parsování, extrakci a klasifikaci dokumentů. Použijte ho k testování vzorových dokumentů, zpřesnění schématu nebo štítků a vizuální ověření výsledků před škálováním.
- SQL AI funkce: Spouštějte inteligentní funkce zpracování dokumentů přímo na Lakehouse. Použijte je k zpracování dokumentů ve velkém měřítku, společnému sestavování fází a budování řízených, produkčních pipeline v Lakeflow pipeline.
Inteligentní schopnosti zpracování dokumentů
| Schopnosti | Uživatelské rozhraní Agent Bricks | SQL funkce |
|---|---|---|
| Převeďte soubory PDF, DOCX, obrázky a PPT na strukturovaný text, tabulky a popisy obrázků. | Parsování dokumentů | ai_parse_document |
| Načítejte strukturovaná pole z dokumentů nebo prostého textu pomocí schématu, které definujete. | Extrakce informací | ai_extract |
| Přiřaďte k dokumentům nebo textu předdefinované kategorie, které podporují až 500+ popisků. | Klasifikace | ai_classify |
| Transformujte parsované dokumenty do sémantických bloků připravených pro generování rozšířené o vyhledávání (RAG) a pro indexování v AI Search. |
ai_prep_search (Beta) |
Běžné případy použití
Protokol IDP v Azure Databricks využívá širokou škálu podřízených aplikací:
- Generování rozšířeného načítání (RAG): Parsování a strukturování dokumentů za účelem zlepšení bloků dat, kvality načítání a uzemnění pro aplikace LLM.
- Extrakce a analýza znalostí: Extrahujte klíčová pole a metadata, abyste umožnili vyhledávání, vytváření sestav a business intelligence v datech dokumentu.
- Pracovní postupy řízené agenty: Směrování, klasifikace a rozšiřování dokumentů pro podporu automatizovaného rozhodování a provádění úkolů.
- Porozumění a klasifikace dokumentů: Uspořádejte velké korpory dokumentů podle typu, tématu nebo obsahu pro zpracování v podřízené oblasti.
Jak to funguje
Azure Databricks umožňuje inteligentní zpracování dokumentů jako jednotný komplexní pracovní postup v Lakehouse. Příjem dat, analýza, rozšiřování a podřízená analýza jsou založené na jedné platformě, takže každá fáze bez problémů funguje bez nutnosti složité integrace nebo přesunu dat.
Ingestování a orchestrace
Kanály Lakeflow můžete použít k ingestování nezpracovaných dokumentů (například souborů PDF, obrázků a souborů DOCX) a orchestraci kanálů. Vzhledem k tomu, že příjem dat a orchestrace jsou nativně integrovány se službou Lakehouse, dokumenty proudí přímo do podřízeného zpracování bez další infrastruktury.
Analýza dokumentů (bronzová vrstva)
Použijte
ai_parse_documentk převodu surových souborů na strukturované reprezentace. Tím se vytvoří standardizovaná bronzová vrstva, která zachycuje text, tabulky a popisy obrázků a strukturu dokumentů, což tvoří konzistentní základ pro všechny případy použití v podřízeném směru.Extrakce a klasifikace
Používejte
ai_extractaai_classifyrozšiřujte parsované dokumenty strukturovanými poli a metadaty. Tyto funkce fungují přímo na analyzovaných výstupech a umožňují extrahovat klíčové informace, klasifikovat dokumenty a směrovat je prostřednictvím pracovních postupů bez dalších kroků transformace.Příprava na načtení (RAG)
Použijte
ai_prep_search(Beta) k transformaci analyzovaných dokumentů na sémantické bloky dat obohacené kontextem na úrovni dokumentu, jako jsou názvy, záhlaví oddílů a odkazy na stránky. Výstup je naformátován pro indexování v AI Search a poskytuje konzistentní základ pro úlohy RAG a vyhledávání.Analýza a zprovoznění
Využijte další funkce AI nebo jiné nástroje (řídicí panely AI/BI, aplikace, vyhledávání AI) pro podřízené analýzy, načítání (RAG) a pracovní postupy řízené agenty. Vzhledem k tomu, že všechna data zůstávají v Lakehouse, dají se data strukturovaných dokumentů okamžitě použít pro vyhledávání, řídicí panely a aplikace.