Intelligens dokumentumfeldolgozás

Az intelligens dokumentumfeldolgozás (IDP) strukturálatlan tartalmakat – például PDF-fájlokat, DOCX-fájlokat, képeket és bemutatókat – strukturált, bővített adatokká alakítja át, amelyek az alárendelt ügynököket, alkalmazásokat és elemzéseket működtetik.

Az Azure Databricks három módot kínál az IDP futtatására, mindezt ugyanazon kutatáson kidolgozott AI funkciókon építve:

  • Agent Bricks UI: Kód nélküli, vizuális élmény dokumentumok elemzéséhez, kinyeréséhez és osztályozásához. Használd mintadokumentumok tesztelésére, séma vagy címkék finomítására, valamint vizuálisan az eredmények validálására a skálázás előtt.
  • SQL AI funkciók: Intelligens dokumentumfeldolgozó funkciókat futtatsz közvetlenül a Lakehouse-on. Használd őket dokumentumok nagy léptékű feldolgozására, közös szakaszok összeállítására, és szabályozott, gyártási szintű pipelines építésére a Lakeflow vezetékekben.
  • REST API-k: Ugyanazokat az AI funkciókat hívják alkalmazásokból, szolgáltatásokból és automatizálási munkafolyamatokból.

Intelligens dokumentumfeldolgozási képességek

Képesség Agent Bricks UI SQL függvény REST API
PDF-fájlokat, DOCX-eket, képeket és PPT-ket strukturált szöveggé, táblázattá és ábraleírássá alakíthat. Dokumentumelemzés ai_parse_document AI Parse dokumentum
Strukturált mezők lekérése dokumentumokból vagy egyszerű szövegekből egy ön által definiált sémával. Információ kinyerése ai_extract AI kivonat
Előre definiált kategóriákat rendelhet dokumentumokhoz vagy szövegekhez, amelyek legfeljebb 500 címkét támogatnak. Osztályozás ai_classify AI Classify
Alakítsa át a feldolgozott dokumentumokat olyan szemantikai egységekké, amelyek készen állnak a visszakereséssel támogatott generáláshoz (RAG) és az AI Search általi indexeléshez. ai_prep_search (bétaverzió)

Gyakori használati esetek

Az IDP az Azure Databricks platformon számos alárendelt alkalmazást működtet.

  • Lekéréssel kiegészített generálás (RAG): Dokumentumok elemzése és strukturálása a szegmentálás, lekérési minőség és az LLM-alkalmazások megalapozásának javítása érdekében.
  • Tudáskinyerés és elemzés: Kulcsmezők és metaadatok kinyerése a dokumentumadatok keresésének, jelentésének és üzleti intelligenciájának biztosításához.
  • Ügynökalapú munkafolyamatok: Dokumentumok átirányítása, besorolása és bővítése az automatizált döntéshozatal és feladatvégrehajtás támogatásához.
  • Dokumentumértelmezés és -besorolás: A nagyméretű dokumentum korpuszt típus, témakör vagy tartalom szerint rendezi az alsóbb rétegbeli feldolgozáshoz.

Hogyan működik?

Az Azure Databricks lehetővé teszi az intelligens dokumentumfeldolgozást egységes, végpontok közötti munkafolyamatként a Lakehouse-ban. A betöltési, elemzési, bővítési és alsóbb rétegbeli elemzések egyetlen platformra épülnek, így minden fázis zökkenőmentesen működik együtt anélkül, hogy összetett integrációt vagy adatáthelyezést kellene igényelnie.

  1. Adatbefogadás és folyamatvezérlés

    A Lakeflow-folyamatok használatával betöltheti a nyers dokumentumokat (például PDF-fájlokat, képeket és DOCX-fájlokat), és vezényelheti a folyamatokat. Mivel a betöltés és a vezénylés natív módon integrálva van a Lakehouse-ral, a dokumentumok közvetlenül az alsóbb rétegbeli feldolgozásba kerülnek további infrastruktúra nélkül.

  2. Dokumentumok elemzése (Bronz réteg)

    A nyers fájlok strukturált ábrázolásokká alakítására alkalmazható ai_parse_document . Ez egy szabványosított bronzréteget hoz létre, amely rögzíti a szöveget, a táblázatokat/a képek leírását és a dokumentumstruktúrát, és egységes alapot képez az összes alsóbb rétegbeli használati esethez.

  3. Kinyerés és besorolás

    A ai_extract és ai_classify használatával gazdagítsa az elemzett dokumentumokat strukturált mezőkkel és metaadatokkal. Ezek a függvények közvetlenül az elemzési kimeneteken működnek, lehetővé téve a kulcsadatok kinyerését, a dokumentumok besorolását és a munkafolyamatokon való irányítását további átalakítási lépések nélkül.

  4. Felkészülés a lekérésre (RAG)

    Használja a ai_prep_search (béta) funkciót a feldolgozott dokumentumok dokumentumszintű kontextussal – például címekkel, szakaszcímekkel és oldalhivatkozásokkal – kiegészített szemantikai szegmensekké alakításához. A kimenet az AI Search indexeléséhez van formázva, így konzisztens alapot biztosít a RAG és a lekéréses számítási feladatok számára.

  5. Elemzés és működés

    További AI-függvények vagy egyéb eszközök (AI/BI-irányítópultok, alkalmazások, AI-keresés) használata az alsóbb rétegbeli elemzésekhez, a lekéréshez (RAG) és az ügynökalapú munkafolyamatokhoz. Mivel minden adat a Lakehouse-on marad, a strukturált dokumentumadatok azonnal felhasználhatók kereséshez, irányítópultokhoz és alkalmazásokhoz.