Pemrosesan dokumen cerdas

Pemrosesan Dokumen Cerdas (IDP) mengonversi konten yang tidak terstruktur—seperti PDF, file DOCX, gambar, dan presentasi—menjadi data terstruktur dan diperkaya yang mendukung agen hilir, aplikasi, dan analitik.

Azure Databricks memberi Anda dua cara menjalankan IDP, keduanya dibangun di atas fungsi AI yang dikembangkan oleh penelitian yang sama:

  • Agent Bricks UI: Pengalaman visual tanpa kode untuk memparsing, mengekstrak, dan mengklasifikasikan dokumen. Gunakan untuk menguji dokumen contoh, menyempurnakan skema atau label, dan memvalidasi hasil secara visual sebelum Anda melakukan skala.
  • Fungsi SQL AI: Jalankan fungsi pemrosesan dokumen cerdas langsung di Lakehouse. Gunakan fitur-fitur tersebut untuk memproses dokumen dalam skala besar, menggabungkan tahapan, dan membangun pipeline tingkat produksi dengan tata kelola di Lakeflow Pipelines.

Kemampuan pemrosesan dokumen yang cerdas

Kemampuan Agent Bricks UI Fungsi SQL
Konversi PDF, DOCX, gambar, dan PPT menjadi teks terstruktur, tabel, dan deskripsi gambar. Penguraian Dokumen ai_parse_document
Tarik bidang terstruktur dari dokumen atau teks biasa menggunakan skema yang Anda tentukan. Ekstraksi Informasi ai_extract
Tetapkan kategori yang telah ditentukan sebelumnya ke dokumen atau teks, mendukung hingga 500+ label. Klasifikasi ai_classify
Ubah dokumen yang telah diurai menjadi segmen semantik yang siap digunakan untuk retrieval-augmented generation (RAG) dan pengindeksan AI Search. ai_prep_search (Beta)

Kasus penggunaan umum

IDP di Azure Databricks mendukung berbagai aplikasi hilir:

  • Retrieval-augmented generation (RAG): Mengurai dan menyusun dokumen untuk meningkatkan pengelompokan, kualitas pengambilan, dan pemahaman dasar untuk aplikasi LLM.
  • Ekstraksi dan analitik pengetahuan: Ekstrak bidang kunci dan metadata untuk mengaktifkan pencarian, pelaporan, dan kecerdasan bisnis pada data dokumen.
  • Alur kerja berbasis agen: Merutekan, mengklasifikasikan, dan memperkaya dokumen untuk mendukung pengambilan keputusan otomatis dan eksekusi tugas.
  • Pemahaman dan klasifikasi dokumen: Mengatur korpora dokumen besar menurut jenis, topik, atau konten untuk pemrosesan hilir.

Cara kerjanya

Azure Databricks memungkinkan pemrosesan dokumen cerdas sebagai alur kerja end-to-end terpadu di Lakehouse. Analisis penyerapan, penguraian, pengayaan, dan hilir dibangun pada satu platform, sehingga setiap tahap bekerja dengan mulus bersama-sama tanpa memerlukan integrasi atau pergerakan data yang kompleks.

  1. Menyerap dan mengatur

    Gunakan alur Lakeflow untuk menyerap dokumen mentah (seperti PDF, gambar, dan file DOCX) dan mengatur alur Anda. Karena penyerapan dan orkestrasi terintegrasi secara asli dengan Lakehouse, dokumen mengalir langsung ke pemrosesan hilir tanpa infrastruktur tambahan.

  2. Menganalisis dokumen (Lapisan perunggu)

    Terapkan ai_parse_document untuk mengonversi file mentah menjadi representasi terstruktur. Ini membuat lapisan perunggu yang distandarisasi yang menangkap teks, deskripsi tabel/gambar, serta struktur dokumen, membentuk fondasi yang konsisten untuk semua kasus penggunaan berikutnya.

  3. Mengekstrak dan mengklasifikasikan

    Gunakan ai_extract dan ai_classify untuk memperkaya dokumen yang diurai dengan bidang dan metadata terstruktur. Fungsi-fungsi ini beroperasi langsung pada output yang diurai, memungkinkan Anda mengekstrak informasi utama, mengklasifikasikan dokumen, dan merutekannya melalui alur kerja tanpa langkah transformasi tambahan.

  4. Persiapkan untuk penelusuran (RAG)

    Terapkan ai_prep_search (Beta) untuk mengubah dokumen yang diurai menjadi gugus semantik yang diperkaya dengan konteks tingkat dokumen seperti judul, header bagian, dan referensi halaman. Output tersebut diformat untuk pengindeksan AI Search, sehingga memberikan landasan yang konsisten untuk RAG dan beban kerja pengambilan data.

  5. Menganalisis dan mengoprasionalkan

    Manfaatkan Fungsi AI tambahan atau alat lain (dasbor AI/BI, Aplikasi, Pencarian AI) untuk analitik hilir, pengambilan (RAG), dan alur kerja berbasis agen. Karena semua data tetap berada di Lakehouse, data dokumen terstruktur dapat segera digunakan untuk pencarian, dasbor, dan aplikasi.