Ekstraksi Informasi

Note

Halaman ini mencakup versi baru Ekstraksi Informasi. Untuk informasi tentang versi sebelumnya, lihat Menggunakan Ekstraksi Informasi (warisan)

Ekstraksi Informasi mengubah dokumen dan teks yang tidak terstruktur menjadi kunci, wawasan terstruktur menggunakan skema yang ditentukan. Ini memungkinkan Anda menggunakan informasi yang disematkan dalam teks, PDF, gambar, atau tabel yang tidak terstruktur secara langsung untuk analisis, pelaporan, atau agen dan aplikasi hilir.

Contoh Ekstraksi Informasi meliputi:

  • Mengekstrak pihak hukum dan persyaratan dari kontrak.
  • Menarik item lini dan syarat pembayaran dari faktur.
  • Menarik detail utama dari catatan medis dan catatan lainnya.

Ekstraksi Informasi dibangun di atas fungsi ai_extractAI . Ekstraksi Informasi memiliki UI visual untuk menyesuaikan dan mengoptimalkan fungsi dengan skema yang ditentukan untuk ekstraksi.

Ekstraksi Informasi menggunakan penyimpanan default untuk menyimpan transformasi data sementara, titik pemeriksaan model, dan metadata internal yang mendukung setiap agen. Saat Anda menghapus agen, Databricks menghapus semua data yang terkait dengan agen dari penyimpanan default.

Persyaratan

Membuat agen Ekstraksi Informasi

Buka ikon Agen.Agen di panel navigasi kiri ruang kerja Anda. Klik Buat Agen>Ekstraksi Informasi.

Langkah 1. Pilih data untuk mengekstrak informasi dari

  1. Pada halaman Mulai dengan data Anda , pilih file atau data yang ingin Anda ekstrak informasinya. Anda dapat melakukan salah satu hal berikut:

    • Seret dan letakkan satu atau beberapa file ke area unggahan, atau klik untuk menelusuri file yang akan diunggah.
    • Klik Pilih volume untuk memilih volume Katalog Unity dengan jenis file yang didukung.
    • Klik Pilih tabel untuk memilih tabel Katalog Unity yang berisi data teks.
  2. Jika Anda memilih tabel, pilih kolom yang berisi data yang akan diekstrak. Anda harus memilih kolom dengan jenis yang didukung, seperti STRING atau VARIAN, sebelum Anda dapat melanjutkan. Jika tabel tidak memiliki kolom yang didukung, pilih tabel lain.

  3. Klik Buat Agen. Tombol ini diaktifkan hanya setelah Anda memilih sumber data yang valid, dan, untuk tabel, kolom yang didukung.

Langkah 2. Mengonfigurasi dan menyempurnakan skema ekstraksi Anda

Setelah proses Ekstraksi Informasi dilakukan pada data Anda, konfigurasikan dan sesuaikan data mana yang ingin Anda ekstrak dari dokumen tersebut.

Tampilan build Ekstrak AI dengan panel konfigurasi skema ekstraksi, dokumen yang diurai, dan output JSON yang diekstrak.

  1. Di bawah Konfigurasi, tentukan skema ekstraksi Anda. Ada beberapa cara untuk melakukan ini:

    • Masukkan bahasa alami yang menjelaskan informasi yang ingin Anda ekstrak dan klik Hasilkan Skema. Ekstraksi Informasi secara otomatis menghasilkan skema JSON dengan nama bidang dan definisi untuk Anda. Edit deskripsi ini sesuai kebutuhan.
    • Atau, klik Atau, Tentukan secara manual untuk menentukan skema Anda secara manual:
      1. Klik Tambahkan bidang.
      2. Masukkan nama bidang, jenis, dan deskripsi Anda.
      3. Klik tombol Konfirmasi.
      4. Ulangi untuk setiap bidang yang ingin Anda ekstrak.
      5. Klik Simpan dan Jalankan ekstraksi.
    • Anda juga dapat mengklik JSON untuk mengedit skema JSON secara langsung. Klik Terapkan Perubahan saat selesai.

    Setiap kali Anda memperbarui skema dan mengklik Simpan dan jalankan ekstraksi, Ekstraksi Informasi memperbarui agen ekstraksi, menjalankan ekstraksi, dan menunjukkan hasil untuk setiap input.

  2. Di sebelah kiri, periksa dokumen yang telah diurai dan hasil ekstraksi agen. Ulangi hasil ekstraksi dalam dua cara yang berbeda. Pertama, berikan umpan balik bahasa alami pada satu atau beberapa input, yang menyetel deskripsi Anda secara otomatis saat Anda menekan Simpan dan jalankan ekstraksi. Kedua, revisi deskripsi skema secara manual, yang berlaku saat Anda menekan Simpan dan jalankan ekstraksi.

  3. Gunakan versi untuk membandingkan atau mengembalikan ke konfigurasi sebelumnya. Klik Versi, lalu klik Bandingkan untuk membandingkan definisi skema versi sebelumnya dengan versi saat ini. Klik Pulihkan untuk memulihkan versi sebelumnya.

Langkah 3. Mengevaluasi dan meningkatkan kualitas ekstraksi

Untuk mengukur seberapa baik performa agen Anda dan meningkatkannya secara sistematis, evaluasi agen terhadap himpunan data berlabel. Evaluasi membandingkan setiap hasil ekstraksi dengan jawaban benar yang sudah diketahui (ground truth), sehingga Anda dapat melacak akurasi pada tingkat field di seluruh versi dan memfokuskan perbaikan pada field yang perlu ditingkatkan.

Menambahkan himpunan data evaluasi

Sebelum menjalankan evaluasi, Anda harus memiliki himpunan data evaluasi di Unity Catalog. Himpunan data harus berupa tabel Katalog Unity dengan dua kolom:

  • Kolom input dengan teks atau dokumen yang akan diekstrak. Ini bisa berupa STRING teks atau VARIANT output dari ai_parse_document.
  • Kolom kebenaran dasar dengan hasil ekstraksi yang diharapkan sebagai string JSON. Setiap nilai harus sesuai dengan skema ekstraksi agen Anda, yang cocok dengan ai_extract skema tingkat lanjut.

Menjalankan evaluasi

Untuk menjalankan evaluasi untuk agen ekstraksi Anda:

  1. Di workbench, buka menu dropdown evaluasi dan klik Jalankan evaluasi. Ini membuka dialog Buat eksekusi evaluasi .
  2. Di tabel Himpunan data evaluasi, pilih tabel Katalog Unity yang menyimpan contoh berlabel Anda.
  3. Di bawah Pemetaan kolom, pilih kolom Input yang menyimpan input agen dan kolom Kebenaran dasar yang menyimpan respons yang diharapkan.
  4. Klik Jalankan evaluasi. Information Extraction menyimpan konfigurasi saat ini sebagai versi baru dan memberi skor pada setiap baris berdasarkan ground truth-nya.

Tinjau hasil evaluasi

Seiring proses berjalan, dokumen terus masuk ke tab Dokumen dan bidang yang tidak sesuai ditampilkan untuk tiap dokumen. Saat eksekusi selesai, Ekstraksi Informasi memperlihatkan tab Gambaran Umum , yang mencakup:

  • Kartu penilaian dengan akurasi keseluruhan bidang dan dokumen yang sepenuhnya benar. Jika ada pelaksanaan evaluasi sebelumnya, kartu skor menampilkan perubahan dibandingkan dengan pelaksanaan tersebut.
  • Tabel Skor per bidang . Klik kolom apa pun untuk membuka tampilan perinciannya, yang menampilkan akurasi, presisi, recall, dan F1. Klik Perlihatkan dokumen yang gagal untuk melihat setiap dokumen yang gagal mengekstrak bidang tersebut dan output yang diekstrak.

Tab Gambaran Umum Evaluasi memperlihatkan akurasi bidang keseluruhan, dokumen yang benar sepenuhnya, rekomendasi Kode Genie, dan tabel skor per bidang.

Beralih ke tab Dokumen untuk memeriksa dokumen individual. Setiap baris memperlihatkan rasio bidang yang cocok dan bidang yang tidak cocok. Gunakan menu dropdown Bidang untuk memfilter dokumen yang memiliki bidang tertentu yang tidak cocok. Klik dokumen untuk membandingkan respons agen dengan kebenaran dasar secara berdampingan.

Menerapkan perbaikan Kode Genie

Setelah eksekusi selesai, Ekstraksi Informasi menganalisis hasil dan menampilkan masalah dalam rekomendasi Kode Genie, yang diberi peringkat berdasarkan jumlah dokumen yang terpengaruh. Setiap temuan menjelaskan potensi masalah kualitas. Klik Perbaiki dengan Genie untuk membuka obrolan Kode Genie interaktif yang mengusulkan perubahan skema dan instruksi, memvalidasinya terhadap dokumen yang terpengaruh, dan menawarkan untuk menjalankan kembali evaluasi penuh.

Panel Kode Genie memperlihatkan skema yang diusulkan dan perubahan instruksi yang divalidasi terhadap dokumen yang terpengaruh.

Langkah 4. Gunakan agen ekstraksi Anda

Setelah Anda puas dengan performa agen, gunakan agen untuk mengekstrak informasi.

Klik Gunakan Agen di kanan atas. Anda dapat memilih:

  • Jalankan di SQL untuk menggunakan agen untuk mengekstrak informasi dari semua data Anda. Ini membuka kueri SQL yang menggunakan ai_extract untuk mengekstrak informasi dari volume atau tabel Anda menggunakan skema yang ditentukan. Untuk informasi selengkapnya tentang penggunaan ai_extract dalam kueri SQL, lihat ai_extract fungsi.
  • Buat alur Lakeflow yang berjalan pada interval terjadwal untuk memanggil agen Anda pada data baru. Ini membuat alur Lakeflow yang memperbarui tabel streaming dengan data yang Anda ekstrak. Anda dapat mengonfigurasi jadwal alur untuk dijalankan saat data baru tiba. Untuk informasi selengkapnya tentang alur Lakeflow, lihat Alur Deklaratif Spark.

Limitations

  • Agen Ekstraksi Informasi memiliki panjang konteks maksimum token 128k.
  • Jenis skema gabungan tidak didukung.