Model Kustom untuk Kecerdasan Dokumen

Konten ini berlaku untuk:centangv4.0 (GA) | Versi sebelumnya:centang biruv3.1 (GA)centang merahv3.0 (menghentikan)centang merahv2.1 (menghentikan)

Konten ini berlaku untuk:checkmarkv3.1 (GA) | Versi terbaru:purple-checkmarkv4.0 (GA) | Versi sebelumnya:blue-checkmarkv3.0blue-checkmarkv2.1

Konten ini berlaku untuk:red-checkmarkv3.0 (pensiun) | Versi terbaru:purple-checkmarkv4.0 (GA)purple-checkmarkv3.1 | Versi sebelumnya:blue-checkmarkv2.1 (pensiun)

Konten ini berlaku untuk:red-checkmarkv2.1 | Versi terbaru:blue-checkmarkv4.0 (GA)

Kecerdasan Dokumen menggunakan teknologi pembelajaran mesin canggih untuk mengidentifikasi dokumen, mendeteksi dan mengekstrak informasi dari formulir dan dokumen, dan mengembalikan data yang diekstrak dalam output JSON terstruktur. Dengan Kecerdasan Dokumen, Anda dapat menggunakan model analisis dokumen, model bawaan atau terlatih, atau model kustom mandiri yang Anda latih.

Model kustom sekarang menyertakan model klasifikasi kustom untuk skenario di mana Anda perlu mengidentifikasi jenis dokumen sebelum memanggil model ekstraksi. Model pengklasifikasi tersedia dimulai dengan 2023-07-31 (GA) API. Model klasifikasi dapat dipasangkan dengan model ekstraksi kustom untuk menganalisis dan mengekstrak bidang dari formulir dan dokumen khusus untuk bisnis Anda. Model ekstraksi kustom mandiri dapat dikombinasikan untuk membuat model yang disusun.

Jenis model dokumen kustom

Model dokumen kustom dapat berupa salah satu dari dua jenis, templat kustom atau formulir kustom dan model dokumen kustom atau neural kustom . Proses pelabelan dan pelatihan untuk kedua model identik, tetapi modelnya berbeda sebagai berikut:

Model ekstraksi kustomisasi

Untuk membuat model ekstraksi kustom, beri label himpunan data dokumen dengan nilai yang ingin Anda ekstrak dan latih model pada himpunan data berlabel. Anda hanya memerlukan lima contoh formulir atau jenis dokumen yang sama untuk memulai.

Model neural khusus

Penting

API Kecerdasan v4.0 2024-11-30 (GA) Dokumen mendukung model neural kustom untuk bidang tumpang tindih, deteksi tanda tangan, dan keyakinan tingkat tabel, baris, dan sel.

Model neural kustom (dokumen kustom) menggunakan model pembelajaran mendalam dan model dasar yang dilatih pada kumpulan dokumen yang besar. Model ini kemudian disempurnakan atau disesuaikan dengan data Anda saat Anda melatih model dengan himpunan data berlabel. Model neural kustom mendukung ekstraksi bidang data utama dari dokumen terstruktur, semi terstruktur, dan tidak terstruktur. Saat Anda memilih antara dua jenis model, mulailah dengan model neural untuk menentukan apakah model tersebut memenuhi kebutuhan fungsi anda. Dengan V4.0, model neural kustom mendukung deteksi tanda tangan, keyakinan tabel, dan bidang yang tumpang tindih. Lihat model neural untuk mempelajari selengkapnya tentang model dokumen kustom.

Model templat kustom

Templat kustom atau model formulir kustom bergantung pada templat visual yang konsisten untuk mengekstrak data berlabel. Variasi pada struktur visual dokumen Anda memengaruhi akurasi model Anda. Bentuk terstruktur seperti kuesioner atau aplikasi adalah contoh templat visual yang konsisten.

Set pelatihan Anda terdiri dari dokumen terstruktur di mana pemformatan dan tata letak statis dan konstanta dari satu instans dokumen ke instans dokumen berikutnya. Model templat kustom mendukung pasangan kunci-nilai, tanda pilihan, tabel, bidang tanda tangan, dan wilayah. Model template dan dapat dilatih pada dokumen dalam berbagai bahasa yang didukung. Untuk informasi selengkapnya, lihatmodel templat kustom.

Jika bahasa dokumen dan skenario ekstraksi Anda mendukung model neural kustom, kami sarankan Anda menggunakan model neural kustom melalui model templat untuk akurasi yang lebih tinggi.

Tips

Untuk mengonfirmasi bahwa dokumen pelatihan Anda menyajikan templat visual yang konsisten, hapus semua data yang dimasukkan pengguna dari setiap formulir dalam set. Jika formulir kosong identik dalam tampilan, formulir tersebut mewakili templat visual yang konsisten.

Untuk informasi selengkapnya, lihatMenginterpretasikan dan meningkatkan akurasi dan kepercayaan diri untuk model kustom.

Persyaratan input

  • Untuk hasil terbaik, berikan satu foto yang jelas atau pemindaian berkualitas tinggi per dokumen.

  • Format file yang didukung:

    Model PDF Gambar:
    jpeg/jpg, , pngbmp, tiff, ,heif
    Microsoft Office:
    Word (docx), Excel (xlsx), PowerPoint (pptx)
    Baca
    Tata letak
    Dokumen Umum
    Prabangun
    Ekstraksi kustom
    Klasifikasi kustom

    ✱ file Microsoft Office saat ini tidak didukung untuk model atau versi lain.

  • Untuk PDF dan TIFF, hingga 2.000 halaman dapat diproses (dengan langganan tingkat gratis, hanya dua halaman pertama yang diproses).

  • Ukuran file untuk menganalisis dokumen adalah 500 MB untuk tingkat berbayar (S0) dan 4 MB secara gratis (F0).

  • Dimensi gambar harus antara 50 x 50 piksel dan 10.000 piksel x 10.000 piksel.

  • Jika PDF Anda dikunci kata sandi, Anda harus menghapus kunci sebelum pengiriman.

  • Tinggi minimum teks yang akan diekstrak adalah 12 piksel untuk gambar piksel 1024 x 768. Dimensi ini sesuai dengan 8-titik teks pada 150 titik per inci.

  • Untuk pelatihan model kustom, jumlah maksimum halaman untuk data pelatihan adalah 500 untuk model templat kustom dan 50.000 untuk model neural kustom.

  • Untuk pelatihan model ekstraksi kustom, ukuran total data pelatihan adalah 50 MB untuk model templat dan 1 GB untuk model neural.

  • Untuk pelatihan model klasifikasi kustom, ukuran total data pelatihan adalah 1 GB dengan maksimum 10.000 halaman.

Data pelatihan yang optimal

Data input pelatihan adalah dasar dari model pembelajaran mesin apa pun. Ini menentukan kualitas, akurasi, dan performa model. Oleh karena itu, sangat penting untuk membuat data input pelatihan terbaik yang mungkin untuk proyek Kecerdasan Dokumen Anda. Saat Anda menggunakan model kustom Kecerdasan Dokumen, Anda menyediakan data pelatihan Anda sendiri. Berikut adalah beberapa tips untuk membantu melatih model Anda secara efektif:

  • Gunakan berbasis teks alih-alih PDF berbasis gambar jika memungkinkan. Salah satu cara untuk mengidentifikasi PDF berbasis gambar*adalah dengan mencoba memilih teks tertentu dalam dokumen. Jika Anda hanya dapat memilih seluruh gambar teks, dokumen berbasis gambar, bukan berbasis teks.

  • Atur dokumen pelatihan Anda dengan menggunakan subfolder untuk setiap format (JPEG/JPG, PNG, BMP, PDF, atau TIFF).

  • Gunakan formulir yang memiliki semua bidang yang tersedia telah diisi.

  • Gunakan formulir dengan nilai yang berbeda di setiap bidang.

  • Gunakan himpunan data yang lebih besar (lebih dari lima dokumen pelatihan) jika gambar Anda berkualitas rendah.

  • Tentukan apakah Anda perlu menggunakan satu model atau beberapa model yang terdiri dari satu model.

  • Pertimbangkan untuk mensegmentasi himpunan data Anda ke dalam folder, di mana setiap folder adalah templat yang unik. Latih satu model per folder, dan gabungkan model yang dihasilkan menjadi satu titik akhir. Akurasi model dapat berkurang ketika Anda memiliki format berbeda yang dianalisis dengan satu model.

  • Pertimbangkan untuk mensegmentasi himpunan data Anda untuk melatih beberapa model jika formulir Anda memiliki variasi dengan format dan hentian halaman. Formulir kustom mengandalkan templat visual yang konsisten.

  • Pastikan Anda memiliki himpunan data seimbang dengan memperhitungkan format, jenis dokumen, dan struktur.

Mode pembangunan

Operasi build custom model menghadirkan dukungan untuk model kustom templat dan neural. Versi REST API dan pustaka klien sebelumnya hanya mendukung mode build tunggal yang sekarang dikenal sebagai mode templat .

  • Model templat hanya menerima dokumen yang memiliki struktur halaman dasar yang sama—tampilan visual yang seragam—atau posisi elemen relatif yang sama dalam dokumen.

  • Model neural mendukung dokumen yang memiliki informasi yang sama, tetapi struktur halaman yang berbeda. Contoh dokumen-dokumen ini termasuk formulir W2 Amerika Serikat, yang berbagi informasi yang sama, tetapi bervariasi dalam penampilan di seluruh perusahaan.

Tabel ini menyediakan tautan ke referensi SDK bahasa pemrograman mode build dan sampel kode pada GitHub:

Bahasa pemrograman Referensi SDK Sampel kode
C#/.NET Struktur DocumentBuildMode Sample_BuildCustomModelAsync
Java Kelas DocumentBuildMode BuildDocumentModel
JavaScript Tipe DocumentBuildMode buildModel.js
Python DocumentBuildMode Enum

Membandingkan fitur model

Tabel berikut membandingkan templat kustom dan fitur neural kustom:

Fitur Templat khusus (formulir) Neural Kustom untuk Dokumen
Struktur dokumen Templat, formulir, dan terstruktur Terstruktur, semi terstruktur, dan tidak terstruktur
Waktu pelatihan 1 hingga 5 menit 30 menit hingga 12 jam*
Ekstraksi data Pasangan kunci-nilai, tabel, tanda pilihan, koordinat, dan tanda tangan Pasangan kunci-nilai, tanda pilihan, dan tabel
Bidang yang tumpang tindih Tidak didukung Didukung
Variasi dokumen Memerlukan model untuk setiap variasi Menggunakan model tunggal untuk semua variasi
Dukungan bahasa Templat kustom dukungan bahasa Bahasa mendukung neural kustom

*-Waktu pelatihan default adalah 30 menit, memungkinkan pelatihan berbayar untuk melatih model lebih dari 30 menit. Periksa detail selengkapnya di bawah dukungan pelatihan untuk neural kustom

Model klasifikasi kustom

Klasifikasi dokumen adalah skenario baru yang didukung oleh Kecerdasan Dokumen dengan 2023-07-31 API (v3.1 GA). API pengklasifikasi dokumen mendukung skenario klasifikasi dan pemisahan. Latih model klasifikasi untuk mengidentifikasi berbagai jenis dokumen yang didukung aplikasi Anda. File input untuk model klasifikasi dapat berisi beberapa dokumen dan mengklasifikasikan setiap dokumen dalam rentang halaman terkait. Untuk mempelajari selengkapnya, lihat model klasifikasi kustom.

Catatan

Model v4.0 2024-11-30 (GA) klasifikasi dokumen mendukung jenis dokumen Office untuk klasifikasi. Versi API ini juga memperkenalkan pelatihan inkremental untuk model klasifikasi.

Alat model kustom

Model Kecerdasan Dokumen v3.1 dan yang lebih baru mendukung alat, aplikasi, program, dan pustaka berikut:

Fitur Sumber daya Model ID
Model kustom Document Intelligence Studio
REST API
C# SDK
Python SDK
custom-model-id

Siklus hidup model kustom

Siklus hidup model kustom tergantung pada versi API yang digunakan untuk melatihnya. Jika versi API adalah versi ketersediaan umum (GA), model kustom memiliki siklus hidup yang sama dengan versi tersebut. Model kustom tidak tersedia untuk inferensi saat versi API tidak digunakan lagi. Jika versi API adalah versi pratinjau, model kustom memiliki siklus hidup yang sama dengan versi pratinjau API.

Kecerdasan Dokumen v2.1 mendukung alat, aplikasi, dan pustaka berikut:

Catatan

Jenis model kustom neural dan templat kustom tersedia dengan API Document Intelligence versi v3.1 dan v3.0.

Fitur Sumber daya
Model khusus • Alat
REST API
Pustaka klien SDK
Kontainer Docker Kecerdasan Dokumen

Membangun model kustom

Ekstrak data dari dokumen spesifik atau unik Anda menggunakan model kustom. Anda memerlukan sumber daya berikut:

  • Langganan Azure. Anda dapat membuatnya secara gratis.

  • Instans Document Intelligence di portal Azure. Anda dapat menggunakan tingkat harga gratis (F0) untuk mencoba layanan. Setelah sumber daya Anda disebarkan, pilih Akses sumber daya untuk mendapatkan kunci dan titik akhir Anda.

    Screenshot yang memperlihatkan kunci dan lokasi titik akhir di portal Azure.

Alat Pelabelan Sampel

Tips

  • Untuk pengalaman yang ditingkatkan dan kualitas model tingkat lanjut, coba Document Intelligence v3.0 Studio.
  • Studio v3.0 mendukung model apa pun yang dilatih dengan data berlabel v2.1.
  • Anda dapat merujuk ke panduan migrasi API untuk informasi terperinci tentang migrasi dari v2.1 ke v3.0.
  • LihatREST API atau C#, Java, JavaScript, atau Python SDK ../quickstarts untuk memulai dengan v3.0.
  • Alat Pelabelan Sampel Kecerdasan Dokumen adalah alat sumber terbuka yang memungkinkan Anda menguji fitur terbaru fitur Kecerdasan Dokumen dan Pengenalan Karakter Optik (OCR).

  • Mulai dengan panduan cepat alat Pelabelan Sampel untuk mulai membangun dan menggunakan custom model.

Studio Kecerdasan Dokumen

Catatan

Document Intelligence Studio tersedia dengan API v3.1 dan v3.0.

  1. Pada beranda Studio Kecerdasan Dokumen , pilih Model ekstraksi kustom.

  2. Di bawah Proyek Saya, pilih Buat proyek.

  3. Selesaikan bidang detail proyek.

  4. Konfigurasikan sumber daya layanan dengan menambahkan akun Penyimpanan dan kontainer Blob Anda ke Menyambungkan sumber data pelatihan Anda.

  5. Tinjau dan buat proyek Anda.

  6. Tambahkan dokumen sampel Anda untuk memberi label, membangun, dan menguji model kustom Anda.

Untuk panduan terperinci untuk membuat model ekstraksi kustom pertama Anda, lihatCara membuat model ekstraksi kustom.

Ringkasan ekstraksi model kustom

Tabel ini membandingkan area ekstraksi data yang didukung:

Model Bidang formulir Tanda pilihan Bidang terstruktur (Tabel) Tanda tangan Pelabelan wilayah Bidang yang tumpang tindih
Templat khusus N/a
Neural khusus *

Simbol tabel:
✔ —Didukung
**n/a—Saat ini tidak tersedia;
*-Berulah berbeda tergantung pada model. Dengan model templat, data sintetis dihasilkan pada waktu pelatihan. Dengan model neural, teks yang sudah dikenali dalam area tersebut dipilih.

Tips

Untuk memilih antara dua jenis model, mulailah dengan model neural kustom jika memenuhi kebutuhan fungsi anda. Lihat neural kustom untuk mempelajari selengkapnya tentang model neural kustom.

Opsi pengembangan model kustom

Tabel berikut ini menjelaskan fitur yang tersedia dengan alat dan pustaka klien terkait. Sebagai praktik terbaik, pastikan Anda menggunakan alat yang kompatibel yang tercantum di sini.

Jenis dokumen REST API SDK Model Label dan Pengujian
Templat kustom v 4.0 v3.1 v3.0 Kecerdasan Dokumen 3.1 SDK Kecerdasan Dokumen Studio Kecerdasan Dokumen
Neural kustom v4.0 v3.1 v3.0 Kecerdasan Dokumen 3.1 SDK Kecerdasan Dokumen Studio Kecerdasan Dokumen
Formulir kustom v2.1 API GA Kecerdasan Dokumen 2.1 SDK Kecerdasan Dokumen Alat pelabelan sampel

Catatan

Model templat kustom yang dilatih dengan API 3.0 memiliki beberapa peningkatan atas API 2.1 yang berasal dari peningkatan pada mesin OCR. Himpunan data yang digunakan untuk melatih model templat kustom menggunakan API 2.1 masih dapat digunakan untuk melatih model baru menggunakan API 3.0.

  • Satu foto yang jelas atau pemindaian berkualitas tinggi per dokumen harus disediakan untuk hasil terbaik.

  • Format file yang didukung adalah JPEG/JPG, PNG, BMP, TIFF, dan PDF (disematkan teks atau dipindai). PDF yang disematkan teks adalah yang terbaik untuk menghilangkan kemungkinan kesalahan dalam ekstraksi karakter dan lokasi.

  • File PDF dan TIFF, hingga 2.000 halaman, dapat diproses. Dengan langganan tingkat gratis, hanya dua halaman pertama yang diproses.

  • Ukuran file harus kurang dari 500 MB untuk tingkat berbayar (S0) dan 4 MB secara gratis (F0).

  • Dimensi gambar harus antara 50 x 50 piksel dan 10.000 x 10.000 piksel.

  • Dimensi PDF hingga 17 x 17 inci, sesuai dengan ukuran kertas Legal atau A3, atau lebih kecil.

  • Ukuran total data pelatihan adalah 500 halaman atau kurang.

  • PDF yang dikunci kata sandi harus menghapus kunci kata sandi sebelum pengiriman.

    Tips

    Data pelatihan:

    • Jika memungkinkan, gunakan dokumen PDF berbasis teks alih-alih dokumen berbasis gambar. File PDF yang dipindai diperlakukan sebagai gambar.
    • Pastikan hanya ada satu contoh formulir per dokumen.
    • Untuk formulir yang sudah diisi, gunakan contoh dengan semua kolom terisi.
    • Gunakan formulir dengan nilai yang berbeda di setiap bidang.
    • Jika gambar formulir Anda berkualitas lebih rendah, gunakan himpunan data yang lebih besar. Misalnya, gunakan 10 hingga 15 gambar.

Bahasa dan lokal yang didukung

Lihat halaman Dukungan Bahasa—model kustom untuk daftar lengkap bahasa yang didukung.

Langkah berikutnya