Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Catatan
Pencarian Azure AI tersedia melalui portal Azure, REST API, dan Azure SDK. Ini juga mendukung Foundry IQ, lapisan pengetahuan terkelola yang mengubah konten perusahaan menjadi pangkalan pengetahuan yang dapat digunakan kembali dan sadar izin untuk agen di portal Microsoft Foundry.
Dalam panduan cepat ini, Anda menggunakan wizard
Panduan mulai cepat ini menggunakan PDF berbasis teks dan gambar sederhana dari repositori azure-search-sample-data. Namun, Anda dapat menggunakan file yang berbeda dan tetap menyelesaikan panduan memulai cepat ini.
Tips
Memiliki dokumen yang kaya gambar? Lihat Quickstart: Pencarian multimodal di portal Azure untuk mengekstrak, menyimpan, dan mencari gambar bersama teks.
Prasyarat
Akun Azure dengan langganan aktif. Buat akun secara gratis.
Layanan Pencarian Azure AI. Mulai cepat ini memerlukan tingkat Dasar atau lebih tinggi untuk dukungan identitas terkelola.
Keakraban dengan wizard. Lihat wizard Impor data di portal Azure.
Sumber data yang didukung
Wizard dukung beberapa sumber data Azure. Namun, panduan cepat ini hanya mencakup sumber data yang bekerja dengan file utuh, yang dijelaskan dalam tabel berikut.
| Sumber data | Deskripsi |
|---|---|
| Azure Blob Storage | Sumber data ini berfungsi dengan blob dan tabel. Anda harus menggunakan akun performa standar (tujuan umum v2). Tingkat akses bisa panas, sejuk, atau dingin. |
| Azure Data Lake Storage (ADLS) Gen2 | Ini adalah akun Azure Storage dengan namespace hierarki diaktifkan. Untuk mengonfirmasi bahwa Anda memiliki Data Lake Storage, periksa tab Properties pada halaman Overview. |
| Microsoft OneLake | Sumber data ini tersambung ke file dan pintasan OneLake. |
Model penyematan yang didukung
Portal mendukung model penyematan berikut untuk vektorisasi terintegrasi. Instruksi penyebaran disediakan di bagian selanjutnya.
| Penyedia | Model yang didukung |
|---|---|
| akun multi-layanan Azure AI1 | Untuk teks dan gambar: Azure Vision multimodal |
| Proyek Microsoft Foundry berbasis hub | Untuk teks:
|
| proyek Microsoft Foundry | Untuk teks:
|
| Azure sumber daya OpenAI3, 4 | Untuk teks:
|
1 Untuk tujuan penagihan, Anda harus menautkan akun multi-layanan Anda ke skillset Pencarian Azure AI Anda. Wizard mengharuskan layanan pencarian dan akun multi-layanan Anda berada di wilayah yang didukung same untuk keterampilan penyematan multimodal Azure Vision.
2 Wizard hanya mendukung penyebaran API tanpa server untuk model ini. Anda dapat menggunakan gunakan Azure CLI untuk memprovisikan penyebaran tanpa server.
3 Titik akhir sumber daya OpenAI Azure Anda harus memiliki subdomain kustom, seperti https://my-unique-name.openai.azure.com. Jika Anda membuat sumber daya di portal Azure, subdomain ini dibuat secara otomatis selama penyiapan sumber daya.
4 sumber daya Azure OpenAI (yang memiliki akses ke model embedding) yang dibuat di portal Microsoft Foundry tidak didukung. Anda harus membuat sumber daya OpenAI Azure di portal Azure.
Untuk panduan siklus hidup model terbaru, termasuk penghentian, lihat Penghentian dan penghentian model.
Persyaratan titik akhir publik
Semua sumber daya sebelumnya harus mengaktifkan akses publik sehingga wizard dapat mengaksesnya. Jika tidak, wizard gagal. Setelah wizard berjalan, Anda dapat mengaktifkan firewall dan titik akhir privat pada komponen integrasi untuk keamanan. Untuk informasi selengkapnya, lihat Mengamankan koneksi di wizard impor.
Jika titik akhir privat sudah ada dan Anda tidak dapat menonaktifkannya, opsi alternatifnya adalah menjalankan alur end-to-end dari skrip atau program di mesin virtual. Komputer virtual harus berada di jaringan virtual yang sama dengan titik akhir privat. Berikut adalah sampel kode Python untuk vektorisasi terintegrasi. Repositori GitHub yang sama memiliki sampel dalam bahasa pemrograman lainnya.
Mengonfigurasi akses
Sebelum memulai, pastikan Anda memiliki izin untuk mengakses konten dan operasi. Mulai cepat ini menggunakan Microsoft Entra ID untuk autentikasi dan akses berbasis peran untuk otorisasi. Anda harus menjadi Pemilik atau Administrator Akses Pengguna untuk menetapkan peran. Jika peran fungsional tidak layak, gunakan autentikasi berbasis kunci sebagai gantinya.
Konfigurasikan peran yang diperlukan dan peran bersyarat yang diidentifikasi di bagian ini.
Peran yang diperlukan
Pencarian Azure AI menyediakan alur pencarian vektor. Konfigurasikan akses untuk diri Anda dan layanan pencarian Anda untuk membaca data, menjalankan alur, dan berinteraksi dengan sumber daya Azure lainnya.
Pada layanan Pencarian Azure AI Anda:
Tetapkan peran berikut untuk diri Anda sendiri.
Kontributor Layanan Pencarian
Kontributor Data Indeks Pencarian
Pembaca Data Indeks Pencarian
Peran kondisional
Tab berikut mencakup semua sumber daya yang kompatibel dengan wizard untuk pencarian vektor. Pilih hanya tab yang berlaku untuk sumber data dan model penyematan yang Anda pilih.
Azure Blob Storage dan Azure Data Lake Storage Gen2 mengharuskan layanan pencarian Anda memiliki akses baca ke kontainer penyimpanan.
Di akun Azure Storage Anda:
- Tetapkan Storage Blob Data Reader ke identitas terkelola layanan penelusuran Anda.
Menyiapkan data sampel
Di bagian ini, Anda menyiapkan data sampel untuk sumber data yang Anda pilih.
Buka akun Azure Storage Anda di portal Azure.
Dari panel kiri, pilihKontainer> data.
Buat kontainer, lalu unggah dokumen PDF health-plan yang digunakan untuk panduan cepat ini.
(Opsional) Sinkronkan penghapusan dalam kontainer Anda dengan penghapusan dalam indeks pencarian. Untuk mengonfigurasi pengindeks Anda untuk deteksi penghapusan:
Aktifkan penghapusan sementara di akun penyimpanan Anda. Jika Anda menggunakan penghapusan sementara asli, langkah berikutnya tidak diperlukan.
Tambahkan metadata kustom yang dapat dipindai pengindeks untuk menentukan blob mana yang ditandai untuk dihapus. Beri nama deskriptif properti kustom Anda. Misalnya, beri nama properti "IsDeleted" dan atur ke false. Ulangi langkah ini untuk setiap blob dalam kontainer. Saat Anda ingin menghapus blob, ubah properti menjadi true. Untuk informasi selengkapnya, lihat Ubah dan hapus deteksi saat mengindeks dari Azure Storage.
Menyiapkan model penyematan
Catatan
Jika Anda menggunakan Azure Vision, lewati langkah ini. Penyematan multimodal dibangun ke dalam akun multi-layanan Anda dan tidak memerlukan penyebaran model.
Wizard mendukung beberapa model penyematan dari Azure OpenAI dan katalog model Microsoft Foundry. Untuk menyebarkan model yang diperlukan untuk model embedding yang Anda pilih, lihat Model Microsoft Foundry di portal Foundry.
Memulai wizard
Buka layanan pencarian Anda di portal Azure.
Pada halaman Gambaran Umum , pilih Impor data.
Pilih sumber data Anda: Azure Blob Storage, ADLS Gen2, atau OneLake.
Pilih RAG.
Jalankan wizard
Wizard memandu Anda melalui beberapa langkah konfigurasi. Bagian ini mencakup setiap langkah secara berurutan.
Hubungkan ke data Anda
Dalam langkah ini, Anda menyambungkan Pencarian Azure AI ke sumber data yang Anda pilih untuk penyerapan dan pengindeksan konten.
Pada halaman Hubungkan ke data Anda, pilih langganan Azure Anda.
Pilih akun penyimpanan dan kontainer yang menyediakan data sampel.
Jika Anda mengaktifkan penghapusan sementara dan menambahkan metadata kustom di Menyiapkan data sampel, pilih kotak centang Aktifkan pelacakan penghapusan .
Pada pengindeksan berikutnya, indeks pencarian diperbarui untuk menghapus dokumen pencarian apa pun yang didasarkan pada blob yang dihapus sementara di Azure Storage.
Blob mendukung penghapusan sementara blob asli atau Penghapusan sementara menggunakan metadata kustom.
Jika Anda mengonfigurasi blob untuk penghapusan lembut, tentukan pasangan nama-nilai properti metadata. Kami merekomendasikan IsDeleted. Jika IsDeleted diatur ke true pada blob, pengindeks menghilangkan dokumen pencarian yang sesuai pada pengindeks berikutnya yang dijalankan.
Wizard tidak memeriksa Azure Storage untuk pengaturan yang valid atau melemparkan kesalahan jika persyaratan tidak terpenuhi. Namun, deteksi penghapusan tidak berfungsi, dan indeks pencarian Anda kemungkinan akan mengumpulkan dokumen yatim piatu dari waktu ke waktu.
Pilih kotak centang Autentikasi menggunakan identitas terkelola . Biarkan jenis identitas sebagai Ditetapkan oleh sistem.
Pilih Berikutnya.
Vektorisasi teks Anda
Selama langkah ini, wizard menggunakan model penyematan yang Anda pilih untuk mem-vektorisasi data yang dipotong. Fitur penggugusan sudah terintegrasi dan tidak bisa dikonfigurasi. Pengaturan yang efektif adalah:
"textSplitMode": "pages",
"maximumPageLength": 2000,
"pageOverlapLength": 500,
"maximumPagesToTake": 0, #unlimited
"unit": "characters"
Pada halaman Vektorisasi teks Anda, pilih Azure OpenAI untuk jenisnya.
Pilih langganan Azure Anda.
Pilih sumber daya Azure OpenAI Anda, lalu pilih model yang Anda sebarkan di Prepare embedding model.
Untuk jenis autentikasi, pilih Identitas yang ditetapkan sistem.
Pilih kotak centang yang mengakui efek penagihan menggunakan sumber daya ini.
Pilih Berikutnya.
Vektorisasi dan perkaya gambar Anda
PDF rencana kesehatan mencakup logo perusahaan, tetapi sebaliknya, tidak ada gambar. Anda dapat melewati langkah ini jika Anda menggunakan dokumen sampel.
Namun, jika konten Anda menyertakan gambar yang berguna, Anda dapat menerapkan AI dengan salah satu atau kedua cara berikut:
Gunakan model penyematan gambar yang didukung dari katalog model Microsoft Foundry atau API penyematan multimodal Azure Vision (melalui akun multi-layanan) untuk mem-vektorisasi gambar.
Gunakan pengenalan karakter optik (OCR) untuk mengekstrak teks dari gambar. Opsi ini memanggil keterampilan OCR.
Pada halaman Vektorisasi dan perkaya gambar Anda , pilih kotak centang Vektorisasi gambar .
Untuk jenisnya, pilih penyedia model Anda: Microsoft Foundry atau Azure Vision di Foundry Tools.
Pilih langganan Azure Anda, sumber daya, dan penyebaran model penyematan (jika berlaku).
Untuk jenis autentikasi, pilih Identitas yang ditetapkan sistem jika Anda tidak menggunakan proyek berbasis hub. Jika tidak, biarkan sebagai kunci API.
Pilih kotak centang yang mengakui efek penagihan menggunakan sumber daya ini.
Pilih Berikutnya.
Menambahkan peringkat semantik
Pada halaman Pengaturan tingkat lanjut , Anda dapat secara opsional menambahkan peringkat semantik untuk mererank hasil di akhir eksekusi kueri. Reranking mempromosikan kecocokan yang paling relevan secara semantik ke bagian atas.
Memetakan bidang baru
Pada halaman Pengaturan tingkat lanjut , Anda dapat secara opsional menambahkan bidang baru, dengan asumsi sumber data menyediakan metadata atau bidang yang tidak diambil pada pass pertama. Secara default, wizard menghasilkan bidang yang dijelaskan dalam tabel berikut ini.
| Bidang | Berlaku untuk | Deskripsi |
|---|---|---|
| chunk_id | Vektor teks dan gambar | Bidang string yang dihasilkan. Dapat dicari, dapat diakses kembali, dan dapat diurutkan. Ini adalah kunci dokumen untuk indeks. |
| parent_id | Vektor teks | Bidang string yang dihasilkan. Dapat diambil dan dapat difilter. Mengidentifikasi dokumen induk tempat potongan berasal. |
| Potongan | Vektor teks dan gambar | Bidang string. Versi potongan data yang dapat dibaca manusia. Dapat dicari dan diambil, tetapi tidak dapat difilter, dapat difaset, atau dapat diurutkan. |
| Judul | Vektor teks dan gambar | Bidang string. Judul dokumen yang dapat dibaca manusia atau judul halaman atau nomor halaman. Dapat dicari dan diambil, tetapi tidak dapat difilter, dapat difaset, atau dapat diurutkan. |
| text_vector | Vektor teks | Collection(Edm.single). Representasi vektor dari gugus. Dapat dicari dan diambil, tetapi tidak dapat difilter, dapat difaset, atau dapat diurutkan. |
Anda tidak dapat mengubah bidang yang dihasilkan atau atributnya, tetapi Anda dapat menambahkan bidang baru jika sumber data Anda menyediakannya. Misalnya, Azure Blob Storage menyediakan kumpulan bidang metadata.
Untuk menambahkan bidang ke skema indeks:
Pada halaman Pengaturan tingkat lanjut , di bawah Bidang indeks, pilih Pratinjau dan edit.
Pilih Tambahkan bidang.
Pilih bidang sumber dari bidang yang tersedia, masukkan nama bidang untuk indeks, dan terima (atau ambil alih) tipe data default.
Jika Anda ingin memulihkan skema ke versi aslinya, pilih Reset.
Poin-poin penting tentang langkah ini:
Skema indeks menyediakan bidang vektor dan nonvektor untuk data yang dipotong.
Mode penguraian dokumen membuat gugus (satu dokumen pencarian per gugus).
Menjadwalkan pengindeksan
Untuk sumber data di mana data yang mendasar volatil, Anda dapat menjadwalkan pengindeksan untuk menangkap perubahan pada interval tertentu atau tanggal dan waktu tertentu.
Untuk menjadwalkan pengindeksan:
Pada halaman Pengaturan tingkat lanjut , di bawah Pengindeksan jadwal, tentukan jadwal eksekusi untuk pengindeks. Kami merekomendasikan Once untuk memulai dengan cepat.
Pilih Berikutnya.
Menyelesaikan wizard
Langkah terakhir adalah meninjau konfigurasi Anda dan membuat objek yang diperlukan untuk pencarian vektor. Jika perlu, kembali ke halaman sebelumnya dalam wizard untuk menyesuaikan konfigurasi Anda.
Untuk menyelesaikan wizard:
Pada halaman Tinjau dan buat, tentukan awalan untuk objek yang dibuat oleh wizard. Awalan umum membantu Anda tetap terorganisir.
Pilih Buat.
Objek yang dibuat oleh asisten
Saat wizard menyelesaikan konfigurasi, wizard akan membuat objek berikut:
| Objek | Deskripsi |
|---|---|
| Sumber data | Mewakili koneksi ke sumber data yang Anda pilih. |
| Indeks | Berisi bidang vektor, vektorizer, profil vektor, dan algoritma vektor. Anda tidak dapat mengubah indeks default selama alur kerja wizard. Indeks sejalan dengan REST API pratinjau terbaru agar Anda dapat memanfaatkan fitur pratinjau. |
| Kemampuan | Berisi keterampilan dan konfigurasi berikut:
|
| Pengindeks | Mendorong alur pengindeksan, dengan pemetaan bidang dan pemetaan bidang output (jika ada). |
Tips
Objek yang dibuat wizard memiliki definisi JSON yang dapat dikonfigurasi. Untuk melihat atau mengubah definisi ini, pilih Manajemen pencarian dari panel kiri, tempat Anda bisa menampilkan indeks, pengindeks, sumber data, dan set keterampilan Anda.
Periksa hasil
Search Explorer menerima string teks sebagai input lalu mem-vektorisasi teks untuk eksekusi kueri vektor.
Untuk mengkueri indeks vektor Anda:
Di portal Azure, buka Search Management>Indexes, lalu pilih indeks Anda.
Pilih Opsi kueri, lalu pilih Sembunyikan nilai vektor di hasil pencarian. Langkah ini membuat hasilnya lebih mudah dibaca.
Dari menu Tampilan , pilih tampilan JSON sehingga Anda bisa memasukkan teks untuk kueri vektor Anda di
textparameter kueri vektor.Kueri default adalah pencarian kosong (
"*") tetapi menyertakan parameter untuk mengembalikan kecocokan angka. Ini adalah kueri hibrid yang menjalankan kueri teks dan vektor secara paralel. Ini juga termasuk peringkat semantik dan menentukan bidang mana yang akan dikembalikan dalam hasil melaluiselectpernyataan .{ "search": "*", "count": true, "vectorQueries": [ { "kind": "text", "text": "*", "fields": "text_vector,image_vector" } ], "queryType": "semantic", "semanticConfiguration": "my-demo-semantic-configuration", "captions": "extractive", "answers": "extractive|count-3", "queryLanguage": "en-us", "select": "chunk_id,text_parent_id,chunk,title,image_parent_id" }Ganti kedua tempat penampung tanda bintang (
*) dengan pertanyaan yang terkait dengan rencana kesehatan, sepertiWhich plan has the lowest deductible?.{ "search": "Which plan has the lowest deductible?", "count": true, "vectorQueries": [ { "kind": "text", "text": "Which plan has the lowest deductible?", "fields": "text_vector,image_vector" } ], "queryType": "semantic", "semanticConfiguration": "my-demo-semantic-configuration", "captions": "extractive", "answers": "extractive|count-3", "queryLanguage": "en-us", "select": "chunk_id,text_parent_id,chunk,title" }Untuk menjalankan kueri, pilih Cari.
Setiap dokumen adalah potongan PDF asli. Bidang menunjukkan
titledari PDF mana potongan berasal. Masing-masingchunkadalah berukuran panjang. Anda dapat menyalin dan menempelkannya ke editor teks untuk membaca seluruh nilai.Untuk melihat semua bagian dari dokumen tertentu, tambahkan filter untuk bidang
title_parent_iduntuk PDF yang spesifik. Anda dapat memeriksa tab Bidang indeks Anda untuk mengonfirmasi bidang dapat difilter.{ "select": "chunk_id,text_parent_id,chunk,title", "filter": "text_parent_id eq 'aHR0cHM6Ly9oZWlkaXN0c3RvcmFnZWRlbW9lYXN0dXMuYmxvYi5jb3JlLndpbmRvd3MubmV0L2hlYWx0aC1wbGFuLXBkZnMvTm9ydGh3aW5kX1N0YW5kYXJkX0JlbmVmaXRzX0RldGFpbHMucGRm0'", "count": true, "vectorQueries": [ { "kind": "text", "text": "*", "k": 5, "fields": "text_vector" } ] }
Membersihkan sumber daya
Saat Anda bekerja di langganan Anda sendiri, ada baiknya untuk menyelesaikan proyek dengan menghapus sumber daya yang tidak lagi Anda butuhkan. Sumber daya yang dibiarkan berjalan bisa menghabiskan biaya.
Di portal Azure, pilih Semua sumber daya atau Kelompok sumber daya dari panel kiri untuk menemukan dan mengelola sumber daya. Anda dapat menghapus sumber daya satu per satu atau menghapus grup sumber daya untuk menghapus semua sumber daya sekaligus.
Langkah berikutnya
Quickstart ini memperkenalkan Anda ke wizard Impor data, yang membuat semua objek yang diperlukan untuk vektorisasi yang terintegrasi. Untuk menjelajahi setiap langkah secara rinci, lihat Siapkan vektorisasi terintegrasi di Pencarian Azure AI.