Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Note
Pencarian Azure AI tersedia melalui portal Azure, REST API, dan Azure SDK. Ini juga mendukung Foundry IQ, lapisan pengetahuan terkelola yang mengubah konten perusahaan menjadi pangkalan pengetahuan yang dapat digunakan kembali dan sadar izin untuk agen di portal Microsoft Foundry.
Dalam mulai cepat ini, Anda menggunakan wizard Impor data di portal Microsoft Azure untuk mulai menggunakan pencarian multimodal. Wizard menyederhanakan proses ekstraksi, potongan, vektorisasi, dan pemuatan teks dan gambar ke dalam indeks yang dapat dicari.
Panduan mulai cepat ini menggunakan PDF multimodal dari repositori azure-search-sample-data. Namun, Anda dapat tetap menyelesaikan panduan cepat ini meskipun menggunakan file yang berbeda.
Tip
Punya dokumen yang banyak teks? Lihat Quickstart: Pencarian vektor di portal Azure untuk memotong dan mem-vektorisasi konten dengan dukungan gambar opsional.
Prerequisites
Akun Azure dengan langganan aktif. Buat akun secara gratis.
Layanan Pencarian Azure AI. Mulai cepat ini memerlukan tingkat Dasar atau lebih tinggi untuk dukungan identitas terkelola.
Akun Azure Storage. Gunakan Azure Blob Storage atau Azure Data Lake Storage Gen2 (akun penyimpanan dengan namespace hierarkis) pada akun performa standar (tujuan umum v2). Tingkat akses bisa panas, sejuk, atau dingin.
Keakraban dengan wizard. Lihat Wizard impor data di portal Microsoft Azure.
Metode ekstraksi yang didukung
Untuk ekstraksi konten, pilih ekstraksi default melalui Pencarian Azure AI atau ekstraksi yang ditingkatkan melalui Azure Kecerdasan Dokumen di Foundry Tools.
| Method | Description |
|---|---|
| Ekstraksi default | Mengekstrak metadata lokasi hanya dari gambar PDF. Tidak memerlukan sumber daya Azure lain. |
| Ekstraksi yang ditingkatkan | Mengekstrak metadata lokasi dari teks dan gambar untuk beberapa jenis dokumen. Memerlukan akun multi-layanan Azure AI1 untuk integrasi. |
1 Untuk tujuan penagihan, Anda harus menghubungkan akun multi-layanan Anda ke perangkat keterampilan Pencarian Azure AI Anda. Wizard mengharuskan layanan pencarian dan akun multi-layanan Anda berada di wilayah yang didukung yang sama untuk keterampilan Tata Letak Dokumen.
Metode penyematan yang didukung
Untuk penyematan konten, pilih salah satu metode berikut:
Verbalisasi gambar: Menggunakan LLM untuk menghasilkan deskripsi gambar berbahasa alami, lalu menggunakan model penyematan untuk vektorisasi teks biasa dan gambar verbal.
Penyematan multimodal: Menggunakan model penyematan untuk secara langsung mem-vektorisasi teks dan gambar.
Portal mendukung model berikut untuk setiap metode. Instruksi penyebaran disediakan di bagian selanjutnya.
| Provider | Model untuk verbalisasi gambar | Model untuk penyematan multimodal |
|---|---|---|
| Akun multi-layanan Azure AI1 | Model penyematan: Azure Vision multimodal | Azure Vision Multimodal |
| Proyek berbasis hub Microsoft Foundry | LLMs:
|
|
| Proyek Microsoft Foundry | LLMs:
|
|
| Azure sumber daya OpenAI3, 4 | LLMs:
|
1 Untuk tujuan penagihan, Anda harus menghubungkan akun multi-layanan Anda ke perangkat keterampilan Pencarian Azure AI Anda. Panduan mengharuskan layanan pencarian dan akun multi-layanan Anda berada di wilayah yang sama yang didukung untuk keterampilan embedding multimodal Azure Vision.
2 Wizard hanya mendukung penyebaran API tanpa server untuk model ini. Anda dapat menggunakan gunakan Azure CLI untuk memprovisikan penyebaran tanpa server.
3 Titik akhir sumber daya OpenAI Azure Anda harus memiliki subdomain kustom, seperti https://my-unique-name.openai.azure.com. Jika Anda membuat sumber daya di portal Azure, subdomain ini dibuat secara otomatis selama penyiapan sumber daya.
4 Azure sumber daya OpenAI (dengan akses ke model penyematan) yang dibuat di portal Microsoft Foundry tidak didukung. Anda harus membuat sumber daya OpenAI Azure di portal Azure.
Untuk panduan terbaru tentang siklus hidup model, termasuk penghentian dan deprekasi, lihat Penghentian dan deprekasi model.
Persyaratan titik akhir publik
Semua sumber daya sebelumnya harus mengaktifkan akses publik sehingga wizard dapat mengaksesnya. Jika tidak, wizard gagal. Setelah wizard selesai dijalankan, Anda dapat mengaktifkan firewall dan titik akhir privat pada komponen integrasi untuk keamanan. Untuk informasi selengkapnya, lihat Mengamankan koneksi di wizard impor.
Jika titik akhir privat sudah ada dan Anda tidak dapat menonaktifkannya, sebagai alternatif, Anda dapat menjalankan alur kerja end-to-end masing-masing dari skrip atau program di mesin virtual. Komputer virtual harus berada di jaringan virtual yang sama dengan titik akhir privat. Here adalah sampel kode Python untuk vektorisasi terintegrasi. Repositori GitHub yang sama memiliki sampel dalam bahasa pemrograman lainnya.
Mengonfigurasi akses
Sebelum memulai, pastikan Anda memiliki izin untuk mengakses konten dan operasi. Mulai cepat ini menggunakan Microsoft Entra ID untuk autentikasi dan akses berbasis peran untuk otorisasi. Anda harus menjadi Pemilik atau Administrator Akses Pengguna untuk menetapkan peran. Jika fungsi peran tidak dapat digunakan, gunakan autentikasi berbasis kunci sebagai gantinya.
Konfigurasikan peran yang diperlukan dan peran bersyarat yang diidentifikasi di bagian ini.
Peran yang diperlukan
Pencarian Azure AI dan Azure Storage diperlukan untuk semua skenario pencarian multimodal.
Pencarian Azure AI menyediakan alur multimodal. Konfigurasikan akses untuk diri Anda dan layanan pencarian Anda untuk membaca data, menjalankan alur, dan berinteraksi dengan sumber daya Azure lainnya.
Pada layanan Pencarian Azure AI Anda:
Tetapkan peran berikut untuk diri Anda sendiri.
Kontributor Layanan Pencarian
Kontributor Data Indeks Pencarian
Pembaca Data Indeks Pencarian
Peran bersyarat
Tab berikut mencakup sumber daya yang kompatibel dengan wizard untuk pencarian multimodal. Pilih hanya tab yang berlaku untuk metode ekstraksi dan metode penyematan yang Anda pilih.
Akun multi-layanan menyediakan akses ke beberapa layanan Azure, termasuk Azure Document Intelligence untuk ekstraksi konten dan Azure Vision untuk penyematan konten. Layanan pencarian Anda memerlukan akses untuk memanggil keterampilan Document Layout dan keterampilan penyematan multimodal Azure Vision.
Di akun multi-layanan Anda:
- Tetapkan Pengguna Cognitive Services ke identitas terkelola layanan pencarian Anda.
Menyiapkan data sampel
Panduan cepat ini menggunakan contoh PDF multimodal, tetapi Anda juga dapat menggunakan file Anda sendiri. Jika Anda menggunakan layanan pencarian gratis, gunakan kurang dari 20 file untuk tetap berada dalam kuota gratis untuk pemrosesan lanjutan.
Untuk menyiapkan data sampel untuk pengenalan cepat ini:
Buka akun Azure Storage Anda di portal Microsoft Azure.
Dari panel kiri, pilih penyimpanan data>Kontainer.
Buat kontainer, lalu unggah sample PDF ke kontainer.
Buat kontainer lain untuk menyimpan gambar yang diekstrak dari PDF.
Menyiapkan model
Note
Jika Anda menggunakan Azure Vision, lewati langkah ini. Penanaman multimodal dibangun dalam akun multi-layanan Anda dan tidak memerlukan penyebaran model.
Wizard menawarkan beberapa opsi untuk penyematan konten. Verbalisasi gambar memerlukan LLM untuk menjelaskan gambar dan model penyematan untuk memvektorisasi konten teks dan gambar, sementara penyematan multimodal langsung hanya memerlukan model penyematan. Model-model ini tersedia melalui Azure OpenAI dan Foundry.
Untuk menyebarkan model yang diperlukan untuk metode penyematan yang Anda pilih, lihat Menyebarkan Model Microsoft Foundry di portal Foundry.
Memulai asisten
Buka layanan pencarian Anda di portal Microsoft Azure.
Pada halaman Gambaran Umum , pilih Impor data.
Pilih sumber data Anda: Azure Blob Storage atau Azure Data Lake Storage Gen2.
Pilih RAG Multimodal.
Jalankan wizard
Wizard membimbing Anda melalui beberapa langkah konfigurasi. Bagian ini mencakup setiap langkah secara berurutan.
Hubungkan ke data Anda
Pencarian Azure AI memerlukan koneksi ke sumber data untuk penyerapan dan pengindeksan konten. Dalam hal ini, sumber data adalah akun Azure Storage Anda.
Untuk terhubung ke data Anda:
Pada halaman Hubungkan ke data Anda, pilih langganan Azure Anda.
Pilih akun penyimpanan dan kontainer tempat Anda mengunggah data sampel.
Pilih kotak centang Autentikasi menggunakan identitas terkelola . Biarkan jenis identitas sebagai Ditentukan oleh sistem.
Pilih Selanjutnya.
Ekstrak konten Anda
Bergantung pada metode ekstraksi yang Anda pilih, wizard menyediakan opsi konfigurasi untuk pemecahan dan pemotongan dokumen.
Metode default memanggil keterampilan Ekstraksi Dokumen untuk mengekstrak konten teks dan menghasilkan gambar yang dinormalisasi dari dokumen Anda. Keterampilan Pemisahan Teks kemudian dipanggil untuk membagi konten teks yang diekstrak menjadi halaman.
Untuk menggunakan keterampilan Ekstraksi Dokumen:
Menyematkan konten Anda
Selama langkah ini, wizard menggunakan metode penyematan yang Anda pilih untuk menghasilkan representasi vektor dari teks dan gambar.
- Verbalisasi gambar
- Penyematan multimodal
Wizard memanggil satu keterampilan untuk membuat teks deskriptif untuk gambar (verbalisasi gambar) dan keterampilan lain untuk membuat penyematan vektor untuk teks dan gambar.
Untuk verbalisasi gambar, keterampilan GenAI Prompt menggunakan LLM yang Anda sebarkan untuk menganalisis setiap gambar yang diekstrak dan menghasilkan deskripsi bahasa alami.
Untuk embedding, Azure OpenAI Embedding skill, AML skill, atau Azure Vision multimodal embeddings skill menggunakan model embedding yang dideploy untuk mengonversi potongan teks dan deskripsi verbal menjadi vektor dimensi tinggi. Vektor ini memungkinkan similaritas dan pengambilan data hibrid.
Untuk menggunakan keterampilan untuk verbalisasi gambar:
Pada halaman Penyematan konten , pilih Verbalisasi Gambar.
Pada tab Verbalisasi Gambar :
Untuk jenisnya, pilih penyedia LLM Anda: Azure OpenAI atau Microsoft Foundry.
Pilih langganan, sumber daya, dan penyebaran LLM Azure Anda.
Untuk jenis autentikasi, pilih Identitas yang ditetapkan sistem jika Anda tidak menggunakan proyek berbasis hub. Jika tidak, biarkan sebagai kunci API.
Pilih kotak centang yang mengakui efek penagihan menggunakan sumber daya ini.
Pada tab Vektorisasi Teks :
Untuk jenisnya, pilih penyedia model Anda: Azure OpenAI, Microsoft Foundry, atau Azure Vision di Foundry Tools.
Pilih langganan Azure, sumber daya, dan penyebaran model penyematan Anda (jika berlaku).
Untuk jenis autentikasi, pilih Identitas yang ditetapkan sistem jika Anda tidak menggunakan proyek berbasis hub. Jika tidak, biarkan sebagai kunci API.
Pilih kotak centang yang mengakui efek penagihan menggunakan sumber daya ini.
Pilih Selanjutnya.
Menyimpan gambar yang diekstrak
Langkah selanjutnya adalah mengirim gambar yang diekstrak dari dokumen Anda ke Azure Storage. Dalam Pencarian Azure AI, penyimpanan sekunder ini dikenal sebagai penyimpanan pengetahuan.
Untuk menyimpan gambar yang diekstrak:
Pada halaman Image output, pilih langganan Azure Anda.
Pilih akun penyimpanan dan kontainer blob yang Anda buat untuk menyimpan gambar.
Pilih kotak centang Autentikasi menggunakan identitas terkelola . Biarkan jenis identitas sebagai Ditentukan oleh sistem.
Pilih Selanjutnya.
Menambahkan peringkat semantik
Pada halaman Pengaturan tingkat lanjut, Anda dapat secara opsional menambahkan peringkat semantik untuk mererank hasil di akhir eksekusi kueri. Reranking mempromosikan kecocokan yang paling relevan secara semantik ke bagian atas.
Memetakan bidang baru
Pada halaman Pengaturan tingkat lanjut , Anda dapat secara opsional menambahkan bidang ke skema indeks. Secara default, wizard menghasilkan bidang yang dijelaskan dalam tabel berikut ini.
| Field | Berlaku pada | Description | Attributes |
|---|---|---|---|
| content_id | Vektor teks dan gambar | Bidang string. Kunci dokumen untuk indeks. | Dapat diambil, dapat diurutkan, dan dapat dicari. |
| document_title | Vektor teks dan gambar | Bidang string. Judul dokumen yang dapat dibaca manusia. | Dapat diambil dan dapat dicari. |
| text_document_id | Vektor teks | Bidang string. Mengidentifikasi dokumen induk tempat potongan teks berasal. | Dapat diambil dan difilter. |
| image_document_id | Vektor gambar | Bidang string. Mengidentifikasi dokumen induk tempat gambar berasal. | Dapat diambil dan difilter. |
| content_text | Vektor teks | Bidang string. Versi potongan teks yang dapat dibaca manusia. | Dapat diambil dan dapat dicari. |
| content_embedding | Vektor teks dan gambar | Collection(Edm.Single). Representasi vektor teks dan gambar. | Dapat diambil dan dapat dicari. |
| content_path | Vektor teks dan gambar | Bidang string. Jalur ke konten dalam kontainer penyimpanan. | Dapat diambil dan dapat dicari. |
| locationMetadata | Vektor gambar | Edm.ComplexType. Berisi metadata tentang lokasi gambar dalam dokumen. | Bervariasi menurut bidang. |
Anda tidak dapat mengubah bidang yang dihasilkan atau atributnya, tetapi Anda dapat menambahkan bidang jika sumber data Anda menyediakannya. Misalnya, Azure Blob Storage menyediakan kumpulan bidang metadata.
Untuk menambahkan bidang ke skema indeks:
Di bawah Bidang indeks, pilih Pratinjau dan edit.
Pilih Tambahkan bidang.
Pilih bidang sumber dari bidang yang tersedia, masukkan nama bidang untuk indeks, dan terima (atau ambil alih) tipe data default.
Jika Anda ingin memulihkan skema ke versi aslinya, pilih Reset.
Poin-poin penting tentang langkah ini:
Skema indeks menyediakan bidang vektor dan nonvektor untuk data yang dipotong.
Mode penguraian dokumen membuat gugus (satu dokumen pencarian per gugus).
Menjadwalkan pengindeksan
Untuk sumber data di mana data yang mendasar volatil, Anda dapat menjadwalkan pengindeksan untuk menangkap perubahan pada interval tertentu atau tanggal dan waktu tertentu.
Untuk menjadwalkan pengindeksan:
Pada halaman Pengaturan tingkat lanjut , di bawah Pengindeksan jadwal, tentukan jadwal eksekusi untuk pengindeks. Kami merekomendasikan Once untuk panduan cepat ini.
Pilih Selanjutnya.
Menyelesaikan wizard
Langkah terakhir adalah meninjau konfigurasi Anda dan membuat objek yang diperlukan untuk pencarian multimodal. Jika perlu, kembali ke halaman sebelumnya dalam wizard untuk menyesuaikan konfigurasi Anda.
Untuk menyelesaikan wizard:
Pada halaman Tinjau dan buat, tentukan awalan untuk objek yang akan dibuat oleh panduan. Awalan umum membantu Anda tetap terorganisir.
Pilih Buat.
Objek yang dibuat wizard
Saat wizard menyelesaikan konfigurasi, wizard akan membuat objek berikut:
| Objek | Description |
|---|---|
| Sumber data | Mewakili koneksi ke Azure Blob Storage. |
| Index | Berisi bidang teks, bidang vektor, vektorizer, profil vektor, dan algoritma vektor. Anda tidak dapat mengubah indeks default selama alur kerja wizard. Indeks sesuai dengan pratinjau terbaru REST API sehingga Anda dapat menggunakan fitur-fitur pratinjau. |
| Keterampilan | Berisi keterampilan berikut:
|
| Indexer | Mendorong alur pengindeksan, dengan pemetaan bidang dan pemetaan bidang output (jika ada). |
| Toko Pengetahuan | Menyimpan gambar yang diekstrak sebagai blob di Azure Storage untuk pemrosesan hilir atau skenario multimodal. |
Tip
Objek yang dibuat wizard memiliki definisi JSON yang dapat dikonfigurasi. Untuk melihat atau mengubah definisi ini, pilih Manajemen pencarian dari panel kiri, tempat Anda bisa menampilkan indeks, pengindeks, sumber data, dan set keterampilan Anda.
Untuk melihat penyimpanan pengetahuan, buka akun Azure Storage Anda dan pilih kontainer yang Anda tentukan untuk output gambar.
Memeriksa hasil
Panduan memulai cepat ini membuat indeks multimodal yang mendukung pencarian hibrida untuk teks dan gambar. Kecuali Anda menggunakan penyematan multimodal langsung, indeks tidak menerima gambar sebagai input kueri, yang memerlukan keterampilan AML atau keterampilan penyematan multimodal Azure Vision dengan vektorizer yang setara. Untuk informasi selengkapnya, lihat Mengonfigurasi vektorizer dalam indeks pencarian.
Pencarian hibrid menggabungkan kueri teks lengkap dan kueri vektor. Saat Anda mengeluarkan kueri hibrid, mesin pencari menghitung kesamaan semantik antara kueri Anda dan vektor terindeks dan memberi peringkat hasil yang sesuai. Untuk indeks yang dibuat dalam panduan cepat ini, hasil akan menampilkan konten dari bidang content_text yang selaras erat dengan kueri Anda.
Untuk mengkueri indeks multimodal Anda:
Buka layanan pencarian Anda di portal Microsoft Azure.
Dari panel kiri, pilihIndeks> pencarian.
Pilih indeks Anda.
Pilih Opsi kueri, lalu pilih Sembunyikan nilai vektor di hasil pencarian. Langkah ini membuat hasilnya lebih mudah dibaca.
Masukkan teks yang ingin Anda cari. Contoh kami menggunakan
energy.Untuk menjalankan kueri, pilih Cari.
Hasil JSON harus menyertakan konten teks dan gambar yang terkait dengan
energydalam indeks Anda. Jika Anda mengaktifkan pemeringkat semantik,@search.answersarray menyediakan jawaban semantik yang ringkas dan percaya diri untuk membantu Anda mengidentifikasi kecocokan yang relevan dengan cepat."@search.answers": [ { "key": "a71518188062_aHR0cHM6Ly9oYWlsZXlzdG9yYWdlLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsLXNlYXJjaC9BY2NlbGVyYXRpbmctU3VzdGFpbmFiaWxpdHktd2l0aC1BSS0yMDI1LnBkZg2_normalized_images_7", "text": "A vertical infographic consisting of three sections describing the roles of AI in sustainability: 1. **Measure, predict, and optimize complex systems**: AI facilitates analysis, modeling, and optimization in areas like energy distribution, resource allocation, and environmental monitoring. **Accelerate the development of sustainability solution...", "highlights": "A vertical infographic consisting of three sections describing the roles of AI in sustainability: 1. **Measure, predict, and optimize complex systems**: AI facilitates analysis, modeling, and optimization in areas like<em> energy distribution, </em>resource<em> allocation, </em>and environmental monitoring. **Accelerate the development of sustainability solution...", "score": 0.9950000047683716 }, { "key": "1cb0754930b6_aHR0cHM6Ly9oYWlsZXlzdG9yYWdlLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsLXNlYXJjaC9BY2NlbGVyYXRpbmctU3VzdGFpbmFiaWxpdHktd2l0aC1BSS0yMDI1LnBkZg2_text_sections_5", "text": "...cross-laminated timber.8 Through an agreement with Brookfield, we aim 10.5 gigawatts (GW) of renewable energy to the grid.910.5 GWof new renewable energy capacity to be developed across the United States and Europe.Play 4 Advance AI policy principles and governance for sustainabilityWe advocated for policies that accelerate grid decarbonization", "highlights": "...cross-laminated timber.8 Through an agreement with Brookfield, we aim <em> 10.5 gigawatts (GW) of renewable energy </em>to the<em> grid.910.5 </em>GWof new<em> renewable energy </em>capacity to be developed across the United States and Europe.Play 4 Advance AI policy principles and governance for sustainabilityWe advocated for policies that accelerate grid decarbonization", "score": 0.9890000224113464 }, { "key": "1cb0754930b6_aHR0cHM6Ly9oYWlsZXlzdG9yYWdlLmJsb2IuY29yZS53aW5kb3dzLm5ldC9tdWx0aW1vZGFsLXNlYXJjaC9BY2NlbGVyYXRpbmctU3VzdGFpbmFiaWxpdHktd2l0aC1BSS0yMDI1LnBkZg2_text_sections_50", "text": "ForewordAct... Similarly, we have restored degraded stream ecosystems near our datacenters from Racine, Wisconsin120 to Jakarta, Indonesia.117INNOVATION SPOTLIGHTAI-powered Community Solar MicrogridsDeveloping energy transition programsWe are co-innovating with communities to develop energy transition programs that align their goals with broader s.", "highlights": "ForewordAct... Similarly, we have restored degraded stream ecosystems near our datacenters from Racine, Wisconsin120 to Jakarta, Indonesia.117INNOVATION SPOTLIGHTAI-powered Community<em> Solar MicrogridsDeveloping energy transition programsWe </em>are co-innovating with communities to develop<em> energy transition programs </em>that align their goals with broader s.", "score": 0.9869999885559082 } ]
Membersihkan sumber daya
Saat Anda bekerja di langganan Anda sendiri, ada baiknya untuk menyelesaikan proyek dengan menghapus sumber daya yang tidak lagi Anda butuhkan. Sumber daya yang dibiarkan berjalan dapat dikenakan biaya.
Di portal Azure, pilih Semua sumber daya atau Kelompok sumber daya dari panel kiri untuk menemukan dan mengelola sumber daya. Anda dapat menghapus sumber daya satu per satu atau menghapus grup sumber daya untuk menghapus semua sumber daya sekaligus.
Langkah selanjutnya
Panduan Memulai Cepat ini memperkenalkan Anda kepada panduan Impor data, yang membuat semua objek yang diperlukan untuk pencarian multimodal. Untuk menjelajahi setiap langkah secara rinci, lihat tutorial Multimodal.