Mulai cepat: Pencarian vektor di portal Azure

Catatan

Pencarian Azure AI tersedia melalui portal Azure, REST API, dan Azure SDK. Ini juga mendukung Foundry IQ, lapisan pengetahuan terkelola yang mengubah konten perusahaan menjadi pangkalan pengetahuan yang dapat digunakan kembali dan sadar izin untuk agen di portal Microsoft Foundry.

Dalam panduan cepat ini, Anda menggunakan wizard Import data di portal Azure guna memulai dengan vektorisasi terintegrasi . Wizard memotong konten Anda dan memanggil model embedding untuk memvektorkan potongan saat pengindeksan dan kueri.

Panduan mulai cepat ini menggunakan PDF berbasis teks dan gambar sederhana dari repositori azure-search-sample-data. Namun, Anda dapat menggunakan file yang berbeda dan tetap menyelesaikan panduan memulai cepat ini.

Tips

Memiliki dokumen yang kaya gambar? Lihat Quickstart: Pencarian multimodal di portal Azure untuk mengekstrak, menyimpan, dan mencari gambar bersama teks.

Prasyarat

Sumber data yang didukung

Wizard dukung beberapa sumber data Azure. Namun, panduan cepat ini hanya mencakup sumber data yang bekerja dengan file utuh, yang dijelaskan dalam tabel berikut.

Sumber data Deskripsi
Azure Blob Storage Sumber data ini berfungsi dengan blob dan tabel. Anda harus menggunakan akun performa standar (tujuan umum v2). Tingkat akses bisa panas, sejuk, atau dingin.
Azure Data Lake Storage (ADLS) Gen2 Ini adalah akun Azure Storage dengan namespace hierarki diaktifkan. Untuk mengonfirmasi bahwa Anda memiliki Data Lake Storage, periksa tab Properties pada halaman Overview.
Microsoft OneLake Sumber data ini tersambung ke file dan pintasan OneLake.

Model penyematan yang didukung

Portal mendukung model penyematan berikut untuk vektorisasi terintegrasi. Instruksi penyebaran disediakan di bagian selanjutnya.

Penyedia Model yang didukung
akun multi-layanan Azure AI1 Untuk teks dan gambar: Azure Vision multimodal
Proyek Microsoft Foundry berbasis hub Untuk teks:
  • text-embedding-ada-002
  • text-embedding-3-small
  • text-embedding-3-large (penyisipan teks besar 3)
Untuk teks dan gambar:
  • Cohere-embed-v3-english 2
  • Cohere-embed-v3-multilingual 2
proyek Microsoft Foundry Untuk teks:
  • text-embedding-ada-002
  • text-embedding-3-small
  • text-embedding-3-large (penyisipan teks besar 3)
Azure sumber daya OpenAI3, 4 Untuk teks:
  • text-embedding-ada-002
  • text-embedding-3-small
  • text-embedding-3-large (penyisipan teks besar 3)

1 Untuk tujuan penagihan, Anda harus menautkan akun multi-layanan Anda ke skillset Pencarian Azure AI Anda. Wizard mengharuskan layanan pencarian dan akun multi-layanan Anda berada di wilayah yang didukung same untuk keterampilan penyematan multimodal Azure Vision.

2 Wizard hanya mendukung penyebaran API tanpa server untuk model ini. Anda dapat menggunakan gunakan Azure CLI untuk memprovisikan penyebaran tanpa server.

3 Titik akhir sumber daya OpenAI Azure Anda harus memiliki subdomain kustom, seperti https://my-unique-name.openai.azure.com. Jika Anda membuat sumber daya di portal Azure, subdomain ini dibuat secara otomatis selama penyiapan sumber daya.

4 sumber daya Azure OpenAI (yang memiliki akses ke model embedding) yang dibuat di portal Microsoft Foundry tidak didukung. Anda harus membuat sumber daya OpenAI Azure di portal Azure.

Untuk panduan siklus hidup model terbaru, termasuk penghentian, lihat Penghentian dan penghentian model.

Persyaratan titik akhir publik

Semua sumber daya sebelumnya harus mengaktifkan akses publik sehingga wizard dapat mengaksesnya. Jika tidak, wizard gagal. Setelah wizard berjalan, Anda dapat mengaktifkan firewall dan titik akhir privat pada komponen integrasi untuk keamanan. Untuk informasi selengkapnya, lihat Mengamankan koneksi di wizard impor.

Jika titik akhir privat sudah ada dan Anda tidak dapat menonaktifkannya, opsi alternatifnya adalah menjalankan alur end-to-end dari skrip atau program di mesin virtual. Komputer virtual harus berada di jaringan virtual yang sama dengan titik akhir privat. Berikut adalah sampel kode Python untuk vektorisasi terintegrasi. Repositori GitHub yang sama memiliki sampel dalam bahasa pemrograman lainnya.

Mengonfigurasi akses

Sebelum memulai, pastikan Anda memiliki izin untuk mengakses konten dan operasi. Mulai cepat ini menggunakan Microsoft Entra ID untuk autentikasi dan akses berbasis peran untuk otorisasi. Anda harus menjadi Pemilik atau Administrator Akses Pengguna untuk menetapkan peran. Jika peran fungsional tidak layak, gunakan autentikasi berbasis kunci sebagai gantinya.

Konfigurasikan peran yang diperlukan dan peran bersyarat yang diidentifikasi di bagian ini.

Peran yang diperlukan

Pencarian Azure AI menyediakan alur pencarian vektor. Konfigurasikan akses untuk diri Anda dan layanan pencarian Anda untuk membaca data, menjalankan alur, dan berinteraksi dengan sumber daya Azure lainnya.

Pada layanan Pencarian Azure AI Anda:

  1. Aktifkan akses berbasis peran.

  2. Mengonfigurasi identitas terkelola yang ditetapkan sistem.

  3. Tetapkan peran berikut untuk diri Anda sendiri.

    • Kontributor Layanan Pencarian

    • Kontributor Data Indeks Pencarian

    • Pembaca Data Indeks Pencarian

Peran kondisional

Tab berikut mencakup semua sumber daya yang kompatibel dengan wizard untuk pencarian vektor. Pilih hanya tab yang berlaku untuk sumber data dan model penyematan yang Anda pilih.

Azure Blob Storage dan Azure Data Lake Storage Gen2 mengharuskan layanan pencarian Anda memiliki akses baca ke kontainer penyimpanan.

Di akun Azure Storage Anda:

  • Tetapkan Storage Blob Data Reader ke identitas terkelola layanan penelusuran Anda.

Menyiapkan data sampel

Di bagian ini, Anda menyiapkan data sampel untuk sumber data yang Anda pilih.

  1. Buka akun Azure Storage Anda di portal Azure.

  2. Dari panel kiri, pilihKontainer> data.

  3. Buat kontainer, lalu unggah dokumen PDF health-plan yang digunakan untuk panduan cepat ini.

  4. (Opsional) Sinkronkan penghapusan dalam kontainer Anda dengan penghapusan dalam indeks pencarian. Untuk mengonfigurasi pengindeks Anda untuk deteksi penghapusan:

    1. Aktifkan penghapusan sementara di akun penyimpanan Anda. Jika Anda menggunakan penghapusan sementara asli, langkah berikutnya tidak diperlukan.

    2. Tambahkan metadata kustom yang dapat dipindai pengindeks untuk menentukan blob mana yang ditandai untuk dihapus. Beri nama deskriptif properti kustom Anda. Misalnya, beri nama properti "IsDeleted" dan atur ke false. Ulangi langkah ini untuk setiap blob dalam kontainer. Saat Anda ingin menghapus blob, ubah properti menjadi true. Untuk informasi selengkapnya, lihat Ubah dan hapus deteksi saat mengindeks dari Azure Storage.

Menyiapkan model penyematan

Catatan

Jika Anda menggunakan Azure Vision, lewati langkah ini. Penyematan multimodal dibangun ke dalam akun multi-layanan Anda dan tidak memerlukan penyebaran model.

Wizard mendukung beberapa model penyematan dari Azure OpenAI dan katalog model Microsoft Foundry. Untuk menyebarkan model yang diperlukan untuk model embedding yang Anda pilih, lihat Model Microsoft Foundry di portal Foundry.

Memulai wizard

  1. Buka layanan pencarian Anda di portal Azure.

  2. Pada halaman Gambaran Umum , pilih Impor data.

    Cuplikan layar perintah untuk membuka wizard untuk mengimpor dan mem-vektorisasi data.

  3. Pilih sumber data Anda: Azure Blob Storage, ADLS Gen2, atau OneLake.

  4. Pilih RAG.

    Cuplikan layar petak RAG dalam wizard.

Jalankan wizard

Wizard memandu Anda melalui beberapa langkah konfigurasi. Bagian ini mencakup setiap langkah secara berurutan.

Hubungkan ke data Anda

Dalam langkah ini, Anda menyambungkan Pencarian Azure AI ke sumber data yang Anda pilih untuk penyerapan dan pengindeksan konten.

  1. Pada halaman Hubungkan ke data Anda, pilih langganan Azure Anda.

  2. Pilih akun penyimpanan dan kontainer yang menyediakan data sampel.

  3. Jika Anda mengaktifkan penghapusan sementara dan menambahkan metadata kustom di Menyiapkan data sampel, pilih kotak centang Aktifkan pelacakan penghapusan .

    • Pada pengindeksan berikutnya, indeks pencarian diperbarui untuk menghapus dokumen pencarian apa pun yang didasarkan pada blob yang dihapus sementara di Azure Storage.

    • Blob mendukung penghapusan sementara blob asli atau Penghapusan sementara menggunakan metadata kustom.

    • Jika Anda mengonfigurasi blob untuk penghapusan lembut, tentukan pasangan nama-nilai properti metadata. Kami merekomendasikan IsDeleted. Jika IsDeleted diatur ke true pada blob, pengindeks menghilangkan dokumen pencarian yang sesuai pada pengindeks berikutnya yang dijalankan.

    • Wizard tidak memeriksa Azure Storage untuk pengaturan yang valid atau melemparkan kesalahan jika persyaratan tidak terpenuhi. Namun, deteksi penghapusan tidak berfungsi, dan indeks pencarian Anda kemungkinan akan mengumpulkan dokumen yatim piatu dari waktu ke waktu.

  4. Pilih kotak centang Autentikasi menggunakan identitas terkelola . Biarkan jenis identitas sebagai Ditetapkan oleh sistem.

    Cuplikan layar halaman sumber data dengan opsi deteksi penghapusan.

  5. Pilih Berikutnya.

Vektorisasi teks Anda

Selama langkah ini, wizard menggunakan model penyematan yang Anda pilih untuk mem-vektorisasi data yang dipotong. Fitur penggugusan sudah terintegrasi dan tidak bisa dikonfigurasi. Pengaturan yang efektif adalah:

"textSplitMode": "pages",
"maximumPageLength": 2000,
"pageOverlapLength": 500,
"maximumPagesToTake": 0, #unlimited
"unit": "characters"
  1. Pada halaman Vektorisasi teks Anda, pilih Azure OpenAI untuk jenisnya.

  2. Pilih langganan Azure Anda.

  3. Pilih sumber daya Azure OpenAI Anda, lalu pilih model yang Anda sebarkan di Prepare embedding model.

  4. Untuk jenis autentikasi, pilih Identitas yang ditetapkan sistem.

  5. Pilih kotak centang yang mengakui efek penagihan menggunakan sumber daya ini.

    Screenshot halaman Vektorisasi teks Anda dengan Azure OpenAI di panduan.

  6. Pilih Berikutnya.

Vektorisasi dan perkaya gambar Anda

PDF rencana kesehatan mencakup logo perusahaan, tetapi sebaliknya, tidak ada gambar. Anda dapat melewati langkah ini jika Anda menggunakan dokumen sampel.

Namun, jika konten Anda menyertakan gambar yang berguna, Anda dapat menerapkan AI dengan salah satu atau kedua cara berikut:

  • Gunakan model penyematan gambar yang didukung dari katalog model Microsoft Foundry atau API penyematan multimodal Azure Vision (melalui akun multi-layanan) untuk mem-vektorisasi gambar.

  • Gunakan pengenalan karakter optik (OCR) untuk mengekstrak teks dari gambar. Opsi ini memanggil keterampilan OCR.

  1. Pada halaman Vektorisasi dan perkaya gambar Anda , pilih kotak centang Vektorisasi gambar .

  2. Untuk jenisnya, pilih penyedia model Anda: Microsoft Foundry atau Azure Vision di Foundry Tools.

  3. Pilih langganan Azure Anda, sumber daya, dan penyebaran model penyematan (jika berlaku).

  4. Untuk jenis autentikasi, pilih Identitas yang ditetapkan sistem jika Anda tidak menggunakan proyek berbasis hub. Jika tidak, biarkan sebagai kunci API.

  5. Pilih kotak centang yang mengakui efek penagihan menggunakan sumber daya ini.

    Cuplikan layar halaman Vektorisasi dan perkaya gambar Anda di wizard.

  6. Pilih Berikutnya.

Menambahkan peringkat semantik

Pada halaman Pengaturan tingkat lanjut , Anda dapat secara opsional menambahkan peringkat semantik untuk mererank hasil di akhir eksekusi kueri. Reranking mempromosikan kecocokan yang paling relevan secara semantik ke bagian atas.

Memetakan bidang baru

Pada halaman Pengaturan tingkat lanjut , Anda dapat secara opsional menambahkan bidang baru, dengan asumsi sumber data menyediakan metadata atau bidang yang tidak diambil pada pass pertama. Secara default, wizard menghasilkan bidang yang dijelaskan dalam tabel berikut ini.

Bidang Berlaku untuk Deskripsi
chunk_id Vektor teks dan gambar Bidang string yang dihasilkan. Dapat dicari, dapat diakses kembali, dan dapat diurutkan. Ini adalah kunci dokumen untuk indeks.
parent_id Vektor teks Bidang string yang dihasilkan. Dapat diambil dan dapat difilter. Mengidentifikasi dokumen induk tempat potongan berasal.
Potongan Vektor teks dan gambar Bidang string. Versi potongan data yang dapat dibaca manusia. Dapat dicari dan diambil, tetapi tidak dapat difilter, dapat difaset, atau dapat diurutkan.
Judul Vektor teks dan gambar Bidang string. Judul dokumen yang dapat dibaca manusia atau judul halaman atau nomor halaman. Dapat dicari dan diambil, tetapi tidak dapat difilter, dapat difaset, atau dapat diurutkan.
text_vector Vektor teks Collection(Edm.single). Representasi vektor dari gugus. Dapat dicari dan diambil, tetapi tidak dapat difilter, dapat difaset, atau dapat diurutkan.

Anda tidak dapat mengubah bidang yang dihasilkan atau atributnya, tetapi Anda dapat menambahkan bidang baru jika sumber data Anda menyediakannya. Misalnya, Azure Blob Storage menyediakan kumpulan bidang metadata.

Untuk menambahkan bidang ke skema indeks:

  1. Pada halaman Pengaturan tingkat lanjut , di bawah Bidang indeks, pilih Pratinjau dan edit.

  2. Pilih Tambahkan bidang.

  3. Pilih bidang sumber dari bidang yang tersedia, masukkan nama bidang untuk indeks, dan terima (atau ambil alih) tipe data default.

  4. Jika Anda ingin memulihkan skema ke versi aslinya, pilih Reset.

Poin-poin penting tentang langkah ini:

  • Skema indeks menyediakan bidang vektor dan nonvektor untuk data yang dipotong.

  • Mode penguraian dokumen membuat gugus (satu dokumen pencarian per gugus).

Menjadwalkan pengindeksan

Untuk sumber data di mana data yang mendasar volatil, Anda dapat menjadwalkan pengindeksan untuk menangkap perubahan pada interval tertentu atau tanggal dan waktu tertentu.

Untuk menjadwalkan pengindeksan:

  1. Pada halaman Pengaturan tingkat lanjut , di bawah Pengindeksan jadwal, tentukan jadwal eksekusi untuk pengindeks. Kami merekomendasikan Once untuk memulai dengan cepat.

    Cuplikan layar halaman wizard untuk menjadwalkan pengindeksan.

  2. Pilih Berikutnya.

Menyelesaikan wizard

Langkah terakhir adalah meninjau konfigurasi Anda dan membuat objek yang diperlukan untuk pencarian vektor. Jika perlu, kembali ke halaman sebelumnya dalam wizard untuk menyesuaikan konfigurasi Anda.

Untuk menyelesaikan wizard:

  1. Pada halaman Tinjau dan buat, tentukan awalan untuk objek yang dibuat oleh wizard. Awalan umum membantu Anda tetap terorganisir.

    Cuplikan layar halaman wizard untuk meninjau dan menyelesaikan konfigurasi.

  2. Pilih Buat.

Objek yang dibuat oleh asisten

Saat wizard menyelesaikan konfigurasi, wizard akan membuat objek berikut:

Objek Deskripsi
Sumber data Mewakili koneksi ke sumber data yang Anda pilih.
Indeks Berisi bidang vektor, vektorizer, profil vektor, dan algoritma vektor. Anda tidak dapat mengubah indeks default selama alur kerja wizard. Indeks sejalan dengan REST API pratinjau terbaru agar Anda dapat memanfaatkan fitur pratinjau.
Kemampuan Berisi keterampilan dan konfigurasi berikut:
Pengindeks Mendorong alur pengindeksan, dengan pemetaan bidang dan pemetaan bidang output (jika ada).

Tips

Objek yang dibuat wizard memiliki definisi JSON yang dapat dikonfigurasi. Untuk melihat atau mengubah definisi ini, pilih Manajemen pencarian dari panel kiri, tempat Anda bisa menampilkan indeks, pengindeks, sumber data, dan set keterampilan Anda.

Periksa hasil

Search Explorer menerima string teks sebagai input lalu mem-vektorisasi teks untuk eksekusi kueri vektor.

Untuk mengkueri indeks vektor Anda:

  1. Di portal Azure, buka Search Management>Indexes, lalu pilih indeks Anda.

  2. Pilih Opsi kueri, lalu pilih Sembunyikan nilai vektor di hasil pencarian. Langkah ini membuat hasilnya lebih mudah dibaca.

    Cuplikan layar tombol untuk opsi kueri.

  3. Dari menu Tampilan , pilih tampilan JSON sehingga Anda bisa memasukkan teks untuk kueri vektor Anda di text parameter kueri vektor.

    Cuplikan layar perintah menu untuk membuka tampilan JSON.

    Kueri default adalah pencarian kosong ("*") tetapi menyertakan parameter untuk mengembalikan kecocokan angka. Ini adalah kueri hibrid yang menjalankan kueri teks dan vektor secara paralel. Ini juga termasuk peringkat semantik dan menentukan bidang mana yang akan dikembalikan dalam hasil melalui select pernyataan .

     {
       "search": "*",
       "count": true,
       "vectorQueries": [
         {
           "kind": "text",
           "text": "*",
           "fields": "text_vector,image_vector"
         }
       ],
       "queryType": "semantic",
       "semanticConfiguration": "my-demo-semantic-configuration",
       "captions": "extractive",
       "answers": "extractive|count-3",
       "queryLanguage": "en-us",
       "select": "chunk_id,text_parent_id,chunk,title,image_parent_id"
     }
    
  4. Ganti kedua tempat penampung tanda bintang (*) dengan pertanyaan yang terkait dengan rencana kesehatan, seperti Which plan has the lowest deductible?.

     {
       "search": "Which plan has the lowest deductible?",
       "count": true,
       "vectorQueries": [
         {
           "kind": "text",
           "text": "Which plan has the lowest deductible?",
           "fields": "text_vector,image_vector"
         }
       ],
       "queryType": "semantic",
       "semanticConfiguration": "my-demo-semantic-configuration",
       "captions": "extractive",
       "answers": "extractive|count-3",
       "queryLanguage": "en-us",
       "select": "chunk_id,text_parent_id,chunk,title"
     }
    
  5. Untuk menjalankan kueri, pilih Cari.

    Cuplikan layar hasil pencarian.

    Setiap dokumen adalah potongan PDF asli. Bidang menunjukkan title dari PDF mana potongan berasal. Masing-masing chunk adalah berukuran panjang. Anda dapat menyalin dan menempelkannya ke editor teks untuk membaca seluruh nilai.

  6. Untuk melihat semua bagian dari dokumen tertentu, tambahkan filter untuk bidang title_parent_id untuk PDF yang spesifik. Anda dapat memeriksa tab Bidang indeks Anda untuk mengonfirmasi bidang dapat difilter.

    {
       "select": "chunk_id,text_parent_id,chunk,title",
       "filter": "text_parent_id eq 'aHR0cHM6Ly9oZWlkaXN0c3RvcmFnZWRlbW9lYXN0dXMuYmxvYi5jb3JlLndpbmRvd3MubmV0L2hlYWx0aC1wbGFuLXBkZnMvTm9ydGh3aW5kX1N0YW5kYXJkX0JlbmVmaXRzX0RldGFpbHMucGRm0'",
       "count": true,
       "vectorQueries": [
           {
              "kind": "text",
              "text": "*",
              "k": 5,
              "fields": "text_vector"
           }
        ]
    }
    

Membersihkan sumber daya

Saat Anda bekerja di langganan Anda sendiri, ada baiknya untuk menyelesaikan proyek dengan menghapus sumber daya yang tidak lagi Anda butuhkan. Sumber daya yang dibiarkan berjalan bisa menghabiskan biaya.

Di portal Azure, pilih Semua sumber daya atau Kelompok sumber daya dari panel kiri untuk menemukan dan mengelola sumber daya. Anda dapat menghapus sumber daya satu per satu atau menghapus grup sumber daya untuk menghapus semua sumber daya sekaligus.

Langkah berikutnya

Quickstart ini memperkenalkan Anda ke wizard Impor data, yang membuat semua objek yang diperlukan untuk vektorisasi yang terintegrasi. Untuk menjelajahi setiap langkah secara rinci, lihat Siapkan vektorisasi terintegrasi di Pencarian Azure AI.