Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Catatan
Pencarian Azure AI tersedia melalui portal Azure, REST API, dan Azure SDK. Ini juga mendukung Foundry IQ, lapisan pengetahuan terkelola yang mengubah konten perusahaan menjadi pangkalan pengetahuan yang dapat digunakan kembali dan sadar izin untuk agen di portal Microsoft Foundry.
Batas maksimum penyimpanan, beban kerja, dan jumlah indeks dan objek lainnya bergantung pada model harga layanan Pencarian Azure AI Anda.
Pencarian Azure AI mendukung dua model harga, masing-masing dengan tingkat layanan terkait. Tingkat yang Anda pilih berdampak pada batas layanan yang diuraikan dalam panduan ini.
- Khusus: Harga tetap yang diukur oleh Unit Pencarian (SU). Opsi tingkat layanan meliputi: Dasar, Standar (S1-S3, termasuk S3 HD), Storage Optimized (L1-L2), dan tingkat Gratis dengan kemampuan layanan pencarian terbatas.
- Tanpa server (Pratinjau): Harga berbasis konsumsi yang diukur oleh Unit Komputasi per jam (CU/jam) dan per GB/bulan untuk penyimpanan terindeks. Tingkat pratinjau saat ini adalah: Pengembang Tanpa Server. Batas didefinisikan oleh batas per indeks, jumlah objek per layanan, dan perilaku pembatasan Tanpa Server.
Penting
Tingkat Pengembang Tanpa Server saat ini dalam pratinjau. Pratinjau ini disediakan tanpa perjanjian tingkat layanan dan tidak direkomendasikan untuk beban kerja produksi. Fitur tertentu mungkin tidak didukung atau mungkin memiliki kemampuan terbatas. Untuk informasi lebih lanjut, lihat Supplemental Terms of Use for Microsoft Azure Previews.
Penagihan untuk tingkat Pengembang Tanpa Server belum diaktifkan selama pratinjau. Perkiraan biaya untuk penggunaan Anda tersedia di portal Azure dan telemetri, tetapi penggunaan tersebut tidak akan muncul pada tagihan Azure Anda selama periode awal ini. Microsoft akan memberikan pemberitahuan setidaknya 30 hari sebelum penagihan dimulai. Penangguhan penagihan selama pratinjau ini bersifat sementara. Pengembang Tanpa Server adalah tingkat berbayar dan Anda akan bertanggung jawab atas biaya apa pun yang timbul setelah penagihan dimulai.
Tingkat Pengembang Tanpa Server tidak mendukung migrasi ke atau dari tingkat harga lain dan beberapa fitur yang tersedia di tingkat lain tidak didukung selama Pratinjau Umum. Batas layanan, fitur yang didukung, dan detail harga dapat berubah sebelum ketersediaan umum.
Pratinjau saat ini hanya tersedia di West Central US, Switzerland North, dan Japan East.
Untuk mempelajari selengkapnya, lihat Memilih model harga dan tingkat layanan.
Mendiagnosis kegagalan kuota, kapasitas, atau batas
Kegagalan kuota dan kapasitas berasal dari kontrol terpisah. Gunakan kesalahan dari operasi yang telah selesai untuk menemukan mana yang berlaku.
Jika operasi buat, skalakan, atau tingkatkan masih berjalan, tunggu hingga status provisi menjadi Succeeded atau Failed. Operasi yang sedang berlangsung bukanlah bukti masalah kuota atau kapasitas. Jika operasi skala gagal, lihat Kesalahan selama penskalakan.
| Failure | Kemungkinan penyebabnya | Tindakan pertama |
|---|---|---|
| Pembuatan layanan diblokir di langganan dan wilayah | Kuota langganan | Di layanan Kuota , periksa batas untuk tingkat dan wilayah Anda, lalu minta lebih banyak layanan. |
| Membuat, menskalakan, atau meningkatkan gagal meskipun kuota tersedia | Batasan kapasitas regional | Periksa catatan kaki di dukungan wilayah untuk tingkat yang dibatasi, lalu pilih wilayah lain. |
| Permintaan replika, partisi, tingkat, atau objek ditolak | Batas layanan atau indeks | Bandingkan jumlah konfigurasi dan objek Anda dengan batas layanan dan batas indeks. |
| Layanan pencarian mengembalikan respons pembatasan di bawah beban | Throttling | Kurangi tingkat permintaan atau tambahkan unit pencarian. Lihat Batas pembatasan. |
| Pengindeksan gagal di dekat batas penyimpanan atau vektor | Kuota penyimpanan atau vektor | Bandingkan storageSize dengan penyimpanan partisi untuk disk dan vectorIndexSize dengan batas ukuran indeks vektor untuk memori. |
| Pengindeks, keterampilan, atau vektorizer melaporkan 429 dari layanan lain | Azure OpenAI atau kuota layanan lainnya | Ikuti panduan kuota untuk layanan yang mengeluarkan kesalahan, seperti Azure OpenAI. |
Kuota langganan yang tersedia tidak menjamin kapasitas regional, dan meminta lebih banyak kuota tidak menyelesaikan batasan kapasitas. Jika kegagalan berlanjut, buka permintaan Azure support yang menyertakan langganan, wilayah, tingkat, konfigurasi yang diminta, teks kesalahan penuh, waktu UTC, dan korelasi atau ID operasi apa pun.
Batas langganan
Anda dapat membuat beberapa layanan pencarian yang dapat ditagih (Dasar dan lebih tinggi), hingga jumlah maksimum layanan yang diizinkan di setiap tingkatan, per wilayah. Misalnya, Anda dapat membuat hingga 16 layanan di tingkat Dasar dan 16 layanan lain di tingkat S1 dalam langganan dan wilayah yang sama. Anda kemudian dapat membuat 16 layanan Dasar tambahan di wilayah lain untuk total gabungan 32 layanan Dasar di bawah langganan yang sama. Untuk informasi selengkapnya tentang tingkat layanan, lihat Memilih model harga dan tingkat layanan.
Anda dapat menaikkan batas layanan maksimum berdasarkan permintaan. Jika Anda memerlukan lebih banyak layanan dalam langganan yang sama, ajukan permintaan dukungan.
| Sumber daya | Gratis 1 | Dasar | S1 | S2 | S3 | S3 HD | L1 | L2 | Pengembang Tanpa Server |
|---|---|---|---|---|---|---|---|---|---|
| Layanan maksimum per wilayah | 1 | 16 | 16 | 8 | 6 | 6 | 6 | 6 | 5 |
| Unit pencarian maksimum (SU)2 | Tidak Ada | 3 SU | 36 SU | 36 SU | 36 SU | 36 SU | 36 SU | 36 SU | Tidak Ada |
1 Anda dapat memiliki satu layanan pencarian gratis per langganan Azure. Tingkat gratis didasarkan pada infrastruktur yang dibagikan dengan pelanggan lain. Karena perangkat keras tidak didedikasikan, peningkatan skala tidak didukung, dan penyimpanan dibatasi hingga 50 MB. Layanan pencarian gratis mungkin dihapus setelah jangka waktu tidak aktif yang lama untuk memberikan ruang bagi lebih banyak layanan.
2 Unit pencarian (SU) adalah unit penagihan, dialokasikan sebagai replika atau partisi. Kau butuh keduanya. Untuk mempelajari selengkapnya tentang kombinasi SU, lihat Memperkirakan dan mengelola kapasitas layanan pencarian.
Batas layanan
Dalam model harga Dedicated, rencanakan kapasitas dengan mengalikan jumlah replika dengan jumlah partisi (unit pencarian).
| Sumber daya | Gratis | Dasar | S1 | S2 | S3 | S3 HD | L1 | L2 | Pengembang Tanpa Server |
|---|---|---|---|---|---|---|---|---|---|
| Sekat | Tidak Ada | 3 1 | 12 | 12 | 12 | 3 | 12 | 12 | Tidak Ada |
| Replika | Tidak Ada | 3 | 12 | 12 | 12 | 12 | 12 | 12 | Tidak Ada |
1 Tingkat Dasar mendukung tiga partisi dan tiga replika, untuk total sembilan unit pencarian (SU) pada layanan pencarian baru yang dibuat setelah 3 April 2024. Layanan Basic lama terbatas pada satu partisi dan tiga replika.
Layanan pencarian tunduk pada batas penyimpanan maksimum (ukuran partisi dikalikan dengan jumlah partisi) atau batas keras pada jumlah maksimum indeks atau pengindeks, batas mana pun yang lebih dulu.
Perjanjian tingkat layanan (SLA) berlaku untuk layanan yang dapat ditagih yang memiliki dua replika atau lebih untuk beban kerja kueri, atau tiga replika atau lebih untuk beban kerja kueri dan pengindeksan. Jumlah partisi bukanlah pertimbangan SLA. Untuk informasi selengkapnya, lihat Keandalan di Pencarian Azure AI.
Layanan gratis tidak memiliki partisi tetap atau replika dan berbagi sumber daya dengan pelanggan lain.
Partisi penyimpanan (GB)
Batas penyimpanan per layanan bervariasi berdasarkan dua faktor: tanggal dan wilayahpembuatan layanan. Sebagian besar wilayah yang didukung menawarkan batas yang lebih tinggi untuk layanan yang lebih baru.
Tabel ini menunjukkan perkembangan peningkatan kuota penyimpanan dalam GB dari waktu ke waktu. Mulai April 2024, partisi berkapasitas lebih tinggi mulai tersedia di wilayah yang tercantum dalam catatan kaki. Jika Anda memiliki layanan lama di wilayah yang didukung, periksa apakah Anda dapat meningkatkan layanan untuk mendapatkan batas penyimpanan yang lebih tinggi.
| Tanggal pembuatan layanan | Dasar | S1 | S2 | S3/HD | L1 | L2 | Pengembang Tanpa Server |
|---|---|---|---|---|---|---|---|
| Sebelum 3 April 2024 | 2 | Dua puluh lima | 100 | 200 | 1,024 | 2.048 | Tidak Ada |
| April 3, 2024 hingga Mei 17, 2024 1 | 15 | 160 | 512 | 1,024 | 1,024 | 2.048 | Tidak Ada |
| Setelah 17 Mei 2024 2 | 15 | 160 | 512 | 1,024 | 2,048 | 4,096 | Tidak Ada |
| Setelah 10 Februari 2025 3 | 15 | 160 | 512 | 1,024 | 2.048 | 4,096 | Tidak Ada |
1 Kapasitas penyimpanan yang lebih besar untuk Basic, S1, S2, dan S3 di wilayah-wilayah ini. Amerika: Brasil Selatan, Kanada Tengah, Kanada Timur, AS Timur, AS Timur 2, AS Tengah, AS Tengah Utara, AS Tengah Selatan, AS Barat, AS Barat 2, AS Barat 3, AS Tengah Barat. Eropa: Prancis Tengah. Italia Utara, Eropa Utara, Norwegia Timur, Polandia Tengah, Swiss Utara, Swedia Tengah, UK Selatan, Inggris Barat. Timur Tengah: UEA Utara. Afrika: Afrika Selatan Utara. Asia Pasifik: Australia Timur, Australia Tenggara, India Tengah, Jio India Barat, Asia Timur, Asia Tenggara, Jepang Timur, Jepang Barat, Korea Tengah, Korea Selatan.
2 Penyimpanan kapasitas yang lebih tinggi untuk L1 dan L2. Semakin banyak wilayah menyediakan kapasitas yang lebih tinggi di setiap tingkatan tarif. Amerika: East US 2 EUAP. Eropa: Jerman Utara, Jerman Barat Tengah, Swiss Barat. Azure Government: Texas, Arizona, Virginia. Afrika: Afrika Selatan Utara. Asia Pasifik: Tiongkok Utara 3, Tiongkok Timur 3.
3 Penyimpanan kapasitas yang lebih tinggi tersedia di Eropa Barat.
Penting
Saat ini, batas penyimpanan yang lebih tinggi tidak tersedia di wilayah berikut, dan mengikuti batas yang berlaku sebelum 3 April.
- Israel Tengah
- Qatar Tengah
- Spanyol Tengah
- India Selatan
Batas indeks
| Sumber daya | Gratis | Dasar 1 | S1 | S2 | S3 | S3 HD | L1 | L2 | Pengembang Tanpa Server |
|---|---|---|---|---|---|---|---|---|---|
| Indeks Maksimum | 3 | 5 atau 15 | 50 | 200 | 200 | 1000 per partisi atau 3000 per layanan | 10 | 10 | 30 |
| Bidang sederhana maksimum per indeks 2 | 1000 | 100 | 1000 | 1000 | 1000 | 1000 | 1000 | 1000 | 1000 |
| Dimensi maksimum per bidang vektor | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 |
| Kumpulan kompleks maksimum per indeks | 40 | 40 | 40 | 40 | 40 | 40 | 40 | 40 | 40 |
| Elemen maksimum di semua koleksi kompleks per dokumen 3 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 |
| Kedalaman maksimum bidang kompleks | 10 | 10 | 10 | 10 | 10 | 10 | 10 | 10 | 10 |
| Jumlah maksimum pemberi saran per indeks | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 |
| Jumlah maksimum profil penilaian per indeks | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 |
| Konfigurasi semantik maksimum per indeks | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 |
| Fungsi maksimum per profil | 8 | 8 | 8 | 8 | 8 | 8 | 8 | 8 | 8 |
| Ukuran indeks maksimum 4 | Tidak Ada | Tidak Ada | Tidak Ada | 1,88 TB | 2,34 TB | 100 GB | Tidak Ada | Tidak Ada | 1 GB |
1 Layanan dasar yang dibuat sebelum Desember 2017 memiliki batas bawah (5, bukan 15) pada indeks. Tingkat dasar adalah satu-satunya tingkat dengan batas bawah 100 bidang per indeks.
2 Batas atas bidang mencakup bidang tingkat pertama dan subbidang berlapis dalam koleksi yang kompleks. Misalnya, jika indeks berisi 15 bidang dan memiliki dua koleksi kompleks dengan masing-masing lima subbidang, jumlah bidang indeks Anda adalah 25. Indeks dengan koleksi bidang yang sangat besar bisa lambat. Batasi bidang dan atribut hanya untuk yang Anda butuhkan, dan jalankan pengujian pengindeksan dan kueri untuk memastikan performa dapat diterima.
3 Batas atas ada untuk elemen karena memiliki sejumlah besar dari mereka secara signifikan meningkatkan penyimpanan yang diperlukan untuk indeks Anda. Elemen koleksi kompleks didefinisikan sebagai anggota koleksi tersebut. Misalnya, asumsikan dokumen Hotel yang berisi koleksi kompleks Rooms. Setiap kamar dalam koleksi Ruangan dianggap sebagai elemen. Selama pengindeksan, mesin pengindeksan dapat dengan aman memproses maksimum 3.000 elemen di seluruh dokumen secara keseluruhan.
Batas ini dimasukkan padaapi-version=2019-05-06 dan berlaku hanya untuk koleksi kompleks, dan tidak untuk koleksi string atau bidang kompleks.
4 Untuk sebagian besar tingkatan, ukuran indeks maksimum adalah total penyimpanan yang tersedia di layanan pencarian Anda. Untuk layanan S2, S3, dan S3 HD dengan beberapa partisi, dan oleh karena itu lebih banyak penyimpanan, ukuran maksimum dari satu indeks diberikan dalam tabel. Berlaku untuk layanan pencarian yang dibuat setelah 3 April 2024. Indeks untuk layanan yang disiapkan dengan model serverless (Pratinjau) memiliki batas ukuran maksimum seperti yang tercantum dalam tabel.
Anda mungkin menemukan beberapa variasi dalam batas maksimum jika layanan Anda kebetulan disediakan pada kluster yang lebih kuat. Batasan di sini mewakili penyedenominator umum. Indeks yang dibangun berdasarkan spesifikasi di atas portabel di seluruh tingkat layanan yang setara di wilayah mana pun.
Batasan Dokumen
Setiap indeks mendukung hingga jumlah dokumen berikut:
- 24 miliar pada Basic, S1, S2, dan S3
- 2 miliar pada S3 HD
- 288 miliar pada L1
- 576 miliar pada L2
Setiap dokumen dapat berukuran hingga sekitar 16 megabyte. Batas ukuran dokumen sebenarnya berlaku untuk ukuran payload permintaan API pengindeksan, yaitu 16 megabyte. Payload tersebut dapat berupa satu dokumen atau batch dokumen. Untuk batch dengan satu dokumen, ukuran dokumen maksimum adalah 16 MB JSON.
Batas ukuran dokumen berlaku untuk pengindeksan mode dorong yang mengunggah dokumen ke layanan pencarian. Jika Anda menggunakan pengindeks untuk pengindeksan mode tarik, file sumber Anda dapat berukuran berapa pun, yang tunduk pada batas pengindeks. Untuk pengindeks blob, batas ukuran file lebih besar untuk tingkat yang lebih tinggi. Misalnya, batas S1 adalah 128 megabyte, batas S2 adalah 256 megabyte, dan sebagainya.
Saat Anda memperkirakan ukuran dokumen, ingatlah untuk mengindeks hanya bidang yang menambahkan nilai ke skenario pencarian Anda. Kecualikan bidang sumber yang tidak memiliki tujuan dalam kueri yang ingin Anda jalankan.
Batas untuk ukuran indeks vektor
Saat Anda mengindeks dokumen dengan bidang vektor, Pencarian Azure AI membuat indeks vektor internal menggunakan parameter algoritma yang Anda berikan.
Ukuran indeks vektor ini dibatasi oleh:
- Memori yang dialokasikan untuk pencarian vektor untuk tingkat layanan Anda (atau
SKU) dalam model harga Khusus. - Batas penyimpanan per indeks dalam model harga Tanpa Server.
Untuk panduan tentang mengelola dan memaksimalkan penyimpanan vektor, lihat Ukuran indeks vektor dan tetap di bawah batas.
Batas vektor bervariasi menurut:
Batas vektor lebih tinggi mulai April 2024 akan berlaku pada layanan pencarian baru di wilayah yang menyediakan kapasitas tambahan, yang mencakup sebagian besar wilayah tersebut. Jika Anda memiliki layanan lama di wilayah yang didukung, periksa apakah Anda dapat meningkatkan layanan Anda ke batas vektor yang lebih tinggi.
Dalam model harga Tanpa Server, batas vektor ditentukan per indeks daripada per partisi.
-
Ukuran indeks vektor maksimum per indeks (Tanpa Server): 300 MB
- Ukuran ini mewakili sekitar 30% total penyimpanan indeks, konsisten dengan rasio vektor-ke-penyimpanan yang digunakan dalam tingkat layanan Khusus.
- Ukuran ini merupakan batas tetap per indeks. Upaya untuk melebihi batas ini selama pengindeksan gagal.
Tabel ini menunjukkan perkembangan peningkatan kuota vektor dalam GB dari waktu ke waktu. Kuota per partisi, jadi jika Anda menskalakan layanan Standar (S1) baru menjadi 6 partisi, total kuota vektor adalah 35 dikalikan dengan 6.
| Tanggal pembuatan layanan | Dasar | S1 | S2 | S3/HD | L1 | L2 |
|---|---|---|---|---|---|---|
| Sebelum 1 Juli 20231 | 0,5 | 1 | 6 | 12 | 12 | 36 |
| Juli 1, 2023 hingga April 3, 20242 | 1 | 3 | 12 | 36 | 12 | 36 |
| April 3, 2024 hingga Mei 17, 20243 | 5 | 35 | 150 | 300 | 12 | 36 |
| Setelah 17 Mei 20244 | 5 | 35 | 150 | 300 | 150 | 300 |
1 Batas vektor awal selama pratinjau awal.
2 Batas vektor selama tahap pratinjau selanjutnya. Tiga wilayah tidak memiliki batas yang lebih tinggi: Jerman Barat Tengah, India Barat, Qatar Tengah.
3 Kuota vektor yang lebih tinggi berdasarkan partisi yang lebih besar untuk tingkatan dan wilayah yang didukung.
4 Kuota vektor yang lebih tinggi untuk lebih banyak tingkatan dan wilayah berdasarkan pembaruan ukuran partisi.
Layanan memberlakukan kuota ukuran indeks vektor:
- Khusus: untuk setiap partisi di layanan pencarian Anda
- Tanpa server: Per indeks
Kuota ini adalah batas yang sulit untuk memastikan layanan Anda tetap sehat. Upaya pengindeksan lebih lanjut setelah batas terlampaui mengakibatkan kegagalan. Anda dapat melanjutkan pengindeksan setelah mengosongkan kuota yang tersedia dengan:
- Menghapus dokumen vektor
- Mengurangi ukuran atau dimensi vektor
- (Khusus khusus) Menskalakan partisi
Penting
Batas vektor yang lebih tinggi terkait dengan ukuran partisi yang lebih besar. Saat ini, batas vektor yang lebih tinggi tidak tersedia di wilayah berikut, yang tunduk pada batas Juli–April.
- Israel Tengah
- Qatar Tengah
- Spanyol Tengah
- India Selatan
Batas pengindeksan
Waktu berjalan maksimum ada untuk memberikan keseimbangan dan stabilitas pada layanan secara keseluruhan, tetapi kumpulan data yang lebih besar mungkin memerlukan lebih banyak waktu pengindeksan daripada waktu maksimum yang diizinkan. Jika pekerjaan pengindeksan tidak dapat diselesaikan dalam waktu maksimum yang diizinkan, coba jalankan sesuai jadwal. Penjadwal terus menerus melacak status pengindeksan. Jika pekerjaan pengindeksan yang terjadwal terganggu karena alasan apa pun, pengindeks dapat melanjutkan dari titik terakhir saat dijalankan pada jadwal berikutnya.
Catatan
Dalam model harga Tanpa Server, perilaku pengindeks berbeda dari layanan Khusus. Kapasitas tidak ditentukan oleh replika atau partisi. Sebagai gantinya, batas objek per layanan, batas penyimpanan per indeks, dan pembatasan laju pada tingkat layanan menentukan batas pengindeksan. Akibatnya, beberapa batasan, seperti waktu eksekusi maksimum, bukan nilai tetap.
| Sumber daya | Gratis 1 | Dasar 2 | S1 | S2 | S3 | S3 HD 3 | L1 | L2 | Pengembang Tanpa Server |
|---|---|---|---|---|---|---|---|---|---|
| Pengindeks maksimum | 3 | 5 atau 15 | 50 | 200 | 200 | Tidak Ada | 10 | 10 | 30 |
| Sumber data maksimum | 3 | 5 atau 15 | 50 | 200 | 200 | Tidak Ada | 10 | 10 | 30 per layanan |
| Kemampuan maksimum 4 | 3 | 5 atau 15 | 50 | 200 | 200 | Tidak Ada | 10 | 10 | 30 |
| Beban pengindeksan maksimum per invokasi | 10.000 dokumen | Hanya dibatasi oleh jumlah maksimum dokumen | Hanya dibatasi oleh jumlah maksimum dokumen | Hanya dibatasi oleh jumlah maksimum dokumen | Hanya dibatasi oleh jumlah maksimum dokumen | Tidak Ada | Tidak ada batasan | Tidak ada batasan | Hanya dibatasi oleh jumlah maksimum dokumen |
| Jadwal paling minim | 5 menit | 5 menit | 5 menit | 5 menit | 5 menit | 5 menit | 5 menit | 5 menit | 5 menit |
| Waktu maksimum berjalan 5 | 1-3 atau 3-10 menit | 2 atau 24 jam | 2 atau 24 jam | 2 atau 24 jam | 2 atau 24 jam | Tidak Ada | 2 atau 24 jam | 2 atau 24 jam | 2 jam |
| Pengindeks blob 7: ukuran blob maksimum, MB | 16 | 16 | 128 | 256 | 256 | Tidak Ada | 256 | 256 | 256 |
| Pengindeks blob: karakter maksimum konten yang diekstrak dari blob 68 | 256.000 | 512.000 | 4 mil | 8 mil | 16 mil | Tidak Ada | 4 mil | 4 mil | 16 mil |
1 Layanan gratis memiliki waktu eksekusi maksimum pengindeks 3 menit untuk sumber blob, dan 1 menit untuk semua sumber data lainnya. Pemanggilan pengindeks adalah setiap 180 detik sekali. Untuk pengindeksan AI yang memanggil Foundry Tools, layanan gratis dibatasi hingga 20 transaksi gratis per pengindeks per hari, di mana transaksi didefinisikan sebagai dokumen yang berhasil melewati alur pengayaan. (Tips: Anda dapat mengatur ulang pengindeks untuk mengatur ulang jumlahnya.)
2 Layanan dasar yang dibuat sebelum Desember 2017 memiliki batas yang lebih rendah (5, bukan 15) pada pengindeks, sumber data, dan kumpulan keterampilan.
3 Dukungan pengindeks S3 HD tersedia dalam pratinjau, memerlukan REST API versi 2025-11-01-preview atau yang lebih baru, dan diatur oleh kuota harian pada tingkat layanan sebesar enam jam total waktu proses pengindeks yang berlaku untuk semua pengindeks. Pengindeks S3 HD hanya berjalan di lingkungan eksekusi multitenan dan tidak mendukung sumber daya private link bersama. Selama pratinjau, dukungan pengindeks HD S3 paling cocok untuk beban kerja kecil (sekitar 1 GB ukuran indeks) tanpa keterampilan atau minimal. Untuk informasi selengkapnya, lihat Eksekusi pengindeks pada Serverless dan S3 HD.
4 Maksimum 30 keterampilan per set keterampilan.
5 Mengenai durasi maksimum 2 atau 24 jam untuk pengindeks: maksimum 2 jam adalah yang paling umum dan itulah yang harus Anda rencanakan. Ini mengacu pada pengindeks yang berjalan di lingkungan publik, yang membebaskan pemrosesan intensif komputasi dan menyediakan lebih banyak sumber daya untuk kueri. Batas 24 jam berlaku jika Anda mengonfigurasi pengindeks untuk berjalan di lingkungan privat hanya menggunakan infrastruktur yang dialokasikan untuk layanan pencarian Anda. Beberapa pengindeks yang lebih lama tidak dapat berjalan di lingkungan publik, dan pengindeks tersebut selalu memiliki rentang pemrosesan 24 jam. Jika Anda memiliki pengindeks yang tidak terjadwal yang berjalan terus menerus selama 24 jam, Anda dapat mengasumsikan pengindeks tersebut tidak dapat dimigrasikan ke infrastruktur yang lebih baru. Sebagai aturan umum, untuk pekerjaan pengindeksan yang tidak dapat diselesaikan dalam waktu dua jam, letakkan pengindeks pada jadwal 5 menit sehingga pengindeks dapat dengan cepat mengambil tempat yang ditinggalkannya. Pada tingkat Gratis, waktu berjalan maksimum 3-10 menit diperuntukkan bagi pengindeks dengan kumpulan keterampilan.
6 Jumlah maksimum karakter didasarkan pada unit kode Unicode, khususnya UTF-16.
7 Saat menggunakan delimitedText mode penguraian untuk file CSV, batas ukuran buffer 10MB per baris file berlaku.
8 Saat menggunakan delimitedText mode penguraian untuk file CSV, batas "ukuran konten maksimum yang diekstrak" tidak berlaku.
Batas sumber daya untuk berbagi tautan pribadi
Pengindeks dapat mengakses sumber daya Azure lainnya melalui titik akhir privat yang dikelola melalui API sumber daya tautan privat bersama. Bagian ini menjelaskan batasan yang terkait dengan kemampuan ini.
Catatan
Tingkat Developer dalam model harga serverless tidak mendukung tautan privat bersama atau perimeter keamanan jaringan (NSP) ke sumber data. Titik Akhir Privat dan aturan firewall IP untuk koneksi privat ke layanan tingkat Pengembang Tanpa Server didukung.
| Sumber daya | Gratis | Dasar | S1 | S2 | S3 | S3 HD | L1 | L2 | Pengembang Tanpa Server |
|---|---|---|---|---|---|---|---|---|---|
| Dukungan pengindeks titik akhir privat | Tidak | Ya | Ya | Ya | Ya | Tidak | Ya | Ya | Tidak |
| Dukungan titik akhir privat untuk pengindeks dengan kumpulan keterampilan 1 | Tidak | Tidak | Ya | Ya | Ya | Tidak | Ya | Ya | Tidak |
| Dukungan titik akhir privat untuk kumpulan keterampilan dengan keterampilan penyematan 2 | Tidak | Ya | Ya | Ya | Ya | Tidak | Ya | Ya | Tidak |
| Maksimum titik akhir privat | Tidak Ada | 10 atau 30 | 100 | 400 | 400 | Tidak Ada | 20 | 20 | Tidak Ada |
| Jenis sumber daya maksimum yang berbeda 3 | Tidak Ada | 4 | 7 | 15 | 15 | Tidak Ada | 4 | 4 | Tidak Ada |
1 Pengayaan AI dan analisis gambar memerlukan komputasi yang intensif dan mengonsumsi daya pemrosesan yang tersedia secara tidak proporsional. Untuk alasan ini, koneksi privat dinonaktifkan pada tingkat yang lebih rendah untuk memastikan performa dan stabilitas layanan pencarian itu sendiri. Pada layanan Dasar, koneksi privat ke sumber daya Microsoft Foundry tidak didukung untuk mempertahankan stabilitas layanan. Untuk tingkat S1, pastikan layanan dibuat dengan batas yang lebih tinggi setelah 3 April 2024. Pengindeks dengan lebih dari 2 keterampilan penyematan multimodal Azure OpenAI Embedding atau Azure Vision dibatasi agar tidak berjalan di lingkungan privat, dan koneksi privat tidak tersedia.
2 Koneksi privat ke model penanaman didukung pada layanan pencarian Dasar dan S1 berkapasitas tinggi yang dibuat setelah 3 April 2024, dengan batas yang lebih tinggi untuk penyimpanan dan pemrosesan komputasi.
3 Jumlah jenis sumber daya yang berbeda dihitung sebagai jumlah nilai unik groupId yang digunakan di semua sumber daya tautan privat bersama untuk layanan pencarian tertentu, terlepas dari status sumber daya.
Batas jumlah sinonim
Jumlah maksimum peta sinonim bervariasi menurut tingkatan. Setiap aturan dapat memiliki hingga 20 ekspansi, di mana ekspansi adalah istilah yang setara. Misalnya, diberikan "cat", asosiasi dengan "kitty", "feline", dan "felis" (genus untuk kucing) dihitung sebagai tiga perluasan.
| Sumber daya | Gratis | Dasar | S1 | S2 | S3 | S3 HD | L1 | L2 | Pengembang Tanpa Server |
|---|---|---|---|---|---|---|---|---|---|
| Jumlah maksimum peta sinonim | 3 | 3 | 5 | 10 | 20 | 20 | 10 | 10 | 20 per layanan |
| Jumlah maksimum aturan per peta | 5.000 | 20000 | 20000 | 20000 | 20000 | 20000 | 20000 | 20000 | 20000 |
Batas untuk alias indeks
Jumlah maksimum alias indeks bervariasi menurut tingkat dan tanggal pembuatan layanan. Pada semua tingkatan, jika layanan dibuat setelah Oktober 2022, jumlah maksimum alias adalah dua kali lipat dari jumlah maksimum indeks yang diizinkan. Jika layanan dibuat sebelum Oktober 2022, batasnya adalah jumlah indeks yang diizinkan.
Catatan
Tingkat Developer dari model Serverless tidak mendukung alias indeks.
| Tanggal pembuatan layanan | Gratis | Dasar | S1 | S2 | S3 | S3 HD | L1 | L2 | Pengembang Tanpa Server |
|---|---|---|---|---|---|---|---|---|---|
| Sebelum Oktober 2022 | 3 | 5 atau 15 1 | 50 | 200 | 200 | 1000 per partisi atau 3000 per layanan | 10 | 10 | Tidak Ada |
| Setelah Oktober 2022 | 6 | 30 | 100 | 400 | 400 | 2000 per partisi atau 6000 per layanan | 20 | 20 | Tidak Ada |
1 Layanan dasar yang dibuat sebelum Desember 2017 memiliki batas bawah (5, bukan 15) pada indeks.
Batas penarikan agensi
Pangkalan pengetahuan menentukan satu atau beberapa sumber pengetahuan dan upaya penalaran pengambilan yang mengontrol tingkat pemrosesan model bahasa besar (LLM) untuk pengambilan agenik. Batas bervariasi menurut tingkat harga, versi API, dan tingkat upaya penalaran.
| Sumber daya | Gratis | Dasar | S1 | S2 | S3 | S3 HD | L1 | L2 | Pengembang Tanpa Server |
|---|---|---|---|---|---|---|---|---|---|
| Sumber pengetahuan maksimum per layanan | 3 | 5 atau 15 1 | 50 | 200 | 200 | 0 | 10 | 10 | 30 |
| Pangkalan pengetahuan maksimum per layanan | 3 | 5 atau 15 1 | 50 | 200 | 200 | 0 | 10 | 10 | 30 |
Sumber pengetahuan maksimum per pangkalan pengetahuan (minimal) 2 |
3 | 5 atau 10 1 | 10 | 10 | 10 | 0 | 10 | 10 | 10 |
Sumber pengetahuan maksimum per pangkalan pengetahuan (low) |
3 | 3 | 3 | 3 | 3 | 0 | 3 | 3 | 3 |
Sumber pengetahuan maksimum per pangkalan pengetahuan (medium) |
3 | 5 | 5 | 5 | 5 | 0 | 5 | 5 | 5 |
1 Layanan dasar yang dibuat sebelum 3 April 2024 memiliki batas yang lebih rendah (5) pada sumber pengetahuan dan pangkalan pengetahuan.
Sumber pengetahuan per pangkalan pengetahuan
Batas per pangkalan pengetahuan pada sumber pengetahuan bergantung pada versi API yang digunakan untuk membuat atau memperbarui pangkalan pengetahuan. Dalam 2026-05-01-preview, semua upaya penalaran pengambilan data mendukung batasan sumber pengetahuan yang sama. Versi pratinjau API sebelumnya memiliki batas yang lebih rendah untuk tingkat upaya penalaran low dan medium.
| Versi API | Upaya penalaran dalam pengambilan data | Gratis | Dasar | S1 | S2 | S3 | S3 HD | L1 | L2 |
|---|---|---|---|---|---|---|---|---|---|
2026-05-01-preview |
minimal, , lowmedium |
3 | 5 atau 10 1 | 10 | 10 | 10 | 0 | 10 | 10 |
2026-05-01-preview, 2025-08-01-preview |
minimal
2 |
3 | 5 atau 10 1 | 10 | 10 | 10 | 0 | 10 | 10 |
2026-05-01-preview, 2025-08-01-preview |
low |
3 | 3 | 3 | 3 | 3 | 0 | 3 | 3 |
2026-05-01-preview, 2025-08-01-preview |
medium |
3 | 5 | 5 | 5 | 5 | 0 | 5 | 5 |
2 Dalam versi API pratinjau sebelumnya, upaya penalaran minimal mendukung lebih banyak sumber pengetahuan daripada low atau medium karena mengabaikan perencanaan kueri berbasis LLM.
Batas data (pengayaan AI)
Batas data berlaku untuk alur pengayaan AI yang melakukan panggilan ke Bahasa Azure di Foundry Tools untuk pengenalan entitas, penautan entitas, ekstraksi frasa kunci, analisis sentimen, deteksi bahasa, dan deteksi informasi pribadi.
Ukuran maksimum rekaman adalah 50.000 karakter sebagaimana diukur oleh String.Length. Jika Anda perlu memecah data Anda sebelum mengirimkannya ke penganalisis sentimen, gunakan keahlian Pemisahan Teks.
Batas ini berlaku untuk model harga Khusus dan Tanpa Server.
Batas Pengendalian
Batas pembatasan membantu memastikan stabilitas layanan dengan mengontrol tingkat permintaan API.
Dalam model harga Dedicated, pembatasan laju didasarkan pada unit pencarian (replika × partisi).
Dalam model harga Tanpa Server, pembatasan tidak didasarkan pada unit pencarian. Sebaliknya, batas operasi tingkat layanan dan perilaku konsumsi keseluruhan mengatur throughput. Batas penggunaan dan layanan mengelola kapasitas, bukan konfigurasi replika dan partisi.
| Pengoperasian | Terdedikasikan (per unit pencarian) | Tanpa server (per layanan atau per indeks) |
|---|---|---|
| Daftar indeks (GET /indexes) | 3 permintaan/detik/SU | 3 permintaan/detik |
| Dapatkan indeks (GET /indexes/{index}) | 10 permintaan/detik/SU | 10 permintaan/detik |
| Membuat indeks (POST /indexes) | 12 permintaan/menit/SU | 12 permintaan/menit |
| Membuat atau memperbarui indeks (PUT /indexes/{index}) | 6 permintaan/detik/SU | 6 permintaan/detik |
| Hapus indeks (DELETE /indexes/{index}) | 12 permintaan/menit/SU | 12 permintaan/menit |
| Statistik layanan (GET /servicestats) | 4 permintaan/detik/SU | 4 permintaan/detik |
| Kueri pencarian (POST /indexes/{index}/docs/search) | Bervariasi menurut jumlah SU dan kompleksitas kueri | 50 permintaan/detik (batas baca gabungan per indeks) |
| Mengindeks dokumen (POST /indexes/{index}/docs/index) | Bervariasi menurut jumlah SU dan beban kerja pengindeksan | 5 permintaan/detik per indeks |
| Sarankan (POST /indexes/{index}/docs/suggest) | Bervariasi menurut jumlah SU | Tidak didefinisikan secara eksplisit |
| Lengkapi otomatis (POST /indexes/{index}/docs/autocomplete) | Bervariasi menurut jumlah SU | Tidak didefinisikan secara eksplisit |
Batas pengendalian ranker semantik
Peringkat semantik menggunakan sistem antrean untuk mengelola permintaan bersamaan. Sistem ini memungkinkan layanan pencarian untuk mendapatkan jumlah kueri tertinggi per detik yang mungkin. Ketika batas permintaan bersamaan tercapai, sistem menempatkan permintaan tambahan dalam antrean. Jika antrean penuh, sistem menolak permintaan lebih lanjut dan mereka harus dicoba kembali.
Total kueri pemeringkat semantik per detik bervariasi berdasarkan faktor-faktor berikut:
- Tingkat layanan pencarian. Kapasitas antrean dan batas permintaan bersamaan bervariasi menurut tingkatan.
- Jumlah unit pencarian di layanan pencarian. Cara paling sederhana untuk meningkatkan jumlah maksimum kueri peringkat semantik bersamaan adalah dengan menambahkan lebih banyak unit pencarian ke layanan pencarian Anda.
- Total kapasitas pemeringkat semantik yang tersedia di wilayah tersebut.
- Jumlah waktu yang diperlukan untuk memproses kueri menggunakan ranker semantik. Waktu ini bervariasi berdasarkan seberapa sibuk layanan pencarian.
Tabel berikut ini menjelaskan batas pembatasan ranker semantik berdasarkan tingkatan, tunduk pada kapasitas yang tersedia di wilayah tersebut. Anda dapat menghubungi dukungan Microsoft untuk meminta peningkatan batas.
| Sumber daya | Dasar | S1 | S2 | S3 | S3 HD | L1 | L2 | Pengembang Tanpa Server |
|---|---|---|---|---|---|---|---|---|
| Permintaan bersamaan maksimum (per unit pencarian) | 2 | 3 | 4 | 4 | 4 | 4 | 4 | 4 (per layanan) |
| Ukuran antrean permintaan maksimum (per unit pencarian) | 4 | 6 | 8 | 8 | 8 | 8 | 8 | 8 (per layanan) |
Batas permintaan API
Batasan kueri ada karena kueri yang tidak terikat dapat mendestabilisasi layanan pencarian Anda. Biasanya, kueri tersebut dibuat secara terprogram. Jika aplikasi Anda menghasilkan kueri pencarian secara terprogram, rancang agar tidak menghasilkan kueri dengan ukuran yang tidak terbatas.
Batasan payload ada karena alasan serupa, memastikan stabilitas layanan pencarian Anda. Batas berlaku untuk seluruh permintaan, termasuk semua komponennya. Misalnya, jika permintaan mengumpulkan beberapa dokumen atau perintah, seluruh permintaan harus sesuai dengan batas yang didukung.
Jika Anda harus melebihi batas yang didukung, uji beban kerja Anda sehingga Anda tahu apa yang diharapkan.
Kecuali jika dicatat, permintaan API berikut berlaku untuk semua antarmuka yang dapat diprogram, termasuk Azure SDK.
Umum:
- Batas payload maksimum yang didukung adalah 16 MB untuk pengindeksan dan permintaan kueri melalui REST API dan SDK.
- Panjang URL maksimum 8 KB (hanya berlaku untuk REST API).
Pengindeksan API:
- Mendukung maksimal 1.000 dokumen per batch pengunggahan, penggabungan, atau penghapusan indeks.
- Setiap permintaan mendukung antara 1 dan 32.000 tindakan pengindeksan.
API untuk Kueri
- Maksimum 10 bidang dalam kueri vektor
- Maksimum 32 bidang dalam klausa $orderby.
- Maksimum 100.000 karakter dalam klausa pencarian.
- Jumlah maksimum klausa dalam pencarian adalah 3.000.
- Batas maksimum pada kueri wildcard dan ekspresi reguler, seperti yang diberlakukan oleh Lucene. Ini membatasi jumlah pola, variasi, atau kecocokan hingga 1.000 contoh. Batas ini diberlakukan untuk menghindari kelebihan beban mesin.
Istilah pencarian:
- Ukuran istilah pencarian maksimum yang didukung adalah 32.766 byte (32 KB dikurangi 2 byte) teks yang dikodekan UTF-8. Berlaku untuk pencarian kata kunci dan properti teks pencarian vektor.
- Ukuran istilah pencarian maksimum yang didukung adalah 1.000 karakter untuk pencarian awalan dan pencarian regex.
Batas respons API
- Setiap halaman hasil pencarian mengembalikan hingga 1.000 dokumen.
- Setiap permintaan Suggest API mengembalikan hingga 100 saran.
Mesin pencari mengembalikan 50 hasil secara default, tetapi Anda dapat mengambil alih parameter ini hingga batas maksimum.
Batas kunci API
Gunakan kunci API untuk autentikasi layanan. Ada dua jenis kunci API. Kunci admin, yang Anda tentukan di header permintaan, menyediakan akses baca-tulis penuh ke layanan. Kunci kueri, yang Anda tentukan pada URL, bersifat baca-saja dan biasanya didistribusikan ke aplikasi klien.
- Setiap layanan mendukung hingga dua kunci admin.
- Setiap layanan mendukung hingga 50 kunci kueri.