Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Sedang menampilkan:Versi portal Foundry (klasik) - Beralih ke versi untuk portal Foundry yang baru
Model router adalah model bahasa terlatih yang merutekan secara cerdas permintaan Anda secara real-time ke model bahasa besar (LLM) yang paling cocok. Anda menerapkan model router seperti menerapkan model Foundry lainnya. Hal ini memungkinkan performa tinggi sambil menghemat biaya, mengurangi latensi, dan meningkatkan responsivitas, serta mempertahankan kualitas yang setara, semuanya dikemas sebagai satu penyebaran model.
Catatan
Anda tidak perlu menyebarkan LLM yang didukung secara terpisah untuk digunakan dengan router model, dengan pengecualian model Claude. Untuk menggunakan router model dengan model Claude Anda, pertama-tama terapkan dari katalog model. Penempatan dipanggil oleh model router jika dipilih untuk perutean.
Untuk mencoba router model dengan cepat, ikuti Cara menggunakan router model. Setelah Anda menyebarkan router model, kirim permintaan ke penyebaran. Router model ini memilih model dasar untuk setiap permintaan berdasarkan pengaturan perutean Anda.
Tips
Portal Microsoft Foundry (baru) menawarkan opsi konfigurasi yang ditingkatkan untuk router model. Switch ke dokumentasi Microsoft Foundry (baru) untuk melihat fitur terbaru.
Cara kerja model router
Sebagai model bahasa terlatih, router model menganalisis perintah Anda secara real time berdasarkan kompleksitas, penalaran, jenis tugas, dan atribut lainnya. Ini tidak menyimpan permintaan Anda. Ini hanya merutekan ke model yang memenuhi syarat berdasarkan jenis akses dan penyebaran Anda, dengan tetap mematuhi batas zona data.
Penting
Jendela konteks yang efektif dibatasi oleh model terkecil yang mendasar. Untuk konteks yang lebih besar, gunakan subset model untuk memilih model yang mendukung kebutuhan Anda.
- Dalam mode Seimbang (default), model mempertimbangkan semua model yang mendasar dalam rentang kualitas kecil (misalnya, 1% hingga 2% dibandingkan dengan model berkualitas tertinggi untuk perintah tersebut) dan memilih model yang paling hemat biaya.
- Dalam Mode Biaya, mempertimbangkan rentang kualitas yang lebih luas (misalnya, 5% hingga 6% jika dibandingkan dengan model berkualitas tertinggi untuk prompt tersebut) dan memilih model yang paling hemat biaya.
- Dalam mode Kualitas, ia memilih model dengan peringkat kualitas tertinggi untuk prompt, tanpa memperhatikan biaya.
Mengapa menggunakan router model?
Model router mengoptimalkan biaya dan latensi sambil tetap menjaga kualitas yang setara. Model yang lebih kecil dan lebih murah digunakan ketika cukup untuk tugas, tetapi model yang lebih besar dan lebih mahal tersedia untuk tugas yang lebih kompleks. Selain itu, model penalaran tersedia untuk tugas yang memerlukan penalaran kompleks, dan model non-penalaran digunakan sebaliknya. Model router menyediakan satu platform penyebaran dan pengalaman obrolan yang menggabungkan fitur terbaik dari semua model obrolan dasar.
Versi saat ini, 2025-11-18 (terbaru), mencakup kemampuan berikut:
- Mendukung penyebaran Standar Global dan Standar Zona Data.
- Rute di seluruh model dari OpenAI, DeepSeek, Meta, xAI, dan Anthropic. Untuk kumpulan perutean saat ini, lihat Model yang didukung.
- Penyebaran cepat atau Penyebaran kustom dengan mode perutean dan opsi subset model .
-
Mode perutean: Optimalkan logika perutean untuk kebutuhan Anda. Opsi yang didukung:
Quality,Cost,Balanced(default). - Subset model: Pilih model pilihan Anda untuk membuat subset model Anda untuk perutean.
- Dukungan untuk skenario berbasis agen dengan alat pada model OpenAI, sumber terbuka (OSS), dan Anthropic yang memenuhi syarat di Foundry Agent Service.
Pengaturan Versi
Router model menggunakan versi bertanda tanggal. Versi saat ini adalah 2025-11-18 (terbaru), yang secara aktif dipertahankan - model dan fitur baru yang mendasar ditambahkan ke versi ini dari waktu ke waktu tanpa mengubah pengidentifikasi versi.
Versi lama (2025-08-07, 2025-05-19) dibekukan dan tidak menerima penambahan model baru.
| Versi | Status | Deskripsi |
|---|---|---|
2025-11-18 |
Aktif (terbaru) | Menerima pembaruan model dan fitur yang sedang berlangsung |
2025-08-07 |
Dibekukan | Set model tetap; tidak ada penambahan baru |
2025-05-19 |
Dibekukan | Set model tetap; tidak ada penambahan baru |
Tips
Anda tidak perlu menunggu nomor versi baru untuk mengakses model yang baru didukung. Versi 2025-11-18 diperbarui secara langsung saat model baru tersedia.
Jika Anda memilih Pembaruan otomatis pada langkah penyebaran (lihat Pembaruan model), penyebaran router model Anda secara otomatis diperbarui saat versi baru tersedia. Ketika itu terjadi, set model yang mendasar juga berubah, yang dapat memengaruhi performa keseluruhan model dan biaya.
Model yang didukung
Catatan
Anda tidak perlu menyebarkan model bahasa besar yang didukung secara terpisah untuk digunakan dengan router model, kecuali untuk model Claude. Untuk menggunakan router model dengan model Claude Anda, pertama-tama terapkan dari katalog model. Router model memanggil penyebaran jika Anda memilihnya untuk perutean.
Versi model router 2025-11-18 (terbaru)
| Format | Model | Versi |
|---|---|---|
| OpenAI | gpt-5.6-sol |
2026-07-09 |
| OpenAI | gpt-5.6-terra |
2026-07-09 |
| OpenAI | gpt-5.6-luna |
2026-07-09 |
| OpenAI | gpt-5.5 |
2026-04-24 |
| OpenAI | gpt-5.4 |
2026-03-05 |
| OpenAI | gpt-5.4-mini |
2026-03-17 |
| OpenAI | gpt-5.4-nano |
2026-03-17 |
| OpenAI | gpt-5.2 |
2025-12-11 |
| OpenAI | gpt-5 |
2025-08-07 |
| OpenAI | gpt-5-mini |
2025-08-07 |
| OpenAI | gpt-5-nano |
2025-08-07 |
| OpenAI | o4-mini |
2025-04-16 |
| OpenAI | gpt-4.1 |
2025-04-14 |
| OpenAI | gpt-4.1-mini |
2025-04-14 |
| OpenAI | gpt-4.1-nano |
2025-04-14 |
| OpenAI | gpt-4o |
2024-11-20 |
| OpenAI | gpt-4o-mini |
2024-07-18 |
| OpenAI | gpt-oss-120b |
1 |
| Anthropic | claude-opus-4-8 |
1 |
| Anthropic | claude-opus-4-7 |
1 |
| Anthropic | claude-opus-4-6 |
1 |
| Anthropic | claude-sonnet-4-5 |
20250929 |
| Anthropic | claude-haiku-4-5 |
20251001 |
| xAI | grok-4-1-fast-reasoning |
1 |
| xAI | grok-4 |
1 |
| DeepSeek | DeepSeek-V3.2 |
1 |
| Meta | Llama-4-Maverick-17B-128E-Instruct-FP8 |
1 |
Wilayah yang didukung
Router model mendukung penyebaran Standar Global di semua wilayah berikut. Tanda centang (✅) menunjukkan bahwa jenis penyebaran tersedia. Tanda hubung (-) menunjukkan bahwa data tersebut tidak tersedia.
| Region | Standar Global | Standar Wilayah Data |
|---|---|---|
| Australia Timur | ✅ | ✅ |
| Brasil Selatan | ✅ | - |
| Kanada Timur | ✅ | - |
| US Tengah | ✅ | ✅ |
| US Timur | ✅ | ✅ |
| US Timur 2 | ✅ | ✅ |
| Prancis Tengah | ✅ | ✅ |
| Jerman Barat Tengah | ✅ | ✅ |
| Italia Utara | ✅ | ✅ |
| Jepang Timur | ✅ | ✅ |
| Jepang Barat | ✅ | ✅ |
| Korea Tengah | ✅ | ✅ |
| US Tengah Utara | ✅ | ✅ |
| Polandia Tengah | ✅ | ✅ |
| Afrika Selatan Utara | ✅ | - |
| US Tengah Selatan | ✅ | ✅ |
| India Selatan | ✅ | ✅ |
| Asia Tenggara | ✅ | ✅ |
| Spanyol Tengah | ✅ | ✅ |
| Swedia Tengah | ✅ | ✅ |
| Swiss Utara | ✅ | ✅ |
| Swiss Barat | ✅ | - |
| UK Selatan | ✅ | - |
| UK Barat | ✅ | - |
| Barat Sentral AS | ✅ | - |
| Eropa Barat | ✅ | ✅ |
| US Barat | ✅ | ✅ |
| Barat AS 3 | ✅ | ✅ |
Catatan
Model yang tersedia untuk model router di setiap wilayah terbatas pada model dasar yang didukung di wilayah tersebut. Ekspansi regional ini memungkinkan Anda menggunakan model router untuk merutekan permintaan ke model yang didukung dan tersedia pada setiap wilayah yang tercantum.
Mode perutean
Dengan versi terbaru, jika Anda memilih penyebaran kustom, Anda dapat memilih mode perutean untuk mengoptimalkan kualitas atau biaya sambil mempertahankan tingkat kinerja dasar. Mengatur mode perutean bersifat opsional, dan jika Anda tidak mengaturnya, penyebaran Anda akan secara otomatis diatur ke Mode Seimbang.
Mode perutean yang tersedia:
| Modus | Deskripsi |
|---|---|
| Seimbang (default) | Mempertimbangkan biaya dan kualitas secara dinamis. Sempurna untuk skenario tujuan umum |
| Kualitas | Memprioritaskan untuk akurasi maksimum. Terbaik untuk penalaran kompleks atau output penting |
| Biaya | Memprioritaskan untuk penghematan biaya yang lebih besar. Ideal untuk beban kerja volume tinggi dan peka anggaran |
Subhimpunan model
Versi terbaru pengarah model mendukung subset model: Anda dapat menentukan model-model dasar yang akan disertakan dalam keputusan perutean. Ini memberi Anda lebih banyak kontrol atas karakteristik biaya, kepatuhan, dan performa.
Saat model dasar baru tersedia, model tersebut tidak disertakan dalam pilihan Anda kecuali Anda secara eksplisit menambahkannya ke daftar penyertaan penyebaran Anda.
Failover otomatis
Router model sekarang menyertakan failover otomatis bawaan. Saat menggunakan penyebaran default untuk merutekan ke semua model yang didukung, router model secara transparan mengalihkan permintaan ke model yang paling tepat berikutnya, sehingga masalah sementara dengan model tunggal apa pun tidak mengganggu aplikasi Anda. Failover diaktifkan secara default — tidak diperlukan konfigurasi tambahan.
Untuk konfigurasi penyebaran kustom:
- Mode perutean yang Anda pilih (Seimbang, Biaya, atau Kualitas) terus berlaku selama failover.
- Subset model yang Anda konfigurasi juga berfungsi sebagai set fallback untuk mencegah prompt Anda diproses oleh model yang tidak disetujui. Oleh karena itu, pastikan untuk memilih subset model dengan setidaknya dua model untuk mendapatkan manfaat dari kemampuan fallback.
Untuk memeriksa urutan percobaan model dan menentukan apakah fallback digunakan untuk permintaan Chat Completions tertentu, lihat Monitor model router.
Penyimpanan sementara prompt
Model router mendukung penyimpanan sementara permintaan karena permintaan diproses oleh model dasar. Ketika pemerute model mendelegasikan permintaan kepada model yang mendukung penyimpanan perintah sementara, token yang disimpan sementara digunakan secara otomatis — tidak memerlukan konfigurasi tambahan.
Perilaku cache tergantung pada model yang mendasar yang dipilih router untuk permintaan tertentu. Karena putusan routing mungkin bervariasi, manfaat caching hanya berlaku ketika model yang sama menangani permintaan berturut-turut dengan awalan prompt yang saling tumpang tindih.
Untuk detail tentang cara kerja pencachingan perintah dan model mana yang mendukungnya, lihat Pencachingan Prompt.
Keterbatasan
Untuk mengatasi batas jendela konteks dan parameter, gunakan fitur Subset Model untuk memilih model yang Anda pilih untuk perutean yang mendukung properti yang Anda inginkan.
Catatan
Batas jendela konteks yang tercantum untuk router model adalah batas dari model dasar yang paling kecil. Model mendasar lainnya kompatibel dengan jendela konteks yang lebih besar, yang berarti panggilan API dengan konteks yang lebih besar hanya akan berhasil jika prompt kebetulan dirutekan ke model yang tepat. Untuk meninjau jendela konteks untuk model yang mendasarinya, lihat Azure OpenAI dalam model Microsoft Foundry.
Untuk mempersingkat jendela konteks, Anda bisa melakukan salah satu hal berikut ini:
- Meringkas perintah sebelum meneruskannya ke model
- Memotong prompt menjadi bagian yang lebih relevan
- Gunakan embedding dokumen dan biarkan model obrolan mengambil bagian yang relevan. Untuk informasi selengkapnya, lihat Apa Pencarian Azure AI?
Lapisan kuota
Router model membatasi skala dengan tingkat penggunaan langganan Anda. Untuk informasi tentang cara kerja tingkatan, lihat Tingkat kuota.
| Tier | GlobalStandard RPM | GlobalStandard TPM | DataZoneStandard RPM | DataZoneStandard TPM |
|---|---|---|---|---|
| Tingkat 1 | 1,000 | 1,000,000 | 300 | 300,000 |
| Tingkat 2 | 2.000 | 2,000,000 | 670 | 670.000 |
| Tingkat 3 | 4,000 | 4.000.000 | 1,000 | 1,000,000 |
| Tingkat 4 | 7,000 | 7,000,000 | 2.000 | 2,000,000 |
| Tingkat 5 | 10,000 | 10.000.000 | 3,000 | 3,000,000 |
| Tingkat 6 | 15,000 | 15.000.000 | 4,000 | 4.000.000 |
Untuk informasi batas tarif lainnya, lihat Kuota dan batasan.
Model router menerima input gambar untuk obrolan yang berkemampuan Vision (semua model dasarnya dapat menerima input gambar), tetapi keputusan perutean hanya didasarkan pada input teks.
Router model tidak memproses input audio.
Pemecahan masalah
| Masalah | Resolusi |
|---|---|
| Penyebaran gagal | Verifikasi bahwa sumber daya Foundry Anda berada di wilayah yang didukung. |
| Model Claude tidak perutean | Pastikan model Claude disebarkan secara terpisah sebelum mengaktifkan router model. |
| Kesalahan batas konteks terlampaui | Kurangi ukuran prompt atau gunakan subset model untuk memilih model dengan jendela konteks yang lebih besar. |
| Pilihan model tak terduga | Tinjau pengaturan mode perutean Anda (Seimbang, Biaya, Kualitas) dan konfigurasi subset model. |
Untuk pemecahan masalah penyebaran terperinci, lihat Cara menggunakan router model.
Informasi penagihan
Penggunaan model router dikenakan biaya untuk permintaan masukan pada tarif yang tercantum di halaman harga.
Anda dapat memantau biaya penyebaran router model Anda di portal Azure.