Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Penting
Item-item yang ditandai (pratinjau) dalam artikel ini saat ini dalam pratinjau publik. Pratinjau ini disediakan tanpa perjanjian tingkat layanan, dan kami tidak merekomendasikannya untuk beban kerja produksi. Fitur tertentu mungkin tidak didukung atau mungkin memiliki kemampuan yang dibatasi. Untuk informasi selengkapnya, lihat Ketentuan Penggunaan Tambahan untuk Pratinjau Microsoft Azure.
Papan peringkat model di portal Foundry membantu Anda membandingkan model dalam katalog model Foundry dengan menggunakan tolok ukur model standar industri.
Anda dapat meninjau metodologi tolok ukur terperinci untuk setiap kategori papan peringkat:
- Tolok ukur kualitas model bahasa untuk memahami seberapa baik performa model pada tugas inti termasuk penalaran, pengetahuan, jawaban atas pertanyaan, matematika, dan pengodean.
- Tolok ukur keamanan model bahasa untuk memahami seberapa aman model terhadap pembuatan perilaku berbahaya.
- Tolok ukur performa model bahasa untuk memahami performa model dalam hal latensi dan throughput.
- Tolok ukur biaya model bahasa untuk memahami perkiraan biaya penggunaan model.
- Skenario tolok ukur papan peringkat model bahasa untuk membantu Anda menemukan model terbaik untuk kasus atau skenario penggunaan spesifik Anda.
- Tolok ukur kualitas model penyematan untuk memahami seberapa baik performa model pada tugas berbasis penyematan termasuk pencarian dan pengambilan.
Saat menemukan model yang sesuai, Anda dapat membuka hasil tolok ukur Terperincinya di katalog model. Dari sana, Anda dapat menyebarkan model, mencobanya di taman bermain, atau mengevaluasinya pada data Anda sendiri. Papan peringkat mendukung tolok ukur untuk model bahasa teks (termasuk model bahasa besar (LLM) dan model bahasa kecil (SLM)) dan model penyematan.
Tolok ukur model menilai LLM dan SLM di seluruh kualitas, keamanan, biaya, dan throughput. Model penyematan dievaluasi dengan menggunakan tolok ukur kualitas standar. Papan peringkat diperbarui saat model baru dan himpunan data tolok ukur tersedia.
Cakupan tolok ukur model
Papan peringkat model menampilkan pilihan model bahasa berbasis teks yang dikumpulkan dari katalog model Foundry. Model disertakan berdasarkan kriteria berikut:
- Model Foundry yang dijual oleh Azure diprioritaskan: Model yang dijual oleh Azure dipilih karena relevansinya dengan skenario AI generatif yang umum.
- Penerapan tolok ukur inti: Model harus mendukung tugas bahasa tujuan umum seperti penalaran, pengetahuan, jawaban atas pertanyaan, penalaran matematika, dan pengodean. Model khusus (misalnya, pelipatan protein atau QA khusus domain) dan modalitas lain tidak didukung.
Cakupan ini memastikan papan peringkat mencerminkan model berkualitas tinggi saat ini yang relevan dengan skenario AI inti.
Menginterpretasikan hasil papan peringkat
Papan peringkat membantu Anda membandingkan model di beberapa dimensi sehingga Anda dapat memilih model yang tepat untuk kasus penggunaan Anda. Berikut adalah beberapa panduan untuk menafsirkan hasilnya:
- Indeks kualitas: Indeks kualitas yang lebih tinggi menunjukkan performa keseluruhan yang lebih kuat di seluruh tugas penalaran, pengkodean, matematika, dan pengetahuan. Bandingkan indeks kualitas di seluruh model untuk mengidentifikasi performer teratas untuk tugas bahasa tujuan umum.
- Skor keamanan: Tingkat keberhasilan serangan yang lebih rendah menunjukkan model yang lebih kuat. Pertimbangkan skor keamanan bersama skor kualitas, terutama untuk aplikasi yang menghadap pelanggan di mana output berbahaya menjadi perhatian yang signifikan.
- Pengorbanan Performa: Gunakan metrik latensi dan throughput untuk memahami responsivitas model dalam konteks dunia nyata. Model dengan kualitas tinggi tetapi latensi tinggi mungkin tidak sesuai dengan aplikasi real-time.
- Pertimbangan biaya: Perkiraan metrik biaya menggunakan rasio token input-ke-output tiga-banding-satu. Sesuaikan ekspektasi Anda berdasarkan rasio input-ke-output beban kerja Anda yang sebenarnya.
- Papan peringkat skenario: Jika kasus penggunaan Anda memetakan ke skenario tertentu (misalnya, pengkodean atau matematika), mulailah dengan papan peringkat skenario untuk menemukan model yang dioptimalkan untuk tugas tersebut daripada hanya mengandalkan indeks kualitas keseluruhan.
Tips
Tolok ukur papan peringkat memberikan perbandingan standar di seluruh model menggunakan himpunan data publik. Untuk mengevaluasi performa model pada data tertentu dan kasus penggunaan Anda, lihat Mengevaluasi aplikasi AI generatif Anda.
Tolok ukur kualitas model bahasa
Foundry menilai kualitas LLM dan SLM menggunakan skor akurasi dari himpunan data tolok ukur standar yang mengukur kemampuan penalaran, pengetahuan, jawaban atas pertanyaan, matematika, dan pengkodean.
| Indeks | Deskripsi |
|---|---|
| Indeks kualitas | Dihitung dengan rata-rata skor akurasi yang berlaku (exact_match, , pass@1arena_hard) di seluruh himpunan data tolok ukur. |
Nilai indeks kualitas berkisar dari nol hingga satu, di mana nilai yang lebih tinggi menunjukkan performa yang lebih baik. Himpunan data yang disertakan dalam indeks kualitas adalah:
| Nama Himpunan Data | Kategori |
|---|---|
| bigbench_hard (dikurangi ke 1.000 contoh) | Penalaran |
| chembench | Kimia |
| frontierscience | Penalaran ilmiah |
| gpqa | Jaminan Kualitas (QA) |
| mbppplus | Pengkodean |
| mmlu_pro (downsampled menjadi 1.000 contoh) | Pengetahuan umum |
| musr | Penalaran |
| tau2_telecom | Pemilihan panggilan agenik dan alat |
Lihat detail selengkapnya dalam skor akurasi:
| Metrik | Deskripsi |
|---|---|
| Akurasi | Skor akurasi tersedia di himpunan data dan tingkat model. Pada tingkat himpunan data, skor adalah nilai rata-rata metrik akurasi yang dihitung atas semua contoh dalam himpunan data. Metrik akurasi yang digunakan ada exact_match di semua kasus, kecuali untuk himpunan data HumanEval dan MBPP yang menggunakan pass@1 metrik. Kecocokan yang tepat membandingkan teks yang dihasilkan model dengan jawaban yang benar sesuai dengan dataset, melaporkan satu jika teks yang dihasilkan cocok dengan jawaban dengan tepat dan nol sebaliknya. Metrik pass@1 mengukur proporsi solusi model yang lulus serangkaian pengujian unit dalam tugas generasi kode. Pada tingkat model, skor akurasi adalah rata-rata akurasi tingkat himpunan data untuk setiap model. |
Skor akurasi berkisar dari nol hingga satu, di mana nilai yang lebih tinggi lebih baik.
Tolok ukur keamanan model bahasa
Tolok ukur keselamatan dipilih melalui proses pemfilteran dan validasi terstruktur yang dirancang untuk memastikan relevansi dan kekakuan. Tolok ukur memenuhi syarat untuk penerimaan jika mengatasi risiko prioritas tinggi. Papan peringkat keselamatan termasuk tolok ukur yang cukup dapat diandalkan untuk memberikan sinyal yang bermakna tentang topik yang menarik karena berkaitan dengan keselamatan. Papan peringkat menggunakan HarmBench untuk keamanan model proksi, dan mengatur papan peringkat skenario sebagai berikut:
| Nama Himpunan Data | Skenario Papan Peringkat | Metrik | Interpretasi |
|---|---|---|---|
| HarmBench (standar) | Perilaku berbahaya standar | Tingkat Keberhasilan Serangan | Nilai yang lebih rendah berarti ketahanan yang lebih baik terhadap serangan yang dirancang untuk memunculkan konten berbahaya standar |
| HarmBench (kontekstual) | Perilaku berbahaya secara kontekstual | Tingkat Keberhasilan Serangan | Nilai yang lebih rendah berarti ketahanan yang lebih baik terhadap serangan yang dirancang untuk memunculkan konten yang berbahaya secara kontekstual |
| HarmBench (pelanggaran hak cipta) | Pelanggaran hak cipta | Tingkat Keberhasilan Serangan | Nilai yang lebih rendah menunjukkan ketahanan yang lebih kuat terhadap pelanggaran hak cipta |
| WMDP | Pengetahuan di domain sensitif | Akurasi | Nilai yang lebih tinggi menunjukkan pengetahuan yang lebih besar dalam domain sensitif |
| Toksigen | Deteksi konten beracun | Skor F1 | Nilai yang lebih tinggi menunjukkan performa deteksi yang lebih baik |
Deteksi perilaku berbahaya
Tolok ukur HarmBench mengukur perilaku berbahaya menggunakan perintah yang dirancang untuk memunculkan respons yang tidak aman. Ini mencakup tujuh kategori semantik:
- Kejahatan cyber dan penyusupan yang tidak sah
- Senjata kimia dan biologis atau obat-obatan
- Pelanggaran hak cipta
- Informasi yang salah dan disinformasi
- Pelecehan dan perundungan
- Aktivitas ilegal
- Bahaya umum
Kategori ini dikelompokkan ke dalam tiga area fungsional:
- Perilaku berbahaya standar
- Perilaku berbahaya secara kontekstual
- Pelanggaran hak cipta
Setiap kategori fungsional ditampilkan dalam papan peringkat skenario terpisah. Evaluasi menggunakan perintah langsung dari HarmBench (tanpa serangan) dan evaluator HarmBench untuk menghitung Tingkat Keberhasilan Serangan (ASR). Nilai ASR yang lebih rendah berarti model yang lebih aman. Tidak ada strategi serangan yang digunakan untuk evaluasi, dan tolok ukur model dilakukan dengan Foundry Guardrails (sebelumnya filter konten) dinonaktifkan.
Deteksi konten beracun
Toxigen adalah himpunan data skala besar untuk mendeteksi ucapan kebencian yang adversarial dan implisit. Ini termasuk kalimat beracun dan jinak secara implisit yang mereferensikan 13 grup minoritas. Foundry menggunakan sampel Toxigen yang telah dianotasikan dan menghitung skor F1 untuk mengukur performa klasifikasi. Skor yang lebih tinggi menunjukkan deteksi konten beracun yang lebih baik. Tolok ukur dilakukan dengan Foundry Guardrails (yang sebelumnya disebut sebagai filter konten) dimatikan.
Informasi domain sensitif
Tolok ukur Weapons of Mass Destruction Proxy (WMDP) mengukur pengetahuan model dalam domain sensitif termasuk biosekuriti, keamanan cyber, dan keamanan kimia. Papan peringkat menggunakan skor akurasi rata-rata di seluruh keamanan cyber, biosekuriti, dan keamanan kimia. Skor akurasi WMDP yang lebih tinggi menunjukkan lebih banyak pengetahuan tentang kemampuan berbahaya (perilaku yang lebih buruk dari sudut keamanan). Tolok ukur model dilakukan dengan Pagar Pembatas Foundry default (sebelumnya filter konten) aktif. Pagar pembatas ini mendeteksi dan memblokir konten yang membahayakan kekerasan, membahayakan diri sendiri, seksual, kebencian, dan tidak adil, tetapi tidak menargetkan kategori dalam keamanan cyber, biosekuriti, dan keamanan kimia.
Batasan tolok ukur keselamatan
Keamanan adalah topik kompleks dengan beberapa dimensi. Tidak ada tolok ukur sumber terbuka tunggal yang dapat menguji atau mewakili keamanan penuh sistem di semua skenario. Selain itu, banyak tolok ukur menderita kejenuhan atau ketidakselarasan antara desain tolok ukur dan definisi risiko. Beberapa tolok ukur juga tidak memiliki dokumentasi yang jelas tentang bagaimana risiko target dikonsep dan dioprasikan, sehingga sulit untuk menilai apakah hasilnya secara akurat menangkap nuansa risiko dunia nyata. Keterbatasan ini dapat menyebabkan perkiraan performa model menjadi terlalu tinggi atau terlalu rendah dalam skenario keselamatan dunia nyata.
Tolok ukur performa model bahasa
Metrik performa menggabungkan data selama 14 hari menggunakan 24 uji coba per hari, dengan dua permintaan per percobaan dikirim pada interval satu jam. Kecuali dinyatakan lain, parameter default berikut berlaku untuk penyebaran API tanpa server dan Azure OpenAI:
| Parameter | Nilai | Berlaku untuk |
|---|---|---|
| Wilayah | US Timur/US Timur2 | penyebaran API tanpa server dan Azure OpenAI |
| Batas tarif token per menit (TPM) | 30k (180 RPM berdasarkan pada Azure OpenAI) untuk tanpa penalaran dan 100k untuk model penalaran N/A (penyebaran API tanpa server) |
Untuk Azure model OpenAI, pengguna dapat memilih rentang batas tarif berdasarkan jenis penyebaran (API tanpa server, global, standar global, dan sebagainya.) Untuk penyebaran API tanpa server, pengaturan ini diabstraksi. |
| Jumlah permintaan | Dua permintaan dalam uji coba untuk setiap jam (24 percobaan per hari) | penyebaran API tanpa server, Azure OpenAI |
| Jumlah percobaan/eksekusi | 14 hari dengan 24 percobaan per hari untuk 336 pengujian | penyebaran API tanpa server, Azure OpenAI |
| Panjang Perintah/Konteks | Panjang sedang | penyebaran API tanpa server, Azure OpenAI |
| Jumlah token yang diproses (sedang) | Rasio 80:20 untuk token input ke output, yaitu, 800 token input menjadi 200 token output. | penyebaran API tanpa server, Azure OpenAI |
| Jumlah permintaan bersamaan | Satu (permintaan dikirim secara berurutan satu demi satu) | penyebaran API tanpa server, Azure OpenAI |
| Data | Sintetis (perintah input yang disiapkan dari teks statis) | penyebaran API tanpa server, Azure OpenAI |
| Jenis penyebaran | API tanpa server | Hanya berlaku untuk Azure OpenAI |
| Penayangan langsung | Benar | Berlaku untuk penyebaran API tanpa server dan Azure OpenAI. Untuk model yang diterapkan melalui komputasi terkelola, atau untuk titik akhir saat streaming tidak didukung, TTFT diwakili sebagai P50 dari metrik latensi. |
| SKU | Standard_NC24ads_A100_v4 (24 core, RAM 220GB, penyimpanan 64GB) | Hanya berlaku untuk Komputasi Terkelola (untuk memperkirakan metrik biaya dan performa) |
Performa LLM dan SLM dinilai di seluruh metrik berikut:
| Metrik | Deskripsi |
|---|---|
| Rata-rata latensi | Waktu rata-rata dalam detik untuk memproses permintaan, dihitung melalui beberapa permintaan. Permintaan dikirim ke titik akhir setiap jam selama dua minggu, dan rata-rata dihitung. |
| Latensi P50 | Latensi median (persentil ke-50). 50% permintaan selesai dalam waktu ini. |
| Latensi P90 | Latensi persentil ke-90. 90% permintaan selesai dalam waktu ini. |
| Latensi P95 | Latensi persentil ke-95. 95% permintaan selesai dalam waktu ini. |
| Latensi P99 | Latensi persentil ke-99. 99% permintaan selesai dalam waktu ini. |
| Lintasan GTPS | Token yang dihasilkan per detik (GTPS) adalah jumlah token output yang dihasilkan per detik sejak permintaan dikirim ke titik akhir. |
| Laju Penyampaian TTPS | Total token per detik (TTPS) adalah jumlah total token yang diproses per detik termasuk dari prompt input dan token output yang dihasilkan. Untuk model yang tidak mendukung streaming, waktu ke token pertama (TTFT) mewakili nilai latensi P50 (waktu yang diperlukan untuk menerima respons) |
| Latensi TTFT | Total waktu untuk token pertama (TTFT) adalah waktu yang diperlukan untuk token pertama dalam respons yang akan dikembalikan dari titik akhir saat streaming diaktifkan. |
| Waktu di antara token-token | Metrik ini adalah waktu antara token yang diterima. |
Untuk metrik kinerja seperti latensi atau throughput, waktu untuk token pertama dan token yang dihasilkan per detik memberikan gambaran keseluruhan yang lebih baik tentang kinerja dan perilaku umum model. Nomor performa di-refresh secara berkala untuk mencerminkan konfigurasi penyebaran terbaru.
Patokan biaya untuk model bahasa
Tolok ukur biaya mengukur biaya aktual untuk menjalankan setiap model pada himpunan data tolok ukur kualitas, bukan perkiraan biaya berdasarkan harga token.
Biaya tolok ukur dihitung menggunakan:
- Jumlah aktual token untuk input, penalaran, dan output yang digunakan selama pelaksanaan pengujian perbandingan.
- Konfigurasi upaya penalaran khusus model yang digunakan untuk evaluasi (biasanya
highatauxhigh). - Karakteristik dan kompleksitas himpunan data, yang memengaruhi penggunaan dan runtime token.
Tidak seperti perkiraan berdasarkan rasio token tetap, pendekatan ini mencerminkan biaya end-to-end yang sebenarnya untuk menjalankan beban kerja tolok ukur.
Cara menginterpretasikan hasil biaya
- Biaya dilaporkan dalam USD per pengujian tolok ukur di seluruh himpunan data kualitas standar.
- Nilai mewakili biaya eksekusi nyata dan mengaktifkan perbandingan langsung antar model.
- Nilai yang lebih rendah menunjukkan performa yang lebih hemat biaya pada rangkaian tolok ukur.
Tolok ukur skenario papan peringkat
Skenario leaderboards mengelompokkan himpunan data tolok ukur berdasarkan tujuan evaluasi umum dunia nyata. Anda dapat dengan cepat mengidentifikasi kekuatan dan kelemahan model dengan kasus penggunaan. Setiap skenario menggabungkan satu atau beberapa himpunan data tolok ukur publik.
Gunakan tabel berikut untuk menemukan kasus penggunaan Anda di kolom Skenario , lalu tinjau himpunan data tolok ukur terkait dan apa yang ditunjukkan hasilnya. Tabel berikut ini meringkas papan peringkat skenario yang tersedia serta himpunan data dan deskripsi terkaitnya:
| Skenario | Datasets | Deskripsi |
|---|---|---|
| Perilaku berbahaya standar | HarmBench (standar) | Rasio keberhasilan serangan pada prompt berbahaya standar. Lebih rendah lebih baik. Lihat Deteksi perilaku berbahaya. |
| Perilaku berbahaya secara kontekstual | HarmBench (kontekstual) | Tingkat keberhasilan serangan pada permintaan berbahaya kontekstual. Lebih rendah lebih baik. Lihat Deteksi perilaku berbahaya. |
| Pelanggaran hak cipta | HarmBench (hak cipta) | Tingkat keberhasilan serangan untuk pemicu pelanggaran hak cipta. Lebih rendah lebih baik. Lihat Deteksi perilaku berbahaya. |
| Pengetahuan di domain sensitif | WMDP (biosekuriti, keamanan kimia, keamanan siber) | Akurasi di tiga subset domain sensitif. Akurasi yang lebih tinggi menunjukkan lebih banyak pengetahuan tentang kemampuan sensitif. Lihat Pengetahuan domain sensitif. |
| Deteksi toksisitas | ToxiGen (diberi anotasi) | Skor F1 untuk kemampuan deteksi konten beracun. Lebih tinggi lebih baik. Lihat Deteksi konten beracun. |
| Penalaran | BIG-Bench Hard (1000 subsampel) | Penilaian kemampuan penalaran. Nilai yang lebih tinggi lebih baik. |
| Pengkodean | BigCodeBench (instruksi), LiveBench (pengkodean), LiveCodeBench Medium, MBPP+ | Mengukur akurasi pada tugas terkait kode. Nilai yang lebih tinggi lebih baik. |
| Pengetahuan umum | MMLU-Pro (Subsampel bahasa Inggris 1K) | 1.000 subsampel khusus bahasa Inggris dari MMLU-Pro. |
| Pertanyaan & jawaban | Arena-Hard, GPQA (berlian) | QA preferensi manusia adversarial (Arena-Hard) dan QA multi-disiplin tingkat pascasarjana (tingkat berlian GPQA). Nilai yang lebih tinggi lebih baik. |
| Matematika | MATH (500 contoh sebagian) | Mengukur kemampuan penalaran matematika model bahasa. Nilai yang lebih tinggi lebih baik. |
| Keterhubungan dengan Dasar | TruthfulQA (MC1) | Penilaian ketepatan konteks dan kebenaran model bahasa pilihan ganda. Nilai yang lebih tinggi lebih baik. |
Tolok ukur kualitas untuk model embedding
Indeks kualitas model penyematan didefinisikan sebagai skor akurasi rata-rata dari serangkaian himpunan data tolok ukur API tanpa server yang komprehensif yang menargetkan tugas Pengambilan Informasi, Pengklusteran Dokumen, dan Ringkasan.
| Metrik | Deskripsi |
|---|---|
| Akurasi | Akurasi adalah proporsi prediksi yang benar di antara jumlah total prediksi yang diproses. |
| Skor F1 | Skor F1 adalah rata-rata tertimbang dari presisi dan pengenalan, di mana nilai terbaik adalah satu (presisi dan pengenalan sempurna), dan yang terburuk adalah nol. |
| Presisi rata-rata (MAP) | MAP mengevaluasi kualitas sistem peringkat dan pemberi rekomendasi. Ini mengukur relevansi item yang disarankan dan seberapa baik sistem menempatkan item yang lebih relevan di bagian atas. Nilai dapat berkisar dari nol hingga satu, dan semakin tinggi MAP, semakin baik sistem dapat menempatkan item yang relevan tinggi dalam daftar. |
| Keuntungan kumulatif terdiskon yang dinormalisasi (NDCG) | NDCG mengevaluasi kemampuan algoritma pembelajaran mesin untuk mengurutkan item berdasarkan relevansi. Ini membandingkan peringkat dengan urutan ideal di mana semua item yang relevan berada di bagian atas daftar, di mana k adalah panjang daftar saat mengevaluasi kualitas peringkat. Dalam tolok ukur ini, k=10, ditunjukkan oleh metrik ndcg_at_10, yang berarti bahwa 10 item teratas dievaluasi. |
| Presisi | Presisi mengukur kemampuan model untuk mengidentifikasi instans kelas tertentu dengan benar. Presisi menunjukkan seberapa sering model pembelajaran mesin benar saat memprediksi kelas target. |
| Korelasi Spearman | Korelasi Spearman berdasarkan kesamaan kosinus dihitung dengan terlebih dahulu menghitung kesamaan kosinus antara variabel, lalu memberi peringkat skor ini dan menggunakan peringkat untuk menghitung korelasi Spearman. |
| Ukuran V | Ukuran V adalah metrik yang digunakan untuk mengevaluasi kualitas pengklusteran. Ukuran V dihitung sebagai rata-rata harmonis homogenitas dan kelengkapan, memastikan keseimbangan antara keduanya untuk skor yang bermakna. Kemungkinan skor terletak antara nol dan satu, dengan satu menjadi pelabelan yang sepenuhnya sempurna. |
Perhitungan skor
Skor individu
Hasil tolok ukur berasal dari himpunan data publik yang umumnya digunakan untuk evaluasi model bahasa. Dalam kebanyakan kasus, data dihosting di repositori GitHub dikelola oleh pembuat atau kurator data. Alur evaluasi foundry mengunduh data dari sumber aslinya, mengekstrak perintah dari setiap baris contoh, menghasilkan respons model, lalu menghitung metrik akurasi yang relevan.
Konstruksi prompt mengikuti praktik terbaik untuk setiap himpunan data (dataset), sesuai dengan penjelasan dalam makalah yang mengenalkan himpunan data tersebut dan standar industri. Dalam kebanyakan kasus, setiap prompt berisi beberapa contoh, yaitu, beberapa contoh pertanyaan lengkap dan jawaban untuk memberikan arahan kepada model untuk menyelesaikan tugas tersebut. Jumlah bidikan bervariasi menurut himpunan data dan mengikuti metodologi yang ditentukan dalam publikasi asli setiap himpunan data. Alur evaluasi membuat bidikan dengan mengambil sampel pertanyaan dan jawaban dari sebagian data yang disimpan dari evaluasi.
Batasan tolok ukur
Semua tolok ukur memiliki batasan melekat yang harus Anda pertimbangkan saat menafsirkan hasil:
- Tolok ukur kualitas: Himpunan data tolok ukur dapat menjadi jenuh dari waktu ke waktu karena model dilatih atau disetel pada data serupa. Hasil evaluasi mungkin juga bervariasi tergantung pada konstruksi prompt dan jumlah contoh beberapa bidikan yang digunakan.
- Tolok ukur performa: Metrik dikumpulkan menggunakan beban kerja sintetis dengan rasio token input-ke-output tetap dan penyebaran wilayah tunggal. Performa dunia nyata mungkin berbeda berdasarkan pola beban kerja, konkurensi, wilayah, dan konfigurasi penyebaran.
- Tolok ukur biaya: Perkiraan biaya didasarkan pada rasio token input ke output tiga ke satu dan harga saat ini pada saat pengukuran. Biaya aktual bergantung pada beban kerja Anda dan tunduk pada perubahan harga.