Karşılaştırmaları kullanarak modelleri seçme
Tip
Daha fazla ayrıntı için Metin ve resimler sekmesine bakın!
Modeli dağıtmadan önce, farklı boyutlarda nasıl performans sergilediğinden anlamak istiyorsunuz. Model karşılaştırmaları, modelleri karşılaştırmanıza ve bilinçli seçim kararları vermenize yardımcı olmak için nesnel, ölçülebilir veriler sağlar. Microsoft Foundry portalı, kalite, güvenlik, maliyet ve performans ölçümlerine göre düzenlenmiş kapsamlı karşılaştırma araçları sunar.
Model ölçütlerine erişim
Karşılaştırmaları Microsoft Foundry portalında iki şekilde inceleyebilirsiniz:
Model kataloğunda, tüm kullanılabilir modellerdeki karşılaştırmalı derecelendirmeleri görmek için Model puan tablosunu görüntüleyin. Bu görünüm, belirli ölçümler veya senaryolar için en yüksek performanslı modelleri belirlemenize yardımcı olur. Puan tablosu kalite, güvenlik, tahmini maliyet ve aktarım hızına göre sıralanmış en iyi modelleri görüntüler.
Belirli bir modelle ilgili ayrıntılı karşılaştırmalar için model kartını açın ve Karşılaştırmalar sekmesini seçin. Bu görünüm, modelin farklı ölçümler ve veri kümeleri arasında nasıl performans gösterdiğini ve benzer modellere göre karşılaştırma grafiklerinin nasıl performans gösterdiğini gösterir.
Kalite karşılaştırmaları
Kalite karşılaştırmaları, bir modelin doğru, tutarlı ve bağlamsal olarak uygun yanıtları ne kadar iyi ürettiğini değerlendirir. Bu ölçümler tutarlılığı sağlamak için genel veri kümelerini ve standartlaştırılmış değerlendirme yöntemlerini kullanır.
Kalite dizini, mantık, bilgi, soru yanıtlama, matematiksel yetenekler ve kodlama becerilerini ölçen birden çok karşılaştırma veri kümesindeki doğruluk puanlarını doğrulayarak üst düzey bir genel bakış sağlar. Daha yüksek kaliteli dizin değerleri, genel amaçlı dil görevlerinde genel performansın daha güçlü olduğunu gösterir.
Kalite karşılaştırmalarında aşağıdakiler gibi veri kümeleri kullanılır:
- Arena-Hard - karşıt soru yanıtlama
- BIG-Bench Zor - akıl yürütme özellikleri
- GPQA - lisansüstü düzeyde çok disiplinli sorular
- HumanEval+ ve MBPP+ - kod oluşturma görevleri
- MATEMATİk - matematiksel mantık
- MMLU-Pro - genel bilgi değerlendirmesi
- IFEval - yönerge aşağıda verilmiştir
Karşılaştırma puanları, sıfırdan bire kadar normalleştirilmiş dizinlerdir ve daha yüksek değerler daha iyi performans gösterir.
Güvenlik karşılaştırmaları
Güvenlik ölçümleri modellerin zararlı, taraflı veya uygunsuz içerik oluşturmamasını sağlar. Bu karşılaştırmalar, özellikle düzenlemeye tabi sektörlerde veya müşteriye yönelik senaryolarda son kullanıcılara sunulan uygulamalar için çok önemlidir.
Microsoft Foundry, modelleri birden çok güvenlik boyutu arasında değerlendirir:
Zararlı davranış algılama, modellerin güvenli olmayan içerik oluşturmaya ne kadar dayanıklı olduğunu ölçmek için HarmBench karşılaştırmasını kullanır. Değerlendirme, düşük değerlerin daha güvenli ve daha sağlam modelleri gösterdiği Saldırı Başarı Oranı'nı (ASR) hesaplar. HarmBench üç işlevsel alanı test eder:
- Standart zararlı davranışlar - siber suç, yasadışı faaliyetler, genel zarar
- Bağlamsal olarak zararlı davranışlar - yanlış bilgilendirme, taciz, zorbalık
- Telif hakkı ihlalleri - telif hakkıyla korunan malzemeyi yeniden üretme
Toksik içerik algılama , modellerin saldırgan ve örtük nefret konuşmasını ne kadar iyi tanımlayabildiği ölçmek için ToxiGen veri kümesini kullanır. Daha yüksek F1 puanları, azınlık gruplarına yapılan referanslar arasında daha iyi algılama performansını gösterir.
Hassas alan bilgisi, biyogüvenlik, siber güvenlik ve kimyasal güvenlikle ilgili model bilgilerini ölçmek için WMDP (Kitle İmha Silahları Proxy'si) ölçütünü kullanır. Daha yüksek WMDP puanları, tehlikeli olabilecek özellikler hakkında daha fazla bilgi olduğunu gösterir.
Güvenlik puanları, model sağlamlığını anlamanıza yardımcı olur ve özellikle zararlı çıkışın önemli endişeler doğurduğu müşteriye yönelik uygulamalar için önemlidir.
Maliyet karşılaştırmaları
Model kullanımının finansal etkisini anlamak, kalite gereksinimlerini bütçe kısıtlamalarıyla dengelemenize yardımcı olur. Microsoft Foundry'deki maliyet karşılaştırmaları sunucusuz API dağıtımları ve Azure OpenAI modelleri için fiyatlandırmayı görüntüler.
Giriş belirteçleri başına maliyet , 1 milyon giriş belirtecinin (modele gönderdiğiniz metin) işlenme fiyatını gösterir.
Çıkış belirteçleri başına maliyet , 1 milyon çıkış belirteci (modelin ürettiği metin) oluşturma fiyatını belirtir.
Tahmini maliyet , tipik bir 3:1 oranı (her çıkış belirteci için üç giriş belirteci) kullanarak giriş ve çıkış maliyetlerini bir araya getirerek karşılaştırma için tek bir sayı sağlar. Düşük değerler daha uygun maliyetli modelleri gösterir.
Maliyet karşılaştırmaları, uygulamanızın kullanım düzenlerine ve bütçesine uygun bir fiyat noktasında ihtiyacınız olan kaliteyi sunan modelleri belirlemenize yardımcı olur.
Performans karşılaştırmaları
Performans ölçümleri, modellerin isteklere ne kadar hızlı ve verimli bir şekilde yanıt verdiğini ölçer. Bu karşılaştırmalar, kullanıcı deneyiminin yanıt verme hızına bağlı olduğu gerçek zamanlı uygulamalar için önemlidir.
Gecikme süresi ölçümleri şunlardır:
- Gecikme süresi ortalaması - bir isteği işlemek için saniye olarak ortalama süre
- Gecikme süresi P50 (ortanca) - İsteklerin 50% bu zamandan daha hızlı tamamlanıyor
- Gecikme süresi P90 - 90% istek bu zamandan daha hızlı tamamlanıyor
- Gecikme süresi P95 - İsteklerin 95% bu süreden daha hızlı tamamlanıyor
- Gecikme süresi P99 - İsteklerin 99% bu süreden daha hızlı tamamlanıyor
- İlk belirtece ulaşma süresi (TTFT) - akış kullanılırken ilk belirtecin ulaşmasına kadar olan süre
Aktarım hızı ölçümleri şunlardır:
- Saniyede oluşturulan belirteçler (GTPS) - saniyede oluşturulan çıkış belirteçleri
- Saniye başına toplam belirteç sayısı (TTPS) - saniyede işlenen birleşik giriş ve çıkış belirteçleri
- Belirteçler arasındaki süre - ardışık belirteçleri alma aralığı
Puan tablosu, ortalama belirteç zamanı (daha düşük daha iyidir) ve saniyede oluşturulan ortalama belirteçleri (daha yüksek daha iyidir) kullanarak performansı özetler. Yüksek aktarım hızı ve düşük gecikme süresine sahip modeller, etkileşimli uygulamalarda daha iyi kullanıcı deneyimleri sağlar. Hızın maliyetten daha az öneme sahip olduğu toplu işleme işleri için diğer faktörlerin önceliklerini ayarlayabilirsiniz.
Puan tablolarını ve karşılaştırma özelliklerini kullanma
Model puan tablosu, belirli ölçümler için en iyi modelleri görüntülemenizi sağlar. Gereksinimlerinize en uygun modelleri belirlemek için kalite, güvenlik, tahmini maliyet ve aktarım hızına göre sıralama yapabilirsiniz.
Senaryo puan tabloları , akıl yürütme, kodlama, matematik, soru yanıtlama veya temellilik gibi belirli kullanım örnekleri için en iyi duruma getirilmiş modelleri bulmanıza yardımcı olur. Uygulamanız belirli bir senaryoyla eşleniyorsa, yalnızca genel kalite dizinine güvenmek yerine ilgili senaryo puan tablosuyla başlayın.
Ticari grafikler , kalite ve maliyet veya kalite ile aktarım hızı gibi iki ölçümü aynı anda görüntüler. Bu görselleştirmeler gereksinimleriniz için en uygun dengeyi bulmanıza yardımcı olur. Kaliteyi maliyet, aktarım hızı veya güvenlikle karşılaştırmak için açılan listeyi kullanın. Grafiğin sağ üst köşesine yakın modeller her iki ölçümde de iyi performans gösterir. Biraz daha az doğru ama önemli ölçüde daha hızlı veya daha ucuz bir model, ihtiyaçlarınıza daha iyi hizmet verebilir.
Yan yana karşılaştırma , puan tablosundan iki veya üç model seçmenize ve bunları birden çok boyutta karşılaştırmanıza olanak tanır:
- Performans karşılaştırmaları (kalite, güvenlik, aktarım hızı)
- Model ayrıntıları (bağlam penceresi, eğitim verileri, desteklenen diller)
- Desteklenen uç noktalar (dağıtım seçenekleri)
- Özellik desteği (işlev çağrısı, yapılandırılmış çıkış, görüntü işleme)
Adlarının yanındaki kutuları işaretleyerek modelleri seçin, ardından ayrıntılı karşılaştırma görünümünü açmak için Karşılaştır'ı seçin.