Model performansını değerlendirme

Tamamlandı

Tip

Daha fazla ayrıntı için Metin ve resimler sekmesine bakın!

Dağıtılan modelinizi değerlendirmek kalite standartlarına uygun olmasını sağlar, doğru yanıtlar sağlar ve zaman içinde sürekli olarak iyileştirir. Microsoft Foundry portalı, el ile testten otomatik ölçümlere ve kapsamlı değerlendirme akışlarına kadar birçok değerlendirme yaklaşımı sunar.

Modelleri neden değerlendirin?

Değerlendirme, yapay zeka uygulama geliştirmede birkaç kritik amaca hizmet eder:

Kalite güvencesi sorunları tanımlar ve modelinizin doğru, ilgili yanıtlar sağlamasını sağlar. Üretim yerine değerlendirme sırasında sorunları keşfetmek kullanıcılarınızı ve kuruluşunuzun itibarını korur.

Modeller tutarlı bir şekilde yararlı ve uygun yanıtlar verdiği zaman kullanıcı memnuniyeti iyileştirir. Değerlendirme, kullanıcıların uygulamanızda nasıl deneyim yaşadığını ve iyileştirmelerin en büyük etkiyi nerede yarattığını anlamanıza yardımcı olur.

Sürekli iyileştirme, geliştirme fırsatlarını belirlemek için değerlendirme sonuçlarının analiz edilmesinden gelir. İstemleri güncelleştirirken, özellik eklerken veya modelleri yeniden eğiterken düzenli değerlendirme, sürekli kaliteyi güvence altına alır.

Uyumluluk ve güvenlik doğrulaması, modelinizin ilkelere uygun olduğunu onaylar, zararlı içerik oluşturmaktan kaçınarak kullanıcı gizliliği ve veri koruma gereksinimlerine uyar.

El ile değerlendirme yaklaşımları

El ile değerlendirme, insan gözden geçirenlerin model yanıtlarını değerlendirmesini içerir. Zaman açısından yoğun olsa da el ile değerlendirme, otomatik ölçümlerin yakalayamadıklarına ilişkin içgörüler sağlar.

Oyun alanında etkileşimli test, model davranışını nitel olarak keşfetmenizi sağlar. Çeşitli istemler girer, yanıtları gözlemler ve yanlış bilgiler, uygunsuz ton veya yönergeleri izlememe gibi sorunları not alırsınız. Bu keşif testi, modelin güçlü yönlerini ve sınırlamalarını anlamanıza yardımcı olur.

Uygulama tasarımınızı iyileştirmeye yardımcı olmak için modelleri oyun alanında yan yana test edebilir, sistem yönergelerini ve istemlerini eşitleyerek yanıtlarını karşılaştırabilirsiniz.

Microsoft Foundry portalındaki sohbet oyun alanının ekran görüntüsü.

Yapılandırılmış inceleme , uygulamanızın kullanım örneklerini temsil eden bir dizi test çalışması oluşturmayı içerir. İnsan değerlendiriciler yanıtları aşağıdaki ölçütlere göre derecelendirir:

  • İlgi: Yanıt, soruyu veya isteği ele alır mı?
  • Bilgilendiricilik: Yeterli ayrıntı ve yararlı bilgiler sağlıyor mu?
  • Katılım: Yanıt ilginç ve uygun bir şekilde konuşma amaçlı mı?
  • Doğruluk: Olgular ve ifadeler doğru mu?
  • Güvenlik: Yanıt zararlı, taraflı veya uygunsuz içerikten kaçınıyor mu?

Değerlendiriciler genellikle her ölçüt için derecelendirme ölçeklerini (1-5 gibi) kullanır. Birden çok test çalışması genelinde toplam derecelendirmeler, genel kaliteye yönelik nicel ölçüler sağlar.

Kullanıcı çalışmaları , uygulamanızla etkileşim kuran gerçek veya temsili kullanıcılardan geri bildirim toplar. Kullanıcı geri bildirimi, kafa karıştırıcı ifadeler, eksik bağlam veya karşılanmayan beklentiler gibi denetimli testlerde kaçırabileceğiniz gerçek dünya sorunlarını ortaya koyuyor.

El ile değerlendirme, kullanıcı memnuniyeti, bağlamsal uygunluk ve ölçümlerin tek başına ölçemediği marka uyumluluğu gibi öznel kalite yönlerini yakalayarak otomatik yaklaşımları tamamlar.

Otomatik değerlendirme ölçümleri

Otomatik değerlendirme, modelinizin çıkışlarını otomatik olarak değerlendirmek için standart ölçümleri kullanır. Bu değerlendirmeler verimli bir şekilde ölçeklendirilir ve tutarlı, objektif ölçümler sağlar.

Microsoft Foundry portalı, aşağıdakiler dahil olmak üzere çeşitli değerlendirme ölçümlerini destekler:

Nesil kalitesi ölçümleri genel yanıt kalitesini değerlendirir:

  • Temellilik: Yanıtların spekülasyon yerine sağlanan bağlamı temel alıp almadığını belirler. Groundedness Pro, gerçek doğruluk gereksinimleri için kullanışlı ikili değerlendirme (temellendirilmiş veya temellendirilmemiş) sunar.
  • İlgi: Yanıtların kullanıcının sorusuna veya isteğine uygun şekilde yanıt verip vermediğini ölçer.
  • Tutarlılık: Yanıtların mantıksal olarak akıp akmadığını değerlendirir ve tutarlı fikirleri korur.
  • Akıcılık: Dil doğruluğunu ve doğal dil kalitesini değerlendirir.

Risk ve güvenlik ölçümleri olası zararlı içeriği tanımlar:

  • Kendine zarar verme içeriği: Kendine zarar verme konusunu tartışan veya teşvik eden yanıtları algılar
  • Nefret dolu ve haksız içerik: Yanlılık, ayrımcılık veya nefret dolu ifadeleri tanımlar
  • Şiddet içeren içerik: Şiddet içeren veya teşvik eden yanıtları işaretler
  • Cinsel içerik: Uygunsuz cinsel içeriği algılar
  • Korumalı malzeme: Olası telif hakkı veya özel içerik çoğaltmasını tanımlar
  • Dolaylı saldırı (jailbreak): Düzenleme girişimlerine yönelik güvenlik açığını değerlendirir

İçerik zarar ölçümleri için sonuçlar hata oranı olarak toplanır; önem derecesi eşiğini (genellikle Orta) aşan yanıtların yüzdesi. Korunan malzeme ve dolaylı saldırı için hata oranı olarak (true instances / total instances) × 100hesaplanır.

Yapay zeka destekli değerlendirmeyi kullanırken değerlendirmeyi gerçekleştirmek için bir GPT modeli belirtirsiniz. Bu değerlendirici modeli, dağıtılan modelinizin yanıtlarını analiz eder ve seçilen ölçütlere göre puan atar.

Doğal dil işleme ölçümleri

NLP ölçümleri, değerlendirici modeli gerektirmeden matematiksel tabanlı değerlendirme sağlar. Bu ölçümler genellikle temel doğruluk verilerine (karşılaştırma için beklenen veya doğru yanıtlar) ihtiyaç duyar.

F1 puanı, oluşturulan ve temel alınan yanıtlar arasında paylaşılan sözcüklerin oranını ölçer ve doğruluğu (yanlış sözcüklerden kaçınarak) ile geri kazanımı (önemli sözcükleri dahil ederek) dengeleyerek yanıt kalite değerlendirmesini yapar. F1 puanı, metin sınıflandırması ve bilgi alma gibi görevler için değerlidir.

BLEU (İki Dilli Yardımcı Değerlendirme), makine çevirisi değerlendirmesi için yaygın olarak kullanılan, oluşturulan ve başvuru metinleri arasındaki n-gramları (sözcük dizileri) karşılaştırır.

METEOR (Açık Sıralama ile Çevirinin Değerlendirilmesi için Ölçüm), eş anlamlılar, kök bulma ve yeniden ifade etme kullanarak BLEU'nun kapsamını genişletir ve daha esnek bir karşılaştırma sağlar.

ROUGE (Gisting Değerlendirmesi için Geri Çağırma Odaklı Yardımcı), kesinlikten ziyade geri çağırmaya vurgu yapar, bu da önemli noktaları kapsamak için ek sözcüklerden kaçınmaktan daha yararlı olduğu özetleme görevlerinde özellikle kullanışlı hale getirir.

GLEU (Google-BLEU), cümle düzeyinde değerlendirme için tasarlanmış bir BLEU çeşididir.

Kesin doğru yanıtlara veya başvuru metinlerine sahip olduğunuzda NLP ölçümleri iyi çalışır. Bunlar, birçok geçerli yanıtın bulunduğu açık uçlu oluşturma için daha az uygundur.

Kapsamlı değerlendirmeler oluşturma

Microsoft Foundry portalının Değerlendirme özelliği, test veri kümelerini ve birden çok ölçümü aynı anda kullanarak sistematik değerlendirmeler çalıştırmanızı sağlar.

Değerlendirmenizi aşağıdakilerden birine dayandırabilirsiniz:

  • Model: Dağıtılan modeli belirttiğiniz istemlerle değerlendirin. Sistem değerlendirme sırasında çıkışlar oluşturur.
  • Aracı: Kullanıcı tanımlı istemlerle bir aracının yanıtlarını değerlendirin.
  • Veri kümesi: Test veri kümenizde zaten mevcut olan önceden oluşturulmuş çıkışları değerlendirin.

Bir modeli veya aracıyı değerlendirirken, değerlendirmeye yönelik girişler sağlamak için bir veri kümesine ihtiyacınız vardır. Üç seçeneğiniz vardır:

  • Yeni veri kümesini yükle: Yerel storage test çalışmalarını içeren bir CSV veya JSONL dosyası sağlayın.
  • Var olan veri kümesini kullan: Daha önce project yüklediğiniz veri kümelerinden seçim yapın.
  • Yapay veri kümesi oluşturma: Test verileriniz yoksa sistem, sağladığınız konu açıklamasına göre örnek veriler oluşturabilir. Veri oluşturulacak kaynağı, satır sayısını ve istenen verileri açıklayan bir istem belirtirsiniz. Ayrıca, özel görevinizle ilgili ilgiyi geliştirmek için dosyaları karşıya yükleyebilirsiniz.

Çıktıların önceden oluşturulduğu veri kümesi değerlendirmesi için hem girişleri hem de model tarafından oluşturulan yanıtları içeren veri kümenizi seçin veya karşıya yükleyin.

Hesaplamak istediğiniz ölçümleri, değerlendirme verileri için alan eşlemelerini ve model için sistem istemini yapılandırdıktan sonra; değerlendirme işini başlatabilirsiniz. Bu işlem, zaman uyumsuz olarak çalıştırıldığında biraz zaman alabilir ve test veri kümenizdeki her satır, seçilen ölçümlere göre işlenir.

Değerlendirme sonuçlarını gözden geçirme

Değerlendirme tamamlandığında sonuçlar, seçtiğiniz ölçümlerin toplam puanlarını ve her test isteminin ayrıntılarını gösterir.

Değerlendirme sonuçlarının ekran görüntüsü.

Değerlendirici kitaplığını keşfet

Değerlendirici kitaplığı, kullanılabilir tüm değerlendiricileri görüntülemek ve yönetmek için merkezi bir konum sağlar. Projenizin Evaluation sayfasından, Evaluator kütüphanesi sekmesini seçerek erişebilirsiniz.

Değerlendirici kitaplığında şunları yapabilirsiniz:

  • Kalite, güvenlik ve performans için Microsoft tarafından seçilmiş değerlendiricileri görüntüleme
  • Ad, açıklama, parametreler ve ilişkili dosyalar dahil olmak üzere değerlendirici ayrıntılarını inceleyin
  • Ölçümlerin nasıl hesaplanmış olduğunu anlamak için kalite değerlendiricileri için ek açıklama istemlerini gözden geçirin
  • Güvenlik değerlendiricileri için tanımları ve önem derecelerini denetleyin
  • Belirli senaryolar için oluşturduğunuz özel değerlendiricileri yönetme

Kitaplık, farklı sürümleri karşılaştırmanıza, gerekirse önceki sürümleri geri yüklemenize ve özel değerlendiriciler üzerinde başkalarıyla birlikte çalışmanıza izin veren sürüm yönetimini destekler.

Değerlendirme bazında yineleme yapın

Değerlendirme sonuçları sonraki adımlarınızı bildirir:

Puanlar gerekenden düşük olduğunda şunları göz önünde bulundurun:

  • İstem mühendisliği: Yönergeleri ve sistem iletilerini iyileştirme
  • Farklı modeller: Kullanım durumunuz için en iyi duruma getirilmiş modelleri deneme
  • RAG tümleştirmesi: Verilerinizdeki temel yanıtlara alma özellikleri ekleme
  • İnce ayar: Modeli belirli bir etki alanınızda eğitme (destekleniyorsa)

Bu adımların her biri karmaşıklıkta (ve bazen maliyette) artabilir, bu nedenle geliştirmeleri planlarken bunu dikkate alın.

Güvenlik ölçümleri endişeleri gösterdiğinde:

  • İçerik filtreleri: Azure Yapay Zeka İçerik Güvenliği hizmetlerinin uygulanması
  • İstem sağlamlaştırma: Sistem iletilerine güvenlik yönergeleri ekleme
  • Çıkış doğrulaması: Kullanıcılara görüntülenmeden önce yanıtları denetleme

Değişiklik yaparken düzenli değerlendirme, iyileştirmeleri izler ve kalitenin gerilememesini sağlar. Geliştirmenin erken aşamalarında değerlendirme karşılaştırmaları oluşturun, ardından etkiyi objektif olarak ölçmek için yapılan değişikliklerden sonra değerlendirmeleri yeniden çalıştırın.

El ile test, otomatik ölçümler ve kapsamlı değerlendirme akışlarını birleştirerek modelinizin iyi performans göstermesi, kullanıcılara güvenli bir şekilde hizmet sunması ve uygulamanızın kalite gereksinimlerini karşılaması konusunda güven oluşturursunuz.