Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Note
Bu makaledeki özellikler, standart koşar tarafından beslenen acenteler için Lisanslama bölümünde tanımlanan faturalama seçeneklerini kullanan standart koşum sistemiyle desteklenmektedir. Access standart ajanlar ve ajan akışlarında standart özelliklere nasıl erişileceğini öğrenin.
Yapay zeka ajanları iş süreçlerinde kritik roller üstlendikçe, güvenilir ve tekrarlanabilir test ihtiyacı önemli hale gelir. Ajan değerlendirmesi, ajanınız için gerçek dünya senaryolarını simüle eden testler oluşturmanıza olanak tanır. Bu testler, manuel, vaka bazlı testlere göre daha fazla soru ve konuşmayı daha hızlı kapsar. Ardından, aracının erişebileceği bilgilere bağlı olarak, aracınızın etkileşimlerinin doğruluğunu, ilgililiğini ve yanıt kalitesini ölçebilirsiniz . Test setinden elde edilen sonuçları kullanarak, temsilcinizin davranışını optimize edebilir ve temsilcinizin iş ve kalite gereksinimlerinizle karşılandığını doğrulayabilirsiniz.
Neden otomatik test kullanılıyor?
Ajan değerlendirmesi otomatik, yapılandırılmış test sağlar. Sorunları erken yakalamaya yardımcı olur, kötü cevap riskini azaltır ve ajan geliştikçe kaliteyi korur. Bu süreç, ajan testine otomasyonlu, tekrarlanabilir bir kalite güvencesi biçimi getirir. Temsilcinin işletmenizin doğruluk ve güvenilirlik standartlarını karşıladığından emin olur ve performansının nasıl olduğunu şeffaf bir şekilde gösterir. Test sohbeti kullanılarak yapılan testlerden farklı güçlü yönlere sahiptir.
Değerlendirmeleri çalıştırabilir ve sonuçları Copilot Studio arabirimini kullanarak, Power Platform REST API'leri aracılığıyla veya Power Automate, araçlar veya akışlar içerisine eylemler ekleyerek görebilirsiniz.
Ajan değerlendirmesi, doğruluk ve performansı ölçür, yapay zeka etiği veya güvenlik sorunları değil. Bir ajan, tüm değerlendirme testlerini geçebilir ama örneğin yine de bir soruya uygunsuz bir cevap verebilir. Müşteriler sorumlu yapay zeka incelemelerini ve içerik güvenliği filtrelerini kullanmaya devam etmelidir; değerlendirmeler bu gözden geçirmelerin ve filtrelerin yerini almıyor.
Hükümet Topluluk Bulutu sınırlamaları
Hükümet Topluluk Bulutu (GCC) ortamlarında ajan değerlendirmesi aşağıdaki sınırlamalara sahiptir:
Üreticiler, test setlerine kullanıcı profili ekleyemez. Ancak, üreticiler kullanıcı profili olmadan da değerlendirmeler yapabiliyor.
Üreticiler değerlendirmeler için benzerlik testi yöntemini kullanamaz. Diğer tüm test yöntemleri mevcuttur.
Ajan değerlendirmesi nasıl çalışır
Copilot Studio, her aracı değerlendirmesi için bir test senaryosu kullanır. Test çalışması, bir kullanıcının aracınızla nasıl etkileşim kuracağını simüle eden tek bir etkileşimdir. Etkileşim tek bir soru veya konuşmanın tamamı olabilir.
Bir test vakası, temsilcinizin cevap vermesini beklediğiniz cevabı da içerebilir. Örneğin:
Soru şu: İş saatleriniz nedir?
Beklenen yanıt: Pazartesi'den Cuma'ya kadar sabah 9'dan akşam 5'e kadar açığız.
Ajan değerlendirmesini kullanarak, bir grup test vakası oluşturabilir, içe aktarabilir veya manuel olarak yazabilirsiniz . Bu test senaryosu grubu test kümesi olarak adlandırılır. Bir test seti size şunları sağlar:
Ajanınıza tek bir soru sormak yerine, aynı anda çok çeşitli yetenekleri kapsayan birden fazla test vakası çalıştırın.
Ajantınızın performansını kolaylıkla sindirilebilir bir birleştirilmiş skorla analiz edin ve ayrıca bireysel test senaryolarına odaklanın.
Ajanlarınızdaki değişiklikleri aynı test seti kullanarak test edin, böylece performans değişikliklerini ölçmek ve karşılaştırmak için nesnel bir standardınız olur.
Hızla yeni test setleri oluşturun veya mevcut olanları, değişen ajan yetenekleri veya gereksinimleri karşılayacak şekilde değiştirin.
Her test seti, ajanınızı aynı anda birden fazla test yöntemi kullanarak değerlendirebilir.
Uyarılmış kullanıcı olarak hareket etmek için bir kullanıcı profili de seçebilirsiniz. Ajan, farklı kullanıcılara farklı şekillerde yanıt verecek şekilde yapılandırılabilir veya kaynaklara farklı şekillerde erişim izni verebilir.
Bir test kümesi seçip aracı değerlendirmesini çalıştırdığınızda, Copilot Studio test çalışmalarındaki soruları gönderir, aracının yanıtlarını kaydeder, bu yanıtları beklenen yanıtlarla veya kalite standardıyla karşılaştırır ve her test çalışması için bir puan atar. Ayrıca her test vakası için detayları, tutanları ve etkinlik haritasını ve temsilcinizin yanıtı oluşturmak için kullandığı kaynakları görebilirsiniz.
Kapsamlı bir değerlendirme stratejisi oluşturma
Değerlendirmeleri çalıştırmadan önce, aracınız için başarının nasıl göründüğünü tanımlayın ve iş sonuçlarınız için en önemli senaryolara karar verin. Net bir strateji, doğru test yöntemlerini seçmenize, yüksek etkili test çalışmalarının önceliğini belirlemenize ve sonuçları doğru bağlamla yorumlamanıza yardımcı olur.
Mimari aracı çözümlerini kullanma: İş hedeflerini ölçülebilir değerlendirme boyutlarına ve puanlama yaklaşımlarına eşlemek için değerlendirme çerçeveleri.
Sürekli kalite iyileştirmelerini destekleyen tekrarlanabilir bir değerlendirme süreci oluşturmak için Ajan değerlendirmesinin tasarımını yapın ve işler hale getirin.
Değerlendirmeleri otomatik akışlarla tümleştirme
Aracı değerlendirmesi, oluşturucuların değerlendirmeleri el ile müdahale olmadan çalıştırabilmesi için otomasyonu destekler. REST API'lerini veya Power Platform bağlayıcılarını kullanarak değerlendirme çalıştırmalarını program aracılığıyla tetikleyebilir ve sürekli tümleştirme ve sürekli dağıtım (CI/CD) işlem hatları gibi otomatik iş akışlarıyla test tümleştirebilirsiniz. Bu yaklaşım, Copilot Studio'de el ile yürütmeye gerek kalmadan test kümelerini büyük ölçekte çalıştırmanızı ve değişiklikler yapılırken aracı davranışını doğrulamanızı sağlar.
Test sohbeti ve ajan değerlendirmesi
Her test yöntemi, ajanınızın özellikleri ve davranışları hakkında size farklı bilgiler sunar:
Bir soruyu birer alır ve yanıtlar. Aynı testleri birden fazla kez tekrar etmek zor.
Birden fazla mesaj içeren tam bir oturumu test etmenizi sağlar.
Bir sohbet arayüzü kullanarak kullanıcı olarak temsilcinizle etkileşim kurmanıza olanak tanır.
Ajan değerlendirmesi:
Bir test kümesi kullanarak aynı anda birden çok test çalışması oluşturabilir ve çalıştırabilirsiniz. Testleri aynı test kümesiyle test ederek tekrarlayabilirsiniz.
Test senaryosu başına bir soru ve bir yanıt veya bir konuşma test edebilirsiniz. Ancak, bu konuşmalarda, test sohbetini kullandığınız zamankinden daha az denetiminiz vardır.
Etkileşimleri kendiniz tamamlamanıza gerek kalmadan farklı kullanıcıları simüle etmek için farklı kullanıcı profilleri seçin.
Bir ajanı test ederken, hem test sohbetini hem de ajan değerlendirmesini kullanarak ajanınızın tam bir resmini elde edin.
Aracı değerlendirme sürecinde dil desteği
Copilot Studio aracıları çeşitli dilleri desteklemektedir. Aracınızı birden fazla dili destekleyecek şekilde yapılandırırsanız belirli bir değerlendirme için istediğiniz dili seçebilirsiniz.
Çok dilli aracı için aşağıdaki değerlendirme bileşenlerinin belirli davranışları vardır:
Sorgu oluşturma
Varsayılan dil, değerlendirme verilerini girmek için öncelikle kullandığınız dildir. Değerlendirmeyi çalıştırmak istediğiniz dili seçin. Daha fazla değerlendirme çalıştırdığınızda, çıktı da girdi ile aynı dilde olur.
Derecelendirici çalıştırma
Çok dilli bir aracı değerlendirirken, anlam karşılaştırma değerlendirme yöntemi, beklenen yanıt ile aracı yanıtını karşılaştırır. Birden fazla dille ilgili bir sorun ortaya çıkarsa sistem uyuşmazlığı algılar, anlam karşılaştırma notlandırıcısı yanıtı başarısız sayar ve yanıt, dil tutarsızlığı nedeniyle başarısız olarak işaretlenir.
Açıklanabilirlik çıktısı
Çok dilli bir aracı ile yapılan çok turlu görüşmelerde, aracı kendi yanıtlarında kullandığı dilde mantık yürütür.
Sınırlamalar
Şu anda aracı değerlendirmesi Fabric veri aracılarını desteklememektedir.
İlgili bilgiler
- Bir konuşma ajanı performans testi planlayın ve oluşturun
- Ajan değerlendirmesini tasarlayıp operasyonel hale getir
- Değerlendirme temelli önceliklendirme ve düzeltme kullanarak aracıları geliştirme
- Ajan çözümlerinin mimari tasarımı: Değerlendirme çerçeveleri
- Ajan çözümleri mimarisi: Yaygın değerlendirme yaklaşımları