Tentang evaluasi agen

Note

Fitur dalam artikel ini menggunakan harness standar, yang menggunakan opsi penagihan yang dijelaskan dalam Lisensi untuk agen yang menggunakan harness standar. Pelajari cara mengakses fitur standar di agen standar Access dan alur agen.

Karena agen AI mengambil peran penting dalam proses bisnis, kebutuhan akan pengujian yang andal dan dapat diulang menjadi penting. Evaluasi agen memungkinkan Anda membuat pengujian yang mensimulasikan skenario dunia nyata untuk agen Anda. Pengujian ini mencakup lebih banyak pertanyaan dan percakapan lebih cepat daripada pengujian manual per kasus. Kemudian, Anda dapat mengukur akurasi, relevansi, dan kualitas jawaban interaksi agen Anda, berdasarkan informasi yang dapat diakses agen. Dengan menggunakan hasil dari set pengujian, Anda dapat mengoptimalkan perilaku agen dan memvalidasi bahwa agen Anda memenuhi persyaratan bisnis dan kualitas Anda.

Mengapa menggunakan pengujian otomatis?

Evaluasi agen menyediakan pengujian terstruktur otomatis. Ini membantu menangkap masalah sejak dini, mengurangi risiko jawaban yang buruk, dan menjaga kualitas seiring berkembangnya agen. Proses ini menghadirkan bentuk jaminan kualitas yang otomatis dan dapat diulang untuk pengujian agen. Ini memastikan agen memenuhi standar akurasi dan keandalan bisnis Anda dan memberikan transparansi tentang performanya. Ini memiliki kekuatan yang berbeda dari pengujian menggunakan obrolan uji.

Anda menjalankan evaluasi dan melihat hasil menggunakan antarmuka Copilot Studio, melalui Power Platform REST APIs, atau melalui menambahkan tindakan dalam alat, aliran, atau Power Automate.

Evaluasi agen mengukur kebenaran dan kinerja, bukan etika AI atau masalah keselamatan. Seorang agen mungkin lulus semua tes evaluasi tetapi masih, misalnya, menghasilkan jawaban yang tidak tepat untuk sebuah pertanyaan. Pelanggan masih harus menggunakan ulasan AI yang bertanggung jawab dan filter keamanan konten; evaluasi tidak menggantikan ulasan dan filter tersebut.

Batasan Cloud Komunitas Pemerintah

Evaluasi agen di lingkungan Government Community Cloud (GCC) memiliki batasan berikut:

  • Pembuat tidak dapat menambahkan profil pengguna ke set pengujian mereka. Namun, pembuat masih dapat menjalankan evaluasi tanpa profil pengguna.

  • Pembuat tidak dapat menggunakan metode uji kesamaan untuk evaluasi. Semua metode pengujian lainnya tersedia.

Evaluasi Agen: Cara Kerjanya

Copilot Studio menggunakan kasus uji untuk setiap evaluasi agen. Kasus pengujian adalah satu interaksi yang mensimulasikan bagaimana pengguna akan berinteraksi dengan agen Anda. Interaksi dapat berupa satu pertanyaan atau seluruh percakapan.

Kasus uji juga dapat mencakup jawaban yang Anda harapkan untuk dijawab oleh agen Anda. Contohnya:

  • Pertanyaannya: Berapa jam kerja Anda?

  • Respons yang diharapkan: Kami buka dari pukul 9 pagi hingga 5 sore dari Senin sampai Jumat.

Dengan menggunakan evaluasi agen, Anda dapat menghasilkan, mengimpor, atau menulis sekelompok kasus pengujian secara manual . Kelompok kasus pengujian ini dinamakan test set. Set pengujian memungkinkan Anda untuk:

  • Jalankan beberapa kasus pengujian yang mencakup berbagai kemampuan sekaligus, alih-alih mengajukan satu pertanyaan kepada agen Anda pada satu waktu.

  • Menganalisis kinerja agen Anda dengan skor agregat yang mudah dipahami dan juga fokus pada kasus pengujian individual.

  • Menguji perubahan pada agen Anda dengan menggunakan set pengujian yang sama, sehingga Anda memiliki standar objektif untuk mengukur dan membandingkan perubahan performa.

  • Buat set pengujian baru dengan cepat atau modifikasi yang sudah ada untuk mencakup perubahan kemampuan atau persyaratan agen.

Setiap set pengujian dapat mengevaluasi agen Anda menggunakan beberapa metode pengujian sekaligus.

Anda juga dapat memilih profil pengguna untuk bertindak sebagai pengguna yang dirangsang. Agen mungkin dikonfigurasi untuk merespons pengguna yang berbeda dengan cara yang berbeda, atau mengizinkan akses ke sumber daya dengan cara yang berbeda.

Saat Anda memilih set pengujian dan menjalankan evaluasi agen, Copilot Studio mengirimkan pertanyaan dalam kasus pengujian, merekam respons agen, membandingkan respons tersebut dengan respons yang diharapkan atau standar kualitas, dan menetapkan skor untuk setiap kasus pengujian. Anda juga dapat melihat detail, transkrip, dan peta aktivitas untuk setiap kasus pengujian dan sumber daya mana yang digunakan agen Anda untuk membuat respons.

Membuat strategi evaluasi yang komprehensif

Sebelum Anda menjalankan evaluasi, tentukan seperti apa kesuksesan untuk agen Anda dan putuskan skenario mana yang paling penting bagi hasil bisnis Anda. Strategi yang jelas membantu Anda memilih metode pengujian yang tepat, memprioritaskan kasus pengujian berdampak tinggi, dan menafsirkan hasil dengan konteks yang tepat.

Mengintegrasikan evaluasi ke dalam alur otomatis

Evaluasi agen mendukung otomatisasi sehingga pembuat dapat menjalankan evaluasi tanpa intervensi manual. Dengan menggunakan REST API atau konektor Power Platform, Anda dapat secara terprogram memicu evaluasi berjalan dan mengintegrasikan pengujian ke dalam alur kerja otomatis seperti integrasi berkelanjutan dan alur penyebaran berkelanjutan (CI/CD). Pendekatan ini memungkinkan Anda menjalankan set pengujian dalam skala besar dan memvalidasi perilaku agen saat perubahan diperkenalkan, tanpa memerlukan eksekusi manual dalam Copilot Studio.

Menguji evaluasi obrolan versus agen

Setiap metode pengujian memberi Anda wawasan yang berbeda tentang kualitas dan perilaku agen Anda:

Obrolan uji coba:

  • Menerima dan menanggapi satu pertanyaan pada satu waktu. Sulit untuk mengulangi tes yang sama beberapa kali.

  • Memungkinkan Anda menguji sesi penuh yang berisi beberapa pesan.

  • Memungkinkan Anda untuk berinteraksi dengan agen Anda sebagai pengguna dengan menggunakan antarmuka obrolan.

Evaluasi agen:

  • Dapat membuat dan menjalankan beberapa kasus pengujian sekaligus dengan menggunakan set pengujian. Anda dapat mengulangi pengujian dengan menguji dengan set pengujian yang sama.

  • Dapat menguji satu pertanyaan dan satu respons per kasus pengujian, atau satu percakapan per kasus pengujian. Namun, Anda memiliki kontrol yang lebih sedikit atas percakapan dibandingkan saat menggunakan obrolan pengujian.

  • Pilih profil pengguna yang berbeda untuk mensimulasikan pengguna yang berbeda tanpa perlu menyelesaikan interaksi sendiri.

Saat Anda menguji agen, gunakan chat pengujian dan evaluasi agen untuk gambaran lengkap tentang agen Anda.

Dukungan bahasa dalam evaluasi agen

Agen Copilot Studio mendukung berbagai bahasa. Jika Anda mengonfigurasi agen Anda untuk mendukung lebih dari satu bahasa, Anda dapat memilih bahasa yang diinginkan untuk setiap evaluasi.

Untuk agen multibahasa, komponen evaluasi berikut memiliki perilaku tertentu:

Pembuatan kueri

Bahasa default adalah bahasa yang biasa Anda gunakan saat memasukkan input evaluasi. Pilih bahasa yang ingin Anda gunakan untuk menjalankan evaluasi. Saat Anda menjalankan lebih banyak evaluasi, hasilnya akan menggunakan bahasa yang sama dengan masukan.

Eksekusi penilai

Ketika Anda mengevaluasi agen multibahasa, metode evaluasi perbandingan makna membandingkan respons yang diharapkan dengan respons agen. Jika masalah yang terkait dengan beberapa bahasa muncul, sistem mendeteksi ketidakcocokan, penilai perbandingan makna gagal dalam respons, dan respons ditandai gagal karena inkonsistensi bahasa.

Keluaran penjelasan

Dalam percakapan multi-giliran dengan agen multibahasa, agen memberikan penalaran dalam bahasa yang sama dengan yang digunakan dalam responsnya.

Keterbatasan

Saat ini, evaluasi agen tidak mendukung agen data Fabric.