Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Note
Fitur dalam artikel ini didukung oleh harness standar yang menggunakan opsi penagihan yang dijelaskan dalam Lisensi untuk agen yang didukung oleh harness standar. Pelajari cara mengakses fitur standar di agen standar Access dan alur agen.
Evaluasi percakapan memungkinkan Anda menilai perilaku umum agen Anda selama interaksi yang lebih lama. Ini mencerminkan bagaimana pengguna nyata berinteraksi dengan agen, di mana setiap respons bergantung pada konteks sebelumnya dalam percakapan yang sedang berlangsung. Anda dapat menggunakan evaluasi ini untuk menentukan apakah agen dapat mempertahankan konteks, meminta klarifikasi, dan menyelesaikan tugas multi-langkah.
Anda juga dapat menjalankan evaluasi respons tunggal, yang baik ketika Anda ingin menguji agen Anda tentang bagaimana ia menjawab pertanyaan tertentu, pada kemampuan apa yang dipanggilnya, dan pada kata yang tepat yang digunakannya dalam jawabannya.
Evaluasi menggunakan kelompok uji. Set pengujian untuk evaluasi percakapan terdiri dari sekelompok hingga 20 kasus pengujian. Saat menjalankan evaluasi agen, Anda memilih set pengujian dan Copilot Studio menjalankan setiap kasus pengujian di dalam set tersebut terhadap agen Anda.
Anda dapat membuat kasus pengujian dalam set pengujian dengan mengimpornya dengan menggunakan spreadsheet atau menggunakan AI untuk menghasilkan pesan berdasarkan desain dan sumber daya agen Anda. Anda kemudian dapat memilih bagaimana Anda ingin mengukur kualitas respons agen Anda untuk setiap kasus pengujian dalam set pengujian.
Untuk informasi selengkapnya tentang cara kerja evaluasi agen, lihat Tentang evaluasi agen.
Untuk mempelajari cara mengedit set pengujian yang ada, lihat Mengubah detail set pengujian.
Important
Hasil pengujian tersedia di Copilot Studio selama 89 hari. Untuk menyimpan hasil pengujian untuk jangka waktu yang lebih lama, ekspor hasilnya ke file CSV.
Membuat kumpulan pengujian percakapan
Pergi ke halaman Evaluasi agen Anda.
Pilih Evaluasi baru, lalu pilih Percakapan.
Anda dapat membuat kasus pengujian multi-giliran menggunakan salah satu metode berikut:
Kumpulan percakapan cepat: Secara otomatis menghasilkan 10 percakapan singkat berdasarkan deskripsi, instruksi, dan kemampuan agen Anda.
Kumpulan percakapan lengkap: Hasilkan percakapan menggunakan pengetahuan agen Anda atau topik yang ditentukan. Dalam opsi ini Anda dapat memilih membuat percakapan pendek atau panjang.
Gunakan obrolan pengujian Anda: Konversikan obrolan pengujian terbaru menjadi kasus pengujian.
Note
Set pengujian percakapan mendukung hingga 20 kasus pengujian. Setiap kasus pengujian mendukung hingga 12 total pesan, yaitu 6 pasang pertanyaan dan jawaban.
Di bawah Nama, ketik nama untuk set pengujian Anda.
Ubah atau tambahkan metode pengujian yang ingin Anda gunakan. Untuk test set percakapan, Anda dapat menambahkan metode pengujian Kualitas umum, Pencocokan kata kunci, Penggunaan alat atau Kustom.
- Tambahkan metode baru:
- Pilih Tambahkan metode pengujian.
- Pilih semua metode yang ingin Anda uji, lalu pilih OK. Anda dapat menambahkan beberapa metode.
- Untuk beberapa metode, atur skor lulus, lalu pilih OK. Skor lulus menentukan berapa skor yang diperlukan untuk lulus atau gagal.
- Beberapa metode memerlukan penambahan respons atau kata kunci yang diharapkan untuk setiap kasus pengujian Anda. Untuk informasi selengkapnya, lihat Memilih metode evaluasi.
- Pilih metode pengujian yang ada untuk diedit atau dihapus.
Metode pengujian Tindakan Jenis set pengujian Penilaian Konfigurasi Kualitas umum Seberapa baik respons dari suatu kasus pengujian berdasarkan kriteria kualitas tertentu. Tanggapan atau percakapan tunggal Dinilai dari 100% None Bandingkan makna Seberapa baik arti jawaban kasus uji sesuai dengan jawaban yang diharapkan Respons tunggal Dinilai dari 100% Skor lulus, jawaban yang diharapkan Penggunaan alat Apakah kasus pengujian menggunakan semua atau sebagian dari sumber daya yang diharapkan Respons tunggal Lulus/gagal Kemampuan yang diharapkan Pencocokan kata kunci Apakah kasus pengujian menggunakan semua atau salah satu kata kunci atau frasa yang diharapkan Tanggapan atau percakapan tunggal Lulus/gagal Kata kunci atau frasa yang diharapkan Kesamaan teks Seberapa baik teks jawaban kasus uji cocok dengan jawaban yang diharapkan Respons tunggal Dinilai dari 100% Skor lulus, jawaban yang diharapkan Kecocokan persis Apakah jawaban kasus uji sama persis dengan jawaban yang diharapkan Respons tunggal Lulus/gagal Jawaban yang diharapkan Custom Apakah respons kasus pengujian memenuhi kriteria atau ekspektasi yang Anda tentukan. Tanggapan atau percakapan tunggal Lulus/gagal (melewati kriteria label yang ditentukan) Nama, instruksi evaluasi, label - Tambahkan metode baru:
Edit detail kasus pengujian. Semua metode pengujian, kecuali kualitas umum, memerlukan respons atau kata kunci yang diharapkan. Untuk informasi selengkapnya tentang mengedit kasus pengujian, lihat Mengubah set pengujian.
Pilih Profil pengguna, lalu pilih atau tambahkan akun yang ingin Anda gunakan untuk set pengujian ini, atau lanjutkan tanpa autentikasi. Evaluasi menggunakan akun ini untuk terhubung ke sumber pengetahuan dan alat selama pengujian. Untuk informasi tentang menambahkan dan mengelola profil pengguna, lihat Mengelola profil dan koneksi pengguna.
Note
Pengujian otomatis menggunakan autentikasi akun pengujian yang dipilih. Jika agen Anda memiliki sumber pengetahuan atau koneksi yang memerlukan autentikasi tertentu, pilih akun yang sesuai untuk pengujian Anda.
Edit atau buat lebih banyak kasus pengujian. Pelajari lebih dalam di Mengedit kasus uji dalam serangkaian pengujian.
Pilih Simpan untuk memperbarui set pengujian tanpa menjalankan kasus pengujian atau Evaluasi untuk segera menjalankan set pengujian.