เกี่ยวกับการประเมินตัวแทน

Note

บทความนี้อธิบายคุณสมบัติที่ใช้ในเอเจนต์หรือการไหลของเอเจนต์ที่ขับเคลื่อนโดยฮาร์เนสมาตรฐาน

เนื่องจากตัวแทน AI มีบทบาทสําคัญในกระบวนการทางธุรกิจ ความจําเป็นในการทดสอบที่เชื่อถือได้และทําซ้ําได้จึงกลายเป็นสิ่งสําคัญ การประเมินตัวแทนช่วยให้คุณ สร้างการทดสอบ ที่จําลองสถานการณ์ในโลกแห่งความเป็นจริงสําหรับตัวแทนของคุณ การทดสอบเหล่านี้ครอบคลุมคําถามและการสนทนาได้เร็วกว่าการทดสอบด้วยตนเองทีละกรณี จากนั้นคุณสามารถ วัด ความถูกต้อง ความเกี่ยวข้อง และคุณภาพของคําตอบของการโต้ตอบของตัวแทนของคุณ โดยยึดตามข้อมูลที่ตัวแทนสามารถเข้าถึงได้ เมื่อใช้ ผลลัพธ์จากชุดทดสอบ คุณสามารถปรับพฤติกรรมของตัวแทนของคุณให้เหมาะสมและตรวจสอบว่าตัวแทนของคุณตรงตามข้อกําหนดทางธุรกิจและคุณภาพของคุณ

เหตุใดจึงต้องใช้การทดสอบอัตโนมัติ

การประเมินตัวแทนให้การทดสอบแบบมีโครงสร้างอัตโนมัติ ช่วยในการจับปัญหาได้ตั้งแต่เนิ่นๆ ลดความเสี่ยงของคำตอบที่ไม่ดี และรักษาคุณภาพเมื่อตัวแทนพัฒนาขึ้น กระบวนการนี้นํารูปแบบการประกันคุณภาพอัตโนมัติที่ทําซ้ําได้มาสู่การทดสอบตัวแทน ตรวจสอบให้แน่ใจว่าตัวแทนดังกล่าวเป็นไปตามมาตรฐานความถูกต้องและความน่าเชื่อถือของธุรกิจของคุณ และให้ความโปร่งใสในการใช้งาน มีจุดแข็งที่แตกต่างจากการทดสอบโดยใช้แชททดสอบ

คุณเรียกใช้การประเมินและดูผลลัพธ์โดยใช้อินเทอร์เฟซ Copilot Studio ผ่าน Power Platform REST API หรือการดําเนินการผ่าน adding ในเครื่องมือ โฟลว์ หรือ Power Automate

การประเมินตัวแทนเสริมการทดสอบความถูกต้องและประสิทธิภาพด้วยผู้ประเมินความปลอดภัยสี่ประเภท ได้แก่ ความเกลียดชังและความไม่เป็นธรรมเนื้อหาทางเพศความรุนแรง และการทําร้ายตัวเอง ผู้ประเมินเหล่านี้ประเมินการตอบสนองของเอเจนต์สําหรับความเสี่ยงด้านความปลอดภัย AI ทั่วไป และช่วยระบุเนื้อหาที่อาจเป็นอันตราย ไม่ปลอดภัย หรือละเมิดนโยบายก่อนการนําไปใช้จริง แม้ว่าผู้ประเมินความปลอดภัยเหล่านี้จะสนับสนุนแนวทางและธรรมาภิบาลของ AI อย่างรับผิดชอบ แต่ก็ไม่ได้รับประกันว่าตัวแทนจะปลอดภัยหรือเหมาะสมกับทุกสถานการณ์ ใช้การตรวจสอบ AI อย่างรับผิดชอบและตัวกรองความปลอดภัยของเนื้อหาเป็นส่วนหนึ่งของกลยุทธ์ความปลอดภัยโดยรวมของคุณ

ข้อจํากัดของระบบคลาวด์ของชุมชนของรัฐบาล

การประเมินเอเจนต์ในสภาพแวดล้อม Government Community Cloud (GCC) มีข้อจํากัดดังต่อไปนี้:

  • ผู้สร้างไม่สามารถเพิ่ม โปรไฟล์ผู้ใช้ ลงในชุดทดสอบของตนได้ อย่างไรก็ตาม ผู้สร้างยังคงสามารถเรียกใช้การประเมินได้โดยไม่ต้องมีโปรไฟล์ผู้ใช้

  • ผู้สร้างไม่สามารถใช้ วิธีการทดสอบความคล้ายคลึงกัน สําหรับการประเมินได้ มีวิธีการทดสอบอื่นๆ ทั้งหมด

วิธีการทํางานของการประเมินเอเจนต์

Copilot Studio ใช้กรณี test สําหรับการประเมินแต่ละตัวแทน กรณีการทดสอบเป็นการโต้ตอบเดียวที่จําลองวิธีการที่ผู้ใช้จะโต้ตอบกับตัวแทนของคุณ การโต้ตอบอาจเป็นคําถามเดียวหรือการสนทนาทั้งหมด

กรณีทดสอบยังสามารถรวมคําตอบที่คุณ คาดหวัง ให้ตัวแทนตอบกลับได้ เช่น:

  • คําถาม: เวลาทําการของคุณคืออะไร?

  • การตอบที่คาดหวัง: เราเปิดให้บริการตั้งแต่เวลา 9.00 น. ถึง 17.00 น. ตั้งแต่วันจันทร์ถึงวันศุกร์

ด้วยการใช้การประเมินตัวแทน คุณสามารถ สร้างนําเข้า หรือเขียนกลุ่มกรณีทดสอบ ด้วยตนเอง ได้ กลุ่มกรณีทดสอบนี้เรียกว่า ชุดการทดสอบ ชุดทดสอบช่วยให้คุณ:

  • เรียกใช้กรณีทดสอบหลายกรณีที่ครอบคลุมความสามารถที่หลากหลายในคราวเดียว แทนที่จะถามคําถามทีละคําถามกับตัวแทนของคุณ

  • วิเคราะห์ประสิทธิภาพของเจ้าหน้าที่ของคุณด้วยคะแนนรวมที่ย่อยง่าย และซูมเข้าในกรณีทดสอบแต่ละกรณี

  • ทดสอบการเปลี่ยนแปลงกับเจ้าหน้าที่ของคุณโดยใช้ชุดทดสอบเดียวกัน คุณจึงมีมาตรฐานวัตถุประสงค์ในการวัดและเปรียบเทียบการเปลี่ยนแปลงในประสิทธิภาพการทํางาน

  • สร้างชุดทดสอบใหม่อย่างรวดเร็วหรือแก้ไขชุดทดสอบที่มีอยู่เพื่อให้ครอบคลุมความสามารถหรือข้อกําหนดของตัวแทนที่เปลี่ยนแปลงไป

ชุดทดสอบแต่ละชุดสามารถประเมินตัวแทนของคุณโดยใช้ วิธีการทดสอบหลายวิธี พร้อมกัน

นอกจากนี้คุณยังสามารถเลือกโปรไฟล์ผู้ใช้เพื่อทําหน้าที่เป็นผู้ใช้ที่กระตุ้นได้ เอเจนต์อาจได้รับการกําหนดค่าให้ตอบสนองต่อผู้ใช้ที่แตกต่างกันในรูปแบบต่างๆ หรืออนุญาตให้เข้าถึงทรัพยากรด้วยวิธีต่างๆ

เมื่อคุณเลือกชุดการทดสอบและ เรียกใช้การประเมินผลตัวแทน , Copilot Studio ส่งคําถามในกรณีการทดสอบ บันทึกการตอบสนองของตัวแทน เปรียบเทียบคําตอบเหล่านั้นกับการตอบสนองที่คาดไว้หรือมาตรฐานคุณภาพ และกําหนดคะแนนให้กับแต่ละกรณีการทดสอบ คุณยังสามารถดูรายละเอียด การถอดเสียง และแผนผังกิจกรรมสําหรับแต่ละกรณีทดสอบ และทรัพยากรที่ตัวแทนของคุณใช้ในการสร้างการตอบกลับ

สร้างกลยุทธ์การประเมินผลที่ครอบคลุม

ก่อนที่คุณจะเรียกใช้การประเมิน ให้กําหนดว่าความสําเร็จสําหรับตัวแทนของคุณเป็นอย่างไร และตัดสินใจว่าสถานการณ์ใดที่สําคัญที่สุดกับผลลัพธ์ทางธุรกิจของคุณ กลยุทธ์ที่ชัดเจนช่วยให้คุณสามารถเลือกวิธีการทดสอบที่เหมาะสม จัดลําดับความสําคัญของกรณีการทดสอบผลกระทบสูง และตีความผลลัพธ์ด้วยบริบทที่เหมาะสม

รวมการประเมินลงในโฟลว์อัตโนมัติ

การประเมินผลเจ้าหน้าที่สนับสนุนระบบอัตโนมัติ เพื่อให้ผู้สร้างสามารถเรียกใช้การประเมินผลได้โดยไม่ต้องดําเนินการเอง ด้วยการใช้ ตัวเชื่อมต่อ REST API หรือ Power Platform คุณสามารถเรียกใช้การประเมินผลโดยทางโปรแกรมและรวมการทดสอบลงในเวิร์กโฟลว์อัตโนมัติเช่น การผสานรวมอย่างต่อเนื่อง และไปป์ไลน์การปรับใช้ (CI/CD) แบบต่อเนื่อง วิธีนี้ช่วยให้คุณสามารถเรียกใช้ชุดการทดสอบในระดับมาตราส่วนและตรวจสอบลักษณะการทํางานของตัวแทนตามที่จะนําการเปลี่ยนแปลงมาใช้โดยไม่จําเป็นต้องดําเนินการด้วยตนเองใน Copilot Studio

ทดสอบการแชทกับการประเมินตัวแทน

การทดสอบแต่ละวิธีจะให้ข้อมูลเชิงลึกที่แตกต่างกันเกี่ยวกับคุณสมบัติและพฤติกรรมของตัวแทนของคุณ:

ทดสอบแชท:

  • รับและตอบคําถามทีละข้อ เป็นการยากที่จะทําการทดสอบเดิมซ้ําหลายครั้ง

  • ให้คุณทดสอบเซสชันเต็มที่มีหลายข้อความ

  • ช่วยให้คุณสามารถโต้ตอบกับตัวแทนของคุณในฐานะผู้ใช้โดยใช้อินเทอร์เฟซการแชท

การประเมินตัวแทน:

  • สามารถสร้างและเรียกใช้กรณีการทดสอบหลายรายการพร้อมกันโดยใช้ชุดการทดสอบ คุณสามารถทําซ้ําการทดสอบโดยการทดสอบด้วยชุดการทดสอบเดียวกัน

  • สามารถทดสอบคําถามหนึ่งข้อและหนึ่งคําตอบต่อกรณีการทดสอบหรือการสนทนาหนึ่งครั้งต่อกรณีการทดสอบ อย่างไรก็ตาม คุณสามารถควบคุมการสนทนาได้น้อยกว่าเมื่อใช้แชททดสอบ

  • เลือกโปรไฟล์ผู้ใช้ที่แตกต่างกันเพื่อจําลองผู้ใช้ที่แตกต่างกันโดยไม่จําเป็นต้องทําการโต้ตอบด้วยตัวเอง

เมื่อคุณทดสอบตัวแทน ให้ใช้ทั้งการแชททดสอบและการประเมินตัวแทนเพื่อให้เห็นภาพรวมของตัวแทนของคุณ

การรองรับภาษาในการประเมินเอเจนต์

เอเจนต์ Copilot Studio สามารถรองรับได้หลากหลายภาษา หากคุณตั้งค่าเอเจนต์ของคุณให้รองรับหลายภาษา คุณสามารถเลือกภาษาที่ต้องการสำหรับแต่ละการประเมินตามต้องการ

สำหรับเอเจนต์หลายภาษา ส่วนประกอบการประเมินต่อไปนี้มีลักษณะการทำงานเฉพาะ:

การสร้างการสอบถาม

ภาษาเริ่มต้นคือภาษาที่คุณใช้เป็นหลักเมื่อป้อนข้อมูลการประเมิน เลือกภาษาที่คุณต้องการสำหรับการประเมิน เมื่อคุณเรียกใช้การประเมินเพิ่มเติม ผลลัพธ์จะเป็นภาษาเดียวกับอินพุต

การดำเนินการของตัวให้คะแนน

เมื่อคุณประเมินเอเจนต์หลายภาษา วิธีการประเมินแบบ เปรียบเทียบความหมาย จะเปรียบเทียบการตอบที่คาดหวังกับการตอบของเอเจนต์ หากเกิดปัญหาที่เกี่ยวข้องกับหลายภาษา ระบบจะตรวจพบความไม่ตรงกัน ตัวให้คะแนน เปรียบเทียบความหมายจะไม่ผ่านการตอบ และการตอบจะถูกทำเครื่องหมายว่าล้มเหลวเนื่องจากความไม่สอดคล้องกันของภาษา

เอาต์พุตที่อธิบายได้

ในการสนทนาแบบหลายรอบกับเอเจนต์หลายภาษา เอเจนต์จะให้เหตุผลในภาษาเดียวกับที่ใช้ในการตอบ

Limitations

ปัจจุบัน การประเมินเอเจนต์ไม่รองรับ เอเจนต์ข้อมูล Fabric