หมายเหตุ
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลอง ลงชื่อเข้าใช้หรือเปลี่ยนไดเรกทอรีได้
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลองเปลี่ยนไดเรกทอรีได้
Note
บทความนี้อธิบายคุณสมบัติที่ใช้ในเอเจนต์หรือการไหลของเอเจนต์ที่ขับเคลื่อนโดยฮาร์เนสมาตรฐาน
เนื่องจากตัวแทน AI มีบทบาทสําคัญในกระบวนการทางธุรกิจ ความจําเป็นในการทดสอบที่เชื่อถือได้และทําซ้ําได้จึงกลายเป็นสิ่งสําคัญ การประเมินตัวแทนช่วยให้คุณ สร้างการทดสอบ ที่จําลองสถานการณ์ในโลกแห่งความเป็นจริงสําหรับตัวแทนของคุณ การทดสอบเหล่านี้ครอบคลุมคําถามและการสนทนาได้เร็วกว่าการทดสอบด้วยตนเองทีละกรณี จากนั้นคุณสามารถ วัด ความถูกต้อง ความเกี่ยวข้อง และคุณภาพของคําตอบของการโต้ตอบของตัวแทนของคุณ โดยยึดตามข้อมูลที่ตัวแทนสามารถเข้าถึงได้ เมื่อใช้ ผลลัพธ์จากชุดทดสอบ คุณสามารถปรับพฤติกรรมของตัวแทนของคุณให้เหมาะสมและตรวจสอบว่าตัวแทนของคุณตรงตามข้อกําหนดทางธุรกิจและคุณภาพของคุณ
เหตุใดจึงต้องใช้การทดสอบอัตโนมัติ
การประเมินตัวแทนให้การทดสอบแบบมีโครงสร้างอัตโนมัติ ช่วยในการจับปัญหาได้ตั้งแต่เนิ่นๆ ลดความเสี่ยงของคำตอบที่ไม่ดี และรักษาคุณภาพเมื่อตัวแทนพัฒนาขึ้น กระบวนการนี้นํารูปแบบการประกันคุณภาพอัตโนมัติที่ทําซ้ําได้มาสู่การทดสอบตัวแทน ตรวจสอบให้แน่ใจว่าตัวแทนดังกล่าวเป็นไปตามมาตรฐานความถูกต้องและความน่าเชื่อถือของธุรกิจของคุณ และให้ความโปร่งใสในการใช้งาน มีจุดแข็งที่แตกต่างจากการทดสอบโดยใช้แชททดสอบ
คุณเรียกใช้การประเมินและดูผลลัพธ์โดยใช้อินเทอร์เฟซ Copilot Studio ผ่าน Power Platform REST API หรือการดําเนินการผ่าน adding ในเครื่องมือ โฟลว์ หรือ Power Automate
การประเมินตัวแทนเสริมการทดสอบความถูกต้องและประสิทธิภาพด้วยผู้ประเมินความปลอดภัยสี่ประเภท ได้แก่ ความเกลียดชังและความไม่เป็นธรรมเนื้อหาทางเพศความรุนแรง และการทําร้ายตัวเอง ผู้ประเมินเหล่านี้ประเมินการตอบสนองของเอเจนต์สําหรับความเสี่ยงด้านความปลอดภัย AI ทั่วไป และช่วยระบุเนื้อหาที่อาจเป็นอันตราย ไม่ปลอดภัย หรือละเมิดนโยบายก่อนการนําไปใช้จริง แม้ว่าผู้ประเมินความปลอดภัยเหล่านี้จะสนับสนุนแนวทางและธรรมาภิบาลของ AI อย่างรับผิดชอบ แต่ก็ไม่ได้รับประกันว่าตัวแทนจะปลอดภัยหรือเหมาะสมกับทุกสถานการณ์ ใช้การตรวจสอบ AI อย่างรับผิดชอบและตัวกรองความปลอดภัยของเนื้อหาเป็นส่วนหนึ่งของกลยุทธ์ความปลอดภัยโดยรวมของคุณ
ข้อจํากัดของระบบคลาวด์ของชุมชนของรัฐบาล
การประเมินเอเจนต์ในสภาพแวดล้อม Government Community Cloud (GCC) มีข้อจํากัดดังต่อไปนี้:
ผู้สร้างไม่สามารถเพิ่ม โปรไฟล์ผู้ใช้ ลงในชุดทดสอบของตนได้ อย่างไรก็ตาม ผู้สร้างยังคงสามารถเรียกใช้การประเมินได้โดยไม่ต้องมีโปรไฟล์ผู้ใช้
ผู้สร้างไม่สามารถใช้ วิธีการทดสอบความคล้ายคลึงกัน สําหรับการประเมินได้ มีวิธีการทดสอบอื่นๆ ทั้งหมด
วิธีการทํางานของการประเมินเอเจนต์
Copilot Studio ใช้กรณี test สําหรับการประเมินแต่ละตัวแทน กรณีการทดสอบเป็นการโต้ตอบเดียวที่จําลองวิธีการที่ผู้ใช้จะโต้ตอบกับตัวแทนของคุณ การโต้ตอบอาจเป็นคําถามเดียวหรือการสนทนาทั้งหมด
กรณีทดสอบยังสามารถรวมคําตอบที่คุณ คาดหวัง ให้ตัวแทนตอบกลับได้ เช่น:
คําถาม: เวลาทําการของคุณคืออะไร?
การตอบที่คาดหวัง: เราเปิดให้บริการตั้งแต่เวลา 9.00 น. ถึง 17.00 น. ตั้งแต่วันจันทร์ถึงวันศุกร์
ด้วยการใช้การประเมินตัวแทน คุณสามารถ สร้างนําเข้า หรือเขียนกลุ่มกรณีทดสอบ ด้วยตนเอง ได้ กลุ่มกรณีทดสอบนี้เรียกว่า ชุดการทดสอบ ชุดทดสอบช่วยให้คุณ:
เรียกใช้กรณีทดสอบหลายกรณีที่ครอบคลุมความสามารถที่หลากหลายในคราวเดียว แทนที่จะถามคําถามทีละคําถามกับตัวแทนของคุณ
วิเคราะห์ประสิทธิภาพของเจ้าหน้าที่ของคุณด้วยคะแนนรวมที่ย่อยง่าย และซูมเข้าในกรณีทดสอบแต่ละกรณี
ทดสอบการเปลี่ยนแปลงกับเจ้าหน้าที่ของคุณโดยใช้ชุดทดสอบเดียวกัน คุณจึงมีมาตรฐานวัตถุประสงค์ในการวัดและเปรียบเทียบการเปลี่ยนแปลงในประสิทธิภาพการทํางาน
สร้างชุดทดสอบใหม่อย่างรวดเร็วหรือแก้ไขชุดทดสอบที่มีอยู่เพื่อให้ครอบคลุมความสามารถหรือข้อกําหนดของตัวแทนที่เปลี่ยนแปลงไป
ชุดทดสอบแต่ละชุดสามารถประเมินตัวแทนของคุณโดยใช้ วิธีการทดสอบหลายวิธี พร้อมกัน
นอกจากนี้คุณยังสามารถเลือกโปรไฟล์ผู้ใช้เพื่อทําหน้าที่เป็นผู้ใช้ที่กระตุ้นได้ เอเจนต์อาจได้รับการกําหนดค่าให้ตอบสนองต่อผู้ใช้ที่แตกต่างกันในรูปแบบต่างๆ หรืออนุญาตให้เข้าถึงทรัพยากรด้วยวิธีต่างๆ
เมื่อคุณเลือกชุดการทดสอบและ เรียกใช้การประเมินผลตัวแทน , Copilot Studio ส่งคําถามในกรณีการทดสอบ บันทึกการตอบสนองของตัวแทน เปรียบเทียบคําตอบเหล่านั้นกับการตอบสนองที่คาดไว้หรือมาตรฐานคุณภาพ และกําหนดคะแนนให้กับแต่ละกรณีการทดสอบ คุณยังสามารถดูรายละเอียด การถอดเสียง และแผนผังกิจกรรมสําหรับแต่ละกรณีทดสอบ และทรัพยากรที่ตัวแทนของคุณใช้ในการสร้างการตอบกลับ
สร้างกลยุทธ์การประเมินผลที่ครอบคลุม
ก่อนที่คุณจะเรียกใช้การประเมิน ให้กําหนดว่าความสําเร็จสําหรับตัวแทนของคุณเป็นอย่างไร และตัดสินใจว่าสถานการณ์ใดที่สําคัญที่สุดกับผลลัพธ์ทางธุรกิจของคุณ กลยุทธ์ที่ชัดเจนช่วยให้คุณสามารถเลือกวิธีการทดสอบที่เหมาะสม จัดลําดับความสําคัญของกรณีการทดสอบผลกระทบสูง และตีความผลลัพธ์ด้วยบริบทที่เหมาะสม
ใช้ โซลูชันตัวแทนสถาปนิก: เฟรมเวิร์กการประเมิน เพื่อแมปเป้าหมายทางธุรกิจเพื่อวัดมิติการประเมินผลและวิธีการให้คะแนน
ใช้ การออกแบบและดำเนินการประเมินตัวแทน เพื่อสร้างกระบวนการประเมินที่สามารถทำซ้ำได้ซึ่งสนับสนุนการปรับปรุงคุณภาพอย่างต่อเนื่อง
รวมการประเมินลงในโฟลว์อัตโนมัติ
การประเมินผลเจ้าหน้าที่สนับสนุนระบบอัตโนมัติ เพื่อให้ผู้สร้างสามารถเรียกใช้การประเมินผลได้โดยไม่ต้องดําเนินการเอง ด้วยการใช้ ตัวเชื่อมต่อ REST API หรือ Power Platform คุณสามารถเรียกใช้การประเมินผลโดยทางโปรแกรมและรวมการทดสอบลงในเวิร์กโฟลว์อัตโนมัติเช่น การผสานรวมอย่างต่อเนื่อง และไปป์ไลน์การปรับใช้ (CI/CD) แบบต่อเนื่อง วิธีนี้ช่วยให้คุณสามารถเรียกใช้ชุดการทดสอบในระดับมาตราส่วนและตรวจสอบลักษณะการทํางานของตัวแทนตามที่จะนําการเปลี่ยนแปลงมาใช้โดยไม่จําเป็นต้องดําเนินการด้วยตนเองใน Copilot Studio
ทดสอบการแชทกับการประเมินตัวแทน
การทดสอบแต่ละวิธีจะให้ข้อมูลเชิงลึกที่แตกต่างกันเกี่ยวกับคุณสมบัติและพฤติกรรมของตัวแทนของคุณ:
รับและตอบคําถามทีละข้อ เป็นการยากที่จะทําการทดสอบเดิมซ้ําหลายครั้ง
ให้คุณทดสอบเซสชันเต็มที่มีหลายข้อความ
ช่วยให้คุณสามารถโต้ตอบกับตัวแทนของคุณในฐานะผู้ใช้โดยใช้อินเทอร์เฟซการแชท
การประเมินตัวแทน:
สามารถสร้างและเรียกใช้กรณีการทดสอบหลายรายการพร้อมกันโดยใช้ชุดการทดสอบ คุณสามารถทําซ้ําการทดสอบโดยการทดสอบด้วยชุดการทดสอบเดียวกัน
สามารถทดสอบคําถามหนึ่งข้อและหนึ่งคําตอบต่อกรณีการทดสอบหรือการสนทนาหนึ่งครั้งต่อกรณีการทดสอบ อย่างไรก็ตาม คุณสามารถควบคุมการสนทนาได้น้อยกว่าเมื่อใช้แชททดสอบ
เลือกโปรไฟล์ผู้ใช้ที่แตกต่างกันเพื่อจําลองผู้ใช้ที่แตกต่างกันโดยไม่จําเป็นต้องทําการโต้ตอบด้วยตัวเอง
เมื่อคุณทดสอบตัวแทน ให้ใช้ทั้งการแชททดสอบและการประเมินตัวแทนเพื่อให้เห็นภาพรวมของตัวแทนของคุณ
การรองรับภาษาในการประเมินเอเจนต์
เอเจนต์ Copilot Studio สามารถรองรับได้หลากหลายภาษา หากคุณตั้งค่าเอเจนต์ของคุณให้รองรับหลายภาษา คุณสามารถเลือกภาษาที่ต้องการสำหรับแต่ละการประเมินตามต้องการ
สำหรับเอเจนต์หลายภาษา ส่วนประกอบการประเมินต่อไปนี้มีลักษณะการทำงานเฉพาะ:
การสร้างการสอบถาม
ภาษาเริ่มต้นคือภาษาที่คุณใช้เป็นหลักเมื่อป้อนข้อมูลการประเมิน เลือกภาษาที่คุณต้องการสำหรับการประเมิน เมื่อคุณเรียกใช้การประเมินเพิ่มเติม ผลลัพธ์จะเป็นภาษาเดียวกับอินพุต
การดำเนินการของตัวให้คะแนน
เมื่อคุณประเมินเอเจนต์หลายภาษา วิธีการประเมินแบบ เปรียบเทียบความหมาย จะเปรียบเทียบการตอบที่คาดหวังกับการตอบของเอเจนต์ หากเกิดปัญหาที่เกี่ยวข้องกับหลายภาษา ระบบจะตรวจพบความไม่ตรงกัน ตัวให้คะแนน เปรียบเทียบความหมายจะไม่ผ่านการตอบ และการตอบจะถูกทำเครื่องหมายว่าล้มเหลวเนื่องจากความไม่สอดคล้องกันของภาษา
เอาต์พุตที่อธิบายได้
ในการสนทนาแบบหลายรอบกับเอเจนต์หลายภาษา เอเจนต์จะให้เหตุผลในภาษาเดียวกับที่ใช้ในการตอบ
Limitations
ปัจจุบัน การประเมินเอเจนต์ไม่รองรับ เอเจนต์ข้อมูล Fabric