Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Оценка агента должна быть итеративным процессом, начинающимся с фазы визуализации и проектирования агента и продолжающим через развертывание агентов и регрессионное обнаружение. Этот шаблон содержит необходимые элементы для построения тестовых наборов для оценки и способ реализации и прохождения четырёхэтапной структуры на протяжении всего жизненного цикла агента.
- Этап 1: Создание базовых тестовых наборов
- Этап 2: Установите базовый уровень и улучшайте
- Этап 3: Реализация систематического расширения
- Этап 4: Создание непрерывной операции оценки качества
Tip
Скачайте редактируемый шаблон чек-листа.
Этап 1: Создание базовых тестовых наборов
Цель: создать и запустить базовый тестовый набор оценки, который оценивает основные сценарии агента.
Оценочный набор тестов — это группа тестовых примеров. Тестовый случай — это индивидуальная пара «подсказка и ответ» для оценки ответа агента на конкретный вопрос. Он включает тестовый запрос и необязательный ожидаемый ответ (утверждение), напрямую отражающий требования, заданные в инструкции агента. Тестовый случай также должен указывать критерии приема и метод тестирования для оценки качества.
| Сценарий агента 1 | Тестовое задание (Пример запроса для агента) |
Ожидаемый ответ | Критерии приема2 (Определите, как выглядит успешный ответ: что проходит, а что нет) |
|---|---|---|---|
| Агент должен отвечать на вопросы о политике на основе статьи базы знаний о политике. | «Сколько дней больничных получает сотрудник?» | «30 дней. <цитата>» | Ответ должен содержать точный текст из базы знаний политики и полностью ему соответствовать. Ответ должен содержать ссылку. |
| Агент не должен отвечать на вопросы, выходящие за рамки статьи о политике. Прямые ответы от службы поддержки персонала. | «Сколько дней больничных получает сотрудник?» | «В документе политики не указаны дни больничных. Проконсультируйтесь с отделом кадров по поводу вашей политики больничных.» | Ответ на запрещенный случай должен перенаправлять пользователя в службу поддержки персонала. |
Tip
1Сценарий агента: Базовый тестовый набор должен включать тестовые случаи, охватывающие ключевые сценарии или сценарии использования агента. Используйте ситуацию с агентом как ориентир и сосредоточьтесь на том, что агент должен решать или избегать. Этот процесс помогает составить целевой список тестовых запросов и должен тесно координироваться с разработкой инструкций агента. Чтобы определить правильное количество тестовых случаев, начните с одного тестового запроса для каждого ключевого сценария. Начните с небольшого набора тестовых случаев, затем итерайте и уточняйте по мере получения информации и улучшения покрытия.
2Критерии принятия: Чётко определите, что считается успехом. Это определение может показаться сложным на первый взгляд, поэтому подумайте об уточнении своих критериев через итерации. Запустите тестовое задание, прочитайте ответ и оцените его качество, спросив: Отвечает ли оно на основной вопрос? Использует ли он правильную информацию? Подходит ли тон и стиль? Уважает ли он права на совместное использование? Ваши выводы из этих вопросов помогают вам определить критерии приема и, при необходимости, ожидаемый ответ.
Этап 2: Определение базового уровня и улучшение
Цель: проводить оценки и устанавливать базовые метрики для бенчмаркирования и улучшения.
Вы можете провести оценку вручную или использовать специализированные инструменты. Для ручной оценки отправьте запрос на тест агенту, изучите ответ, используйте человеческое суждение, чтобы определить, соответствует ли он критериям принятия, и зафиксируйте результат. Microsoft предлагает инструменты для оценки агентов, включая функцию оценки агентов в Copilot Studio.
Установите базовый уровень
- Запустите базовый набор тестов для агента.
- Документируйте прохождение или непрохождение для каждого тест-кейса.
- Рассчитайте общий процент сдачи: ______%.
- Запишите версию агента и базовую дату: ___________.
Анализ и итерация коренных причин
Изучите результаты оценки для выявления ложноположительных и истинно отрицательных результатов для дальнейшего анализа. Ложноположительный результат — это ответ, отмеченный как успешно прошедший проверку, хотя по оценке человека он должен был ее не пройти. Истинное отрицательное — это ответ, правильно идентифицированный как провал. Оцените неудачные дела с двух точек зрения:
- Проблема с тестовым случаем: вызывают ли провал подсказка, ожидаемый ответ или критерии приёма?
- Проблема проектирования агента: указывает ли сбой на неясную инструкцию агента или недостатки в знаниях или конфигурации инструментов?
Определите первопричину и добейтесь улучшения путем доработки тест-кейса или улучшения архитектуры агента.
Tip
Балл прохождения оценки: Агенты могут давать разные ответы на один и тот же вопрос из-за своей вероятностной природы. Эта изменчивость может привести к тому, что ответы будут проходить или отклоняться в зависимости от строгих критериев приёма. Для обеспечения надёжной оценки запускайте каждый набор тестов несколько раз и рассчитывайте средний процент успешности. Стремитесь к реалистичному проценту сдачи в 80-90%, исходя из потребностей вашего бизнеса.
Этап 3: Реализация систематического расширения
Цель: создать комплексные оценочные группы по различным категориям качества агентов.
Этапы 1 и 2 заложили базовый набор тестов для основных сценариев применения агента. Далее расширьте оценку, создав тестовые наборы, оценивающие различные категории качества агентов. Следующий список предлагает категории, охватывающие различные аспекты качества.
| Категория качества | Goal |
|---|---|
| Основополагающее ядро | Набор тестов, которые должны быть успешно пройдены. Он оценивает ключевые показатели качества отклика при развертывании и выявляет регрессии во время эксплуатации. |
| Устойчивость агента | Главное преимущество одного агента по сравнению с традиционным ПО — его надёжность в работе с различными сценариями использования. Это значение может включать:
|
| Архитектурный тест | Оцените функциональную эффективность агента. Размеры могут включать:
|
| Граничные случаи | Как агент должен обрабатывать граничные случаи с использованием механизмов защиты.
|
Tip
Ссылка на цель категории:
- Сбой ядра: Что-то сломано или не работает. Изучите последние изменения.
- Сбой надежности: агент слишком строг. Возможно, он слишком сосредоточен на конкретных формулировках.
- Сбой архитектуры: Конкретный компонент или рабочий процесс нуждаются в отладке.
- Сбой граничных случаев: механизмы защиты нуждаются в улучшении. Укрепите границы.
Этап 4: Создание непрерывной операции оценки качества
Цель: Организовать непрерывный мониторинг оценки для поддержания качества агентов во время работы.
После развертывания агента в рабочей среде он переходит в стабильную фазу. Чтобы поддерживать качество и быстро выявлять регрессии или проблемы, связанные с изменениями в продукте (например, обновлением модели или обновления системы знаний) или меняющимися сценариями использования, организуйте текущую операцию оценки. Планируйте регулярные оценочные запуски или запускайте их при наступлении определённых событий в целях контроля качества.
- Установите регулярный график проведения оценки.
- Рекомендуемые триггеры полного комплекса оценки:
- Изменение модели
- Крупное обновление настройки базы знаний
- Новые интеграции инструментов или разъёмов
- Инцидент на производстве
Tip
Индикатор успеха: вы успешно внедряете операционную деятельность, когда можете ответить на вопросы заинтересованных сторон конкретно, вместо того чтобы говорить: «Агент кажется нормальным».
Вы пишете: «Соответствие политикам на уровне 98%, но персонализация упала до 87%— в частности, политики, основанные на постоянной должности, не применяются. Мы выявили корень и продолжаем доработку.»