Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Разговорная оценка позволяет оценить общее поведение вашего агента на протяжении длительного взаимодействия. Он отражает, как реальные пользователи взаимодействуют с агентами, где каждый ответ зависит от предыдущего контекста в ходе текущего разговора. Вы можете использовать эти оценки, чтобы определить, способен ли агент сохранять контекст, запрашивать разъяснения и выполнять многоступенчатые задачи.
Вы также можете запускать оценки с одним ответом, что полезно для тестирования вашего агента на то, как он отвечает на конкретные вопросы, какие возможности вызывает и на точные формулировки, которые он использует в ответах.
Оценки используют тестовые наборы. Набор тестов для разговорных оценок состоит из группы до 20 тестовых случаев. Когда вы запускаете оценку агента, вы выбираете тестовый набор, и Copilot Studio запускает все тестовые случаи в этом наборе против вашего агента.
Вы можете создавать тестовые случаи внутри тестового набора, импортируя их с помощью таблицы, или использовать ИИ для генерации сообщений на основе дизайна и ресурсов вашего агента. Затем вы можете выбрать, как измерять качество ответов вашего агента для каждого тестового случая внутри тестового набора.
Для получения дополнительной информации о том, как работает оценка агента, см. раздел «О оценке агента».
Чтобы узнать, как редактировать существующий тестовый набор, см. раздел «Изменить детали тестового набора».
Это важно
Результаты теста доступны в Copilot Studio в течение 89 дней. Чтобы сохранить результаты теста на более длительное время, экспортируйте их в CSV-файл.
Создайте тестовый набор для разговора
- Перейдите на страницу оценки вашего агента.
Выберите «Новую оценку», затем «Разговор».
Вы можете создавать многоходовые тестовые случаи, используя любой из следующих методов:
Набор быстрых разговоров: Автоматически генерируйте 10 коротких разговоров на основе описания, инструкций и возможностей вашего агента.
Полный набор разговоров: Генерируйте беседы, используя знания вашего агента или определённые темы. В этом варианте вы можете выбрать создание коротких или длинных разговоров.
Используйте свой тестовый чат: преобразуйте последний тестовый чат в тестовый случай.
Note
Наборы тестов для разговоров поддерживают до 20 тестовых случаев. Каждый тестовый случай поддерживает до 12 сообщений, то есть 6 пар вопросов и ответов.
В разделе «Имя» введите имя для вашего тестового набора.
Измените или добавьте методы тестирования , которые хотите использовать. Для тестовых наборов разговоров можно добавить общие методы качества, соответствие ключевых слов, соответствие возможностей или пользовательские методы тестирования классификации .
- Добавьте новый метод:
- Выберите "Добавить метод теста".
- Выберите все методы, с которыми хотите протестировать, затем выберите OK. Можно добавить несколько методов.
- Для некоторых методов установите балл прохода, затем выберите OK. Сдачный балл определяет, какой результат приведёт к прохождению, а какой — к провалу.
- Некоторые методы требуют добавления ожидаемых ответов или ключевых слов для каждого вашего тестового случая. Для получения дополнительной информации см. раздел «Выберите методы оценки».
- Выберите существующий метод тестирования для редактирования или удаления.
Метод испытаний Меры Тип тестового набора Очки Конфигурации Общее качество Насколько хорош ответ(ы) тестового случая в зависимости от конкретных качеств Один ответ или разговор Оценка из 100% нет Сравнение значений Насколько смысл ответа тестового случая соответствует ожидаемому ответу Одиночный отклик Оценка из 100% Сдачный балл, ожидаемый ответ Использование возможностей Использовал ли тестовый случай все или какие-либо ожидаемые ресурсы Одиночный отклик Передача или сбой Ожидаемые возможности Совпадение ключевых слов Использовали ли тестовый случай все или какие-либо из ожидаемых ключевых слов или фраз Один ответ или разговор Передача или сбой Ожидаемые ключевые слова или фразы Сходство текста Насколько хорошо текст ответа тестового случая соответствует ожидаемому ответу Одиночный отклик Оценка из 100% Сдачный балл, ожидаемый ответ Точное совпадение Точно ли ответ тестового случая соответствует ожидаемому ответу Одиночный отклик Передача или сбой Ожидаемый ответ Пользовательский Соответствует ли ответ тестового случая вашим установленным критериям или ожиданиям. Один ответ или разговор Сдал/непроход (проходит определённые критерии меток) Имя, инструкции по оценке, ярлыки - Добавьте новый метод:
Отредактируйте детали тестовых случаев. Все методы тестирования, кроме общего качества, требуют ожидаемых ответов или ключевых слов. Для получения дополнительной информации об редактировании тестовых случаев см . Модификация тестового набора (Modify a test set).
Выберите профиль пользователя, затем выберите или добавьте аккаунт, который хотите использовать для этого тестового набора, или продолжите без аутентификации. Оценка использует этот аккаунт для подключения к источникам знаний и инструментам во время тестирования. Для получения информации о добавлении и управлении профилями пользователей см. раздел «Управление профилями пользователей и соединениями».
Note
Автоматизированное тестирование использует аутентификацию выбранного тестового аккаунта. Если у вашего агента есть источники знаний или соединения, требующие специальной аутентификации, выберите подходящий аккаунт для тестирования.
Редактируйте или создавайте больше тестовых случаев. Узнайте больше в разделе «Редактировать тестовые случаи внутри тестового набора».
Выберите Сохранить, чтобы обновить тестовый набор без запуска тестовых случаев, или Оценить, чтобы немедленно запустить тестовый набор.