Тестирование и мониторинг агента Genie

Тестируйте агента Genie на реальных вопросах, проверяйте сгенерированные SQL-запросы и визуализации, редактируйте ответы, если Genie ошибается, и отслеживайте использование агента и отзывы пользователей, чтобы агент оставался точным по мере изменения данных и вопросов. Используйте бенчмарки для оценки точности ответов в больших масштабах.

Note

Ранее агенты Genie были известны как Genie Spaces.

Протестируйте своего агента Genie

Большинство взаимодействий с пользователем происходят в окне чата. Лучший способ узнать, работает ли агент, как вы хотите, это проверить его с реалистичными вопросами, которые вы ожидаете, что ваши бизнес-пользователи будут задавать.

Окно чата Genie с примерами вопросов и текстового поля для ввода собственного вопроса.

Примеры вопросов, настроенных в параметрах агента, отображаются в окне чата. Genie также может создавать примеры вопросов на основе контекста агента, чтобы помочь пользователям начать изучение данных. Пользователи могут щелкнуть пример вопроса или ввести собственные вопросы в текстовом поле в нижней части экрана.

Ответы отображаются над текстовым полем. После того как пользователь вводит вопрос, он сохраняется в журнале чата.

Чтобы начать новую беседу, выполните приведенные далее действия.

  1. Нажмите кнопку "Создать чат ", чтобы начать новый чат. Щелкните иконку истории. чтобы открыть предыдущую беседу.
  2. Введите свой вопрос в текстовое поле Задать свой вопрос....

Просмотр ответов

Ответы обычно предоставляются в виде естественного языка, а также в форме таблицы, показывающей соответствующий набор результатов. Когда Genie обнаруживает, что визуализация может улучшить ясность ответа, она также возвращает визуализацию. Точная структура ответа зависит от вопроса. Если sql-запрос был создан для ответа на этот вопрос, он включается в ответ.

Показан пример ответа с визуализацией, отзывом и другими параметрами.

Note

Как и другие крупные языковые модели (LLMs), Genie может проявлять недетерминированное поведение. Это означает, что при отправке одного и того же запроса иногда могут возникать разные выходные данные. Предоставление примеров SQL-запросов, из которых Genie может извлечь уроки, поможет сделать Genie более согласованным. Смотрите примеры запросов и функций SQL.

Отзывы об ответе

Каждый ответ предложит пользователю ответить Это правильно? Пользователи могут реагировать одним из следующих способов:

  • Да: Подтверждает, что ответ является правильным.
  • Исправьте: Отметить ответ как неправильный. Пользователи могут выбрать из распространенных проблем или ввести собственное объяснение. Затем они могут:
    • Нажмите кнопку "Отправить" и повторите попытку, чтобы повторно создать ответ с помощью предоставленной обратной связи.
    • Нажмите кнопку "Отправить ", чтобы отправить отзыв без повторного создания ответа.
  • Запрос на проверку: Отмечает ответ для ручной проверки. Пользователи могут добавить необязательный комментарий для предоставления дополнительного контекста.

В качестве редактора можно просматривать отзывы и помеченные ответы в интерфейсе Genie. Поведение агента Genie не изменяется только на основе отзывов пользователей. Вы должны использовать отзывы для выявления возможностей улучшения или реагирования непосредственно на вопросы пользователей. Databricks рекомендует поощрять пользователей предоставлять отзывы об агенте с помощью этого механизма.

Бизнес-пользователи могут просматривать обновления вопросов, помеченных для проверки на странице "Монитор ". Пользователи, имеющие по крайней мере разрешение CAN MANAGE для агента Genie, могут просматривать конкретный обмен, комментировать запрос и подтвердить или исправить ответ. Они могут получать доступ к отзывам и просматривать запросы на странице мониторинга. Затем вы можете использовать эту обратную связь, чтобы скорректировать ответы и дорабатывать своего агента. См. раздел "Мониторинг агента".

Другие действия ответа

Для ответов, включающих созданный SQL, дополнительные параметры позволяют взаимодействовать с возвращаемыми данными.

  • Копирование CSV-файла: Пользователи агента могут скачать до примерно 1 ГБ данных результатов в формате CSV. Размер окончательного скачивания файла может быть немного больше или меньше 1 ГБ, так как ограничение на 1 ГБ применяется к предыдущему шагу, чем к окончательному скачиванию файла. Чтобы скачать результаты, щелкните значок скачивания в ответе.

  • Показать код: Нажмите кнопку "Показать код ", чтобы просмотреть созданный запрос. Это может быть полезно для устранения неполадок с ненадежными ответами. См. статью "Изменение и сохранение запросов".

  • Значок меню Kebab. Кебаб меню : Доступ к следующим действиям:

    • Скопируйте CSV: скопируйте CSV-ответ в буфер обмена.
    • Добавьте инструкцию: Для взаимодействия, которые могут быть полезны для обучения Genie, как ответить на аналогичные вопросы, нажмите кнопку "Добавить как инструкцию". Это откроет пользовательский интерфейс для сохранения примеров SQL-запросов, заполненных вопросом и сгенерированным SQL. Вы можете оставить пример как написанный или изменить и сохранить, чтобы внести изменения. Смотрите примеры запросов и функций SQL.
    • Добавьте в качестве теста: добавьте вопрос в качестве контрольного вопроса. См. тесты производительности.
    • Обновление данных: обновите данные, выполнив ранее созданный запрос.
    • Повторное создание ответа: отправьте вопрос еще раз и повторно создайте ответ Genie.

Изменение и сохранение запросов

Запросы SQL Genie можно проверить на точность и изменить при необходимости. Авторы агента Genie обычно знают домен и данные, которые позволяют им распознавать, когда Genie создает неправильный ответ. Часто ошибки можно исправить с небольшим количеством ручной настройки в созданном SQL-запросе. Нажмите кнопку "Показать созданный код ", чтобы проверить запрос и просмотреть созданный SQL для любого ответа.

Вы можете изменить сгенерированное SQL-выражение, чтобы исправить его, если у вас есть разрешение CAN EDIT или более высокий уровень привилегий на агенте Genie. После внесения исправлений выполните запрос. Затем вы можете сохранить его в качестве инструкции для обучения Genie, как ответить в будущем. Чтобы сохранить измененный запрос, нажмите кнопку "Добавить как инструкцию".

Отладка ответов с помощью Genie Code

Когда Genie возвращает неправильный ответ, используйте Genie Code для диагностики проблемы и улучшения контекста агента:

  1. Откройте код Genie в ответе.
  2. Опишите проблему и нужное поведение.
  3. Просмотрите изменения контекста, которые предлагает Genie Code, и примите те, которые вы хотите сохранить.

Tip

Попросите Genie Code сделать это за вас:

The Genie Agent is using calendar quarters instead of our fiscal calendar. Update its context to use our fiscal quarters: Q1 is February through April, Q2 is May through July, Q3 is August through October, and Q4 is November through January.

Вы также можете использовать Код Genie для сохранения семантического контекста из беседы. После того как пользователи добавляют новые термины или исправляют поведение Genie, попросите Genie Code зафиксировать то, чему он научился. Просмотрите каждый предлагаемый вариант и выберите контекст, который вы хотите добавить агенту.

Отслеживайте агента

Агент Genie можно рассматривать как долгосрочное средство совместной работы между командами данных и бизнес-пользователями. Он накапливает знания с течением времени, а не выступает в качестве разового использования. По мере поступления новых вопросов от пользователей вы можете дорабатывать агента, чтобы повысить охват и точность.

Перейдите на вкладку "Монитор " для просмотра отдельных вопросов и ответов, просмотра отзывов пользователей и определения ответов, помеченных для проверки.

На вкладке

На вкладке «Монитор» отображаются все вопросы и ответы, заданные в агенте. Вы можете фильтровать вопросы по времени, рейтингу, пользователю или состоянию. Отслеживая агент, пользователи с разрешениями CAN MANAGE могут заранее понять запросы, создаваемые бизнес-пользователями, и как агент Genie ответил.

Определение вопросов, на которые Genie затрудняется отвечать, поможет вам обновить агента Genie, добавив конкретные инструкции, чтобы улучшить его ответы. Щелкните вопрос, чтобы открыть текст вопроса и ответа и просмотреть полный поток чата.

Используйте раздел " Еженедельный дайджест " на вкладке "Монитор " для просмотра еженедельного объема сообщений, активных пользователей и обратной связи вверх и вниз. Чтобы определить основные тенденции использования и распространенные проблемы, нажмите кнопку "Анализ использования пространства". Это запускает Genie Code, который проверяет сообщения пользователя, отзывы и проблемы за последние семь дней и отчеты о распространенных темах, повторяющихся проблемах и предлагаемых улучшениях контекста. Ответы включают ссылки на соответствующие диалоги в вашем агенте. Щелкните цитату, чтобы открыть переписку непосредственно в ветке Genie Code.

Еженедельный дайджест на вкладке

Оценка качества бесед

Общий доступ к чату Genie позволяет менеджерам агентов просматривать полные беседы, имеющиеся у бизнес-пользователей с агентом Genie. Когда менеджеры агентов устанавливают разговор в режим Reviewable, пользователи с разрешением CAN MANAGE могут открыть разговор со вкладки мониторинга, чтобы просмотреть полный обмен. Это позволяет оценить качество ответа Genie, ответить на отзывы пользователей и определить области, в которых дополнительные инструкции или примеры запросов повышают точность. Для бесед, заданных для частных, менеджеры агентов могут просматривать запросы пользователей на вкладке мониторинга, но не могут просматривать полный диалог или результаты. Дополнительные сведения см. в разделе "Общий доступ к беседе".

Note

Разговоры, созданные до включения функции обмена разговорами , остаются приватными. Разговоры, созданные после включения по умолчанию в режиме «Проверяемые» менеджерами агентов.

Удаление беседы

Пользователи с разрешением CAN MANAGE для агента Genie могут безвозвратно удалить любой разговор в этом агенте со страницы мониторинга. Это удалит разговор и все сообщения в нём для всех пользователей.

  1. Откройте агент Genie и перейдите на вкладку "Монитор ".
  2. Нажмите на беседу, чтобы открыть панель беседы.
  3. Нажмите кнопку "Удалить беседу".
  4. В диалоговом окне подтверждения нажмите кнопку "Удалить ", чтобы окончательно удалить беседу, или отменить , чтобы закрыть диалоговое окно без удаления.

Benchmarks

Эталонные тесты позволяют создавать набор тестовых вопросов, которые можно выполнить для оценки точности ответа Genie в целом. Хорошо продуманный набор контрольных примеров, охватывающих наиболее часто задаваемые пользователями вопросы, помогает оценивать точность вашего агента Genie по мере его доработки. Каждый агент Genie может содержать до 500 эталонных вопросов.

Контрольные вопросы запускаются как новые беседы. Они не несут тот же контекст, что и потоковые беседы Genie. Каждый вопрос обрабатывается как новый запрос, используя инструкции, определенные в агенте, включая любые предоставленные примеры функций SQL и SQL.

Вопросы теста поддерживают два режима:

  • Режим чата: режим по умолчанию. Genie оценивает точность, сравнивая результаты, сгенерированные с помощью SQL, с предоставленным SQL-ответом.
  • Режим агента: обрабатывает контрольные вопросы, используя то же многошаговое рассуждение, что и в режиме агента Genie. Судья LLM оценивает ответы. Вы можете добавить необязательное примечание, которое поможет при оценивании.

Режим вы выбираете при проведении бенчмарков, а не при добавлении вопроса. Используйте переключатель режима в правом верхнем углу вкладки «Бенчмарки », чтобы выбрать режим «Чат » или «Агент » для запуска. Выбранный режим применяется ко всем вопросам в этом прохождении.

примеры тестов с точностью, указанной для девяти вопросов.

Добавление вопросов теста

Вопросы теста должны отражать различные способы выражения распространенных вопросов, которые задают пользователи. Их можно использовать для проверки ответа Genie на варианты выражения вопросов или различные форматы вопросов.

При создании вопроса теста можно дополнительно включить SQL-запрос, результирующий набор которого является правильным ответом. Во время выполнения теста точность оценивается путем сравнения результирующего набора данных из вашего SQL-запроса с тем, который формируется Genie. Вы также можете использовать функции SQL каталога Unity в качестве стандартных ответов на тесты.

Чтобы добавить контрольный вопрос, выполните указанные действия.

  1. В верхней части агента Genie щелкните "Тесты".

  2. Нажмите кнопку "Добавить тест".

  3. В поле "Вопрос" введите тестовый вопрос для тестирования.

  4. (Необязательно) Укажите SQL-запрос, который отвечает на вопрос. Вы можете написать собственный запрос в поле SQL Answer, в том числе с использованием SQL-функций Unity Catalog. Кроме того, нажмите "Создать SQL", чтобы Genie создал SQL-запрос для вас. Используйте инструкцию SQL, которая точно отвечает на введенный вопрос.

    Note

    Этот шаг рекомендуется для прохождения в режиме чата. Только вопросы, содержащие этот пример инструкции SQL, можно автоматически оценить для точности. Любые вопросы, не содержащие ответ SQL, требуют оценки вручную. Если вы используете кнопку "Создать SQL ", просмотрите инструкцию, чтобы убедиться, что она точно отвечает на этот вопрос.

  5. (По желанию) В поле «Оценка » введите руководство по правильному ответу или ожидаемому содержанию. Во время запусков в режиме Agent Genie передаёт примечание с оценкой LLM-арбитру. Примечание может ссылаться на ожидаемое содержимое в текстовых отчетах, создаваемых режимом агента.

  6. (Необязательно) Нажмите Запустить, чтобы запустить запрос и просмотреть результаты.

  7. После завершения редактирования нажмите кнопку "Добавить тест".

  8. Чтобы обновить вопрос после сохранения, щелкните значок карандаша Значок , чтобы открыть диалоговое окно "Обновить вопрос ".

Использование эталонных показателей для тестирования альтернативных фраз вопросов

При оценке точности агента Genie важно структурировать тесты, чтобы отразить реалистичные сценарии. Пользователи могут задавать один и тот же вопрос разными способами. Databricks рекомендует добавлять несколько формулировок одного и того же вопроса и использовать один и тот же пример SQL в тестах для полной проверки точности. Большинство агентов Genie должно содержать от двух до четырёх вариантов формулировки одного и того же вопроса.

Запуск эталонных вопросов

Пользователи, имеющие как минимум права CAN EDIT в агенте Genie, могут в любое время выполнять оценку бенчмарка. Вы можете выполнить все вопросы теста или выбрать подмножество вопросов для тестирования.

Для каждого вопроса Genie интерпретирует входные данные, создает SQL и возвращает результаты. Затем созданные SQL и результаты сравниваются с SQL-ответом, определенным в вопросе теста.

Чтобы запустить все эталонные вопросы:

  1. В верхней части агента Genie щелкните "Тесты".
  2. Нажмите кнопку "Запустить тестовые тесты", чтобы запустить тестовый запуск.

Чтобы выполнить подмножество вопросов теста, выполните следующие действия.

  1. В верхней части агента Genie щелкните "Тесты".
  2. Установите флажки рядом с вопросами, которые вы хотите проверить.
  3. Нажмите кнопку "Запустить", чтобы запустить тестовый запуск по выбранным вопросам.

Вы также можете выбрать подмножество вопросов из предыдущего результата теста и повторно запустить эти конкретные вопросы для тестирования улучшений.

Тесты по-прежнему выполняются при переходе от страницы. После завершения выполнения можно проверить результаты на вкладке "Оценка ".

После завершения запуска можно использовать Genie Code, чтобы просмотреть результаты по всему запуску и предложить улучшения контекста. См . раздел "Анализ тестового запуска с помощью Кода Genie".

Оценки режима чата

Следующие критерии определяют, как Genie оценивает ответы в режиме чата:

Condition Rating
Genie создает SQL, который точно соответствует предоставленному ответу SQL Хорошо
Genie создает результирующий набор, который точно соответствует результирующему набору, созданному ответом SQL Хорошо
Genie создает результирующий набор с теми же данными, что и ответ SQL , но отсортирован по-разному. Хорошо
Genie создает результирующий набор с числовыми значениями, округляемыми до тех же 4 значимых цифр, что и ответ SQL Хорошо
Genie генерирует SQL-запрос, который создает пустой результат или возвращает ошибку Плохой
Genie создает результирующий набор, включающий дополнительные столбцы по сравнению с тем, который создается ответом SQL. Плохой
Genie создает результат одной ячейки, отличный от результата одной ячейки, созданного ответом SQL Плохой

Note

Режим чата сравнивает до 5 000 строк каждого набора результатов. Если набор результатов превышает 5 000 строк и порядок строк отличается между результатами, сгенерированными Genie, и SQL-ответом, это усечение может привести к тому, что совпадающий набор результатов будет оценен как Плохой. Чтобы этого избежать, составляйте SQL Answer запросы, которые возвращают менее 5 000 строк, или добавьте конструкцию ORDER BY как в SQL Answer, так и в ожидаемый вывод Genie, чтобы порядок строк оставался неизменным.

Если результат оценивается как Плохой, объяснение указывает тип несоответствия.

Требуется ручная проверка: ответы помечаются с этой меткой, если Genie не может оценить правильность или если результаты запроса, созданные Genie, не содержат точного совпадения с результатами предоставленного ответа SQL. Все вопросы теста, не содержащие ответ SQL, должны быть проверены вручную.

Оценки режима агента

LLM-судья оценивает ответы режима агента, а не с помощью сравнения SQL. Если вы предоставили примечание по оценке, судья LLM использует его в качестве руководства при оценке ответа, включая любое ожидаемое содержимое в текстовом отчете, который создает режим агента. Судья оценивает ответы, которые соответствуют критериям оценочного примечания, как хорошие.

Доступ к базовым оценкам

Вы можете получить доступ ко всем оценкам эталонных тестов, чтобы отслеживать точность вашего агента Genie с течением времени. Когда вы открываете Контрольные показатели агента, на вкладке Оценки отображается список запусков оценки с отметками времени. Если запуски оценки не найдены, см. Добавить вопросы для контрольных показателей или Запустить вопросы для контрольных показателей.

Экран оценки, как описано в следующем тексте.

На вкладке оценки содержится общий обзор оценок и их эффективности в следующих категориях:

Имя оценки: метка времени, указывающая, когда произошла оценка. Щелкните метку времени, чтобы просмотреть сведения об этой оценке. Состояние выполнения: указывает, завершена ли оценка, приостановлена или неудачна. Если выполнение оценки содержит эталонные вопросы, которые не имеют предопределенных ответов SQL, выполнение оценки помечается для пересмотра в этом столбце. Точность: числовая оценка точности по всем вопросам теста. Для оценочных процессов, требующих ручной проверки, точность отображается только после проверки этих вопросов. Создано: указывает имя пользователя, выполнившего оценку.

Просмотр отдельных оценок

Вы можете просмотреть отдельные оценки, чтобы получить подробный обзор каждого ответа. Вы можете изменить оценку для любого вопроса и обновить все элементы, которые нуждаются в ручной проверке.

Чтобы просмотреть отдельные оценки.

  1. В верхней части Genie Agent щелкните Benchmark.

  2. Щелкните метку времени для любой оценки в столбце имени оценки, чтобы открыть подробное представление тестового запуска.

    Экран, показывающий результаты выполнения одной оценки. Все вопросы перечислены слева. Если применимо, справа отображаются отдельные вопросы с выходными данными модели и истинными выходными данными.

  3. Используйте список вопросов в левой части экрана, чтобы просмотреть подробное представление каждого вопроса.

  4. Просмотрите и сравните выходной ответ модели с эталонным ответом.

    Для результатов, оцененных как неверные, появляется объяснение, описывающее, почему результат был оценен как плохой. Это помогает понять конкретные различия между сгенерированными выходными данными и ожидаемой эталонной истиной.

    Note

    Результаты этих ответов отображаются в сведениях об оценке в течение одной недели. Через одну неделю результаты больше не видны. Созданная инструкция SQL и пример инструкции SQL остаются.

  5. Нажмите Обновить эталонные данные, чтобы сохранить ответ в качестве новых Эталонных данных для этого вопроса. Это полезно, если эталонные данные не существуют, или если ответ лучше или более точен, чем существующее эталонное утверждение.

  6. Щелкните по значку на метке, чтобы отредактировать оценку.

    Пометьте каждый результат как хороший или плохой , чтобы получить точный показатель для этой оценки.

Анализ тестового запуска с помощью Genie Code

После завершения прогона теста используйте Genie Code, чтобы просмотреть результаты за весь прогон, вместо того чтобы анализировать каждый вопрос по отдельности. Запустите Genie Code из окна оценки и попросите его проанализировать запуск. Genie Code проверяет ожидаемые результаты, созданные агентом, и текущий контекст агента, чтобы найти пробелы, а затем предлагает улучшения инструкции и контекста для просмотра и сохранения.