Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Note
На этой странице рассматривается новая версия извлечения информации. Сведения о предыдущей версии см. в разделе "Использование извлечения информации" (устаревшая версия)
Извлечение информации преобразует неструктурированные документы и текст в ключ, структурированные аналитические сведения с помощью определенной схемы. Это позволяет напрямую использовать информацию из неструктурированного текста, PDF-файлов, изображений или таблиц для анализа, подготовки отчетов или последующих агентов и приложений.
Примеры извлечения информации:
- Извлечение юридических сторон и условий из контрактов.
- Извлечение позиций и платёжных условий из счетов.
- Извлечение ключевых сведений из медицинских записей и заметок.
Извлечение сведений использует хранилище по умолчанию для хранения временных преобразований данных, контрольных точек модели и внутренних метаданных, обеспечивающих работу каждого агента. При удалении агента Databricks удаляет все данные, связанные с агентом, из хранилища по умолчанию.
Извлечение информации доступно через интерфейс Agent Bricks и на SQL.
Создайте агент для извлечения информации в интерфейсе
Requirements
- Рабочая область, которая включает в себя следующее:
- Бессерверные вычисления включены. См. требования к бессерверным вычислениям.
- Каталог Unity включен. См. Включение рабочей области для каталога Unity.
- Доступ к бессерверной политике использования с ненулевой бюджетом.
- Эта функция доступна только в некоторых регионах, см. сведения о доступности функций ИИ.
- Для рабочих пространств с дополнением «Повышенная безопасность и соответствие требованиям»,
- См. региональную поддержку для
ai_extractприменительно к соответствующему стандарту соответствия требованиям. - Сведения о включении Azure Databricks в рабочей области см. в статье "Управление Azure Databricks предварительной версии".
- См. региональную поддержку для
- Возможность использовать функцию
ai_extractSQL. - Неструктурированные данные, из которых требуется извлечь информацию. Данные должны находиться в томе каталога Unity или таблице.
- Чтобы создать своего агента, необходимо иметь как минимум один файл в томе Unity Catalog или одну строку в таблице.
Перейдите к Агенты в левой панели навигации вашего рабочего пространства. Щелкните Создать агента>Извлечение сведений.
Шаг 1. Выберите данные, из которых извлечь информацию.
На странице "Начало работы с данными " выберите файлы или данные, из которого требуется извлечь информацию. Вы можете выполнить любое из следующих действий:
- Перетащите один или несколько файлов в область отправки или щелкните, чтобы просмотреть файлы для отправки.
- Щелкните "Выбрать том", чтобы выбрать том каталога Unity с поддерживаемыми типами файлов.
- Щелкните "Выбрать таблицу ", чтобы выбрать таблицу каталога Unity, содержащую текстовые данные.
Если выбрать таблицу, выберите столбец, содержащий данные для извлечения. Прежде чем продолжить, необходимо выбрать столбец с поддерживаемым типом, например STRING или VARIANT. Если в таблице нет поддерживаемых столбцов, выберите другую таблицу.
Нажмите кнопку "Создать агент". Эта кнопка включена только после выбора допустимого источника данных, а для таблицы — поддерживаемого столбца.
Шаг 2. Настройка и уточнение схемы извлечения
После того как процесс извлечения информации завершит обработку ваших данных, настройте и уточните, какие именно данные необходимо извлечь из документов.
В разделе "Конфигурация" определите схему извлечения. Это можно сделать несколькими способами:
- Введите естественный язык, описывающий сведения, которые требуется извлечь, и нажмите кнопку "Создать схему". Извлечение сведений автоматически создает схему JSON с именами полей и определениями. Измените эти описания по мере необходимости.
- В качестве альтернативы нажмите «Или, задать вручную», чтобы самостоятельно определить вашу схему:
- Нажмите поле «Добавить».
- Введите имя поля, тип и описание.
- Нажмите кнопку "Подтвердить".
- Повторите для каждого поля, которое требуется извлечь.
- Нажмите «Сохранить и запустите извлечение».
- Вы также можете щелкнуть JSON , чтобы изменить схему JSON напрямую. Нажмите кнопку "Применить изменения" при завершении.
Каждый раз, когда вы обновляете схему и нажимаете кнопку "Сохранить и запустить извлечение", "Извлечение информации" обновляет агент извлечения, выполняет извлечение и отображает результаты для каждого входного ввода.
Чтобы настроить дополнительные параметры, нажмите на
с разделом «Сохранить и запустить извлечение», затем включите одну или несколько из следующих опций:
- Режим точности: Повышает точность для тонких полей и длинных документов.
- Цитирования: Показывает источники для извлеченных значений.
- Оценки доверия: показывает уровни доверия к извлеченым значениям.
Слева просмотрите проанализированный документ и извлечение агента. Повторите результаты извлечения двумя способами. Сначала предоставьте отзыв на естественном языке по одному или нескольким входным данным; когда вы нажмёте Save and run extraction, система автоматически настроит ваши описания. Во-вторых, вручную изменяйте описания схемы, которые вступают в силу при нажатии клавиши Save и run extraction.
Используйте версии для сравнения или возврата к предыдущей конфигурации. Щелкните "Версии", а затем нажмите кнопку "Сравнить ", чтобы сравнить определение схемы предыдущей версии с текущей версией. Нажмите кнопку "Восстановить" , чтобы восстановить предыдущую версию.
Шаг 3. Оценка и улучшение качества извлечения
Чтобы оценить, насколько эффективно работает ваш агент, и систематически улучшать его, оцените работу агента на размеченном наборе данных. При оценке каждое извлечение сравнивается с известным правильным ответом (ground truth), чтобы вы могли отслеживать точность на уровне полей в разных версиях и сосредоточиться на полях, которые требуют доработки.
Добавление набора данных оценки
Перед выполнением оценки необходимо иметь набор данных оценки в каталоге Unity. Набор данных должен быть таблицей каталога Unity с двумя столбцами:
-
Входной столбец с текстом или документом, из которых нужно извлечь данные. Это может быть
STRINGтекст или выходныеVARIANTai_parse_documentданные. -
Столбец с эталонными данными, содержащий ожидаемый результат извлечения в виде строки JSON. Каждое значение должно соответствовать схеме извлечения вашего агента и совпадать с
ai_extractрасширенной схемой.
Проведение оценки
Чтобы запустить оценку агента извлечения, выполните следующую команду:
- В рабочей области откройте раскрывающийся список «Оценка» и нажмите Выполнить оценку. Откроется диалоговое окно Создание запуска оценки.
- В таблице набора данных оценки выберите таблицу каталога Unity, в которой хранятся помеченные примеры.
- В разделе Сопоставление столбцов выберите столбец ввода с входными данными агента и столбец эталонных ответов с ожидаемым ответом.
- Нажмите кнопку "Выполнить оценку". Извлечение информации сохраняет текущую конфигурацию в качестве новой версии и оценивает каждую строку по своей действительности.
Проверить результаты оценки
По мере выполнения процесса документы поступают на вкладку Документы, и для каждого документа отображаются все несовпадающие поля. Когда выполнение завершится, Information Extraction отобразит вкладку Обзор, которая включает следующее:
- Сводка показателей с общей точностью полей и полностью корректными документами. Если существует предыдущий запуск оценивания, оценочная карточка показывает изменение по сравнению с ним.
- Таблица оценок по полям. Щелкните любое поле, чтобы открыть его детализированное представление, в котором отображаются доля правильных ответов, точность, полнота и F1. Нажмите Показать документы с ошибкой, чтобы просмотреть каждый документ, из которого не удалось извлечь это поле, и извлечённые из него данные.
Перейдите на вкладку "Документы" , чтобы проверить отдельные документы. Каждая строка отображает долю совпавших полей и поля с несоответствиями. Используйте раскрывающийся список "Поля" , чтобы отфильтровать документы с определенным несогласованным полем. Нажмите на документ, чтобы сравнить ответ агента с эталонным ответом бок о бок.
Применение исправлений кода Genie
После завершения запуска Извлечение информации анализирует результаты и выявляет проблемы в рекомендациях Genie Code, ранжируя их по количеству затронутых документов. Каждое замечание описывает потенциальную проблему качества. Нажмите кнопку "Исправить с помощью Genie ", чтобы открыть интерактивный чат Кода Genie, предлагающий изменения схемы и инструкции, проверяет их на соответствие затронутым документам и предлагает повторно выполнить полную оценку.
Шаг 4. Используйте вашего агента извлечения
Когда вас устраивает работа агента, используйте его для извлечения информации.
Кликните "Использовать агент" в правом верхнем углу. Можно выбрать один из следующих вариантов:
-
Запустите агент, чтобы извлекать информацию из всех ваших данных в SQL. Откроется SQL-запрос, который использует
ai_extractдля извлечения информации из вашего тома или таблицы в соответствии с определенной схемой. Дополнительные сведения об использованииai_extractв запросах SQL см. в разделе «Функцияai_extract». - Создайте конвейер Lakeflow, который запускается по расписанию, чтобы запускать вашего агента для новых данных. При этом создается конвейер Lakeflow, который обновляет потоковую таблицу с извлеченными данными. Расписание конвейера можно настроить для запуска при поступлении новых данных. Дополнительные сведения о конвейерах Lakeflow см. в разделе "Декларативные конвейеры Spark".
Извлечение информации в SQL
Используйте ai_extract в SQL для извлечения полей в больших масштабах:
SELECT ai_extract(
'Invoice #12345 from Acme Corp for $1,250.00 dated 2024-01-15',
'{
"invoice_id": {"type": "string", "description": "Unique invoice identifier"},
"vendor_name": {"type": "string", "description": "Legal business name"},
"total_amount": {"type": "number", "description": "Total invoice amount"},
"invoice_date": {"type": "string", "description": "Date in YYYY-MM-DD format"}
}',
options => map('version', '2.1')
);
См. ai_extract справочник по SQL.
Limitations
- См Ограничения
- Агенты извлечения информации имеют максимальную длину контекста в 128k токенов.
- Типы схем объединения не поддерживаются.