Интеллектуальная обработка документов

Интеллектуальная обработка документов (IDP) преобразует неструктурированное содержимое, например PDF-файлы, ФАЙЛЫ DOCX, изображения и презентации, в структурированные, обогащенные данные, которые предоставляют подчиненные агенты, приложения и аналитику.

Azure Databricks предлагает два способа запуска IDP, оба основанных на одних и тех же научно разработанных AI-функциях:

  • Agent Bricks UI: визуальный опыт без кода для разбора, извлечения и классификации документов. Используйте его для тестирования образцов документов, уточнения схемы или меток и визуальной проверки результатов перед масштабированием.
  • SQL AI Functions: Запускайте интеллектуальные функции обработки документов непосредственно на Lakehouse. Используйте их, чтобы обрабатывать документы в больших масштабах, объединять этапы и создавать управляемые конвейеры промышленного уровня в конвейерах Lakeflow.

Интеллектуальные возможности обработки документов

Функциональность Интерфейс Agent Bricks Функция SQL
Преобразование PDF-файлов, DOCX, изображений и PPTs в структурированный текст, таблицы и описания рисунков. Разбор документов ai_parse_document
Извлеките структурированные поля из документов или обычного текста, используя определяемую схему. Извлечение сведений ai_extract
Назначьте стандартные категории документам или тексту, поддерживая до 500+ меток. Классификация ai_classify
Преобразуйте разборочные документы в семантические блоки, готовые к поисково-дополненной генерации (RAG) и индексации с помощью AI Search. ai_prep_search (бета-версия)

Распространенные варианты использования

IDP в Azure Databricks поддерживает широкий спектр производных приложений:

  • Аугментированная генерация на основе извлечения (RAG): анализ и структурирование документов для улучшения фрагментации, качества извлечения и поддержки достоверности для приложений LLM.
  • Извлечение знаний и аналитика: извлечение ключевых полей и метаданных для включения поиска, создания отчетов и бизнес-аналитики для данных документов.
  • Рабочие процессы, управляемые агентом: маршрутизация, классификация и обогащение документов для поддержки автоматического принятия решений и выполнения задач.
  • Распознавание документов и классификация: упорядочивание больших корпусов документов по типу, разделу или содержимому для последующей обработки.

Принцип работы

Azure Databricks обеспечивает интеллектуальную обработку документов как единый комплексный рабочий процесс в Lakehouse. Прием, разбор, обогащение и анализ на последующих этапах выполняются на единой платформе, благодаря чему все этапы взаимосвязаны без сложной интеграции или перемещения данных.

  1. Загрузка данных и управление процессами

    Используйте конвейеры Lakeflow для приема необработанных документов (таких как PDF-файлы, изображения и ФАЙЛЫ DOCX) и оркестрации конвейеров. Так как прием и оркестрация изначально интегрированы с Lakehouse, документы напрямую попадают в низкоуровневую обработку без дополнительной инфраструктуры.

  2. Анализ документов (бронзовый слой)

    Применяется ai_parse_document для преобразования необработанных файлов в структурированные представления. Это создает стандартизированный бронзовый слой, который записывает текст, таблицы и описания изображений и структуру документов, формируя согласованную основу для всех вариантов использования нижестоящего уровня.

  3. Извлечение и классификация

    Используйте ai_extract и ai_classify, чтобы обогатить проанализированные документы структурированными полями и метаданными. Эти функции работают непосредственно на проанализированных выходных данных, что позволяет извлекать ключевые сведения, классифицировать документы и направлять их через рабочие процессы без дополнительных шагов преобразования.

  4. Подготовка к извлечению (RAG)

    Примените ai_prep_search (бета-версию) для преобразования проанализированных документов в семантические блоки, обогащенные контекстом уровня документа, такими как заголовки, заголовки разделов и ссылки на страницы. Результат форматируется для индексирования в AI Search, обеспечивая единую основу для RAG и сценариев извлечения данных.

  5. Анализ и эксплуатация

    Используйте дополнительные функции ИИ или другие инструменты (панели AI/BI, приложения, поиск на основе ИИ) для последующей аналитики, поиска и извлечения данных (RAG), а также рабочих процессов, управляемых агентами. Так как все данные остаются в Lakehouse, структурированные данные документа можно сразу же использовать для поиска, панелей мониторинга и приложений.