Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Интеллектуальная обработка документов (IDP) преобразует неструктурированное содержимое, например PDF-файлы, ФАЙЛЫ DOCX, изображения и презентации, в структурированные, обогащенные данные, которые предоставляют подчиненные агенты, приложения и аналитику.
Azure Databricks предлагает два способа запуска IDP, оба основанных на одних и тех же научно разработанных AI-функциях:
- Agent Bricks UI: визуальный опыт без кода для разбора, извлечения и классификации документов. Используйте его для тестирования образцов документов, уточнения схемы или меток и визуальной проверки результатов перед масштабированием.
- SQL AI Functions: Запускайте интеллектуальные функции обработки документов непосредственно на Lakehouse. Используйте их, чтобы обрабатывать документы в больших масштабах, объединять этапы и создавать управляемые конвейеры промышленного уровня в конвейерах Lakeflow.
Интеллектуальные возможности обработки документов
| Функциональность | Интерфейс Agent Bricks | Функция SQL |
|---|---|---|
| Преобразование PDF-файлов, DOCX, изображений и PPTs в структурированный текст, таблицы и описания рисунков. | Разбор документов | ai_parse_document |
| Извлеките структурированные поля из документов или обычного текста, используя определяемую схему. | Извлечение сведений | ai_extract |
| Назначьте стандартные категории документам или тексту, поддерживая до 500+ меток. | Классификация | ai_classify |
| Преобразуйте разборочные документы в семантические блоки, готовые к поисково-дополненной генерации (RAG) и индексации с помощью AI Search. |
ai_prep_search (бета-версия) |
Распространенные варианты использования
IDP в Azure Databricks поддерживает широкий спектр производных приложений:
- Аугментированная генерация на основе извлечения (RAG): анализ и структурирование документов для улучшения фрагментации, качества извлечения и поддержки достоверности для приложений LLM.
- Извлечение знаний и аналитика: извлечение ключевых полей и метаданных для включения поиска, создания отчетов и бизнес-аналитики для данных документов.
- Рабочие процессы, управляемые агентом: маршрутизация, классификация и обогащение документов для поддержки автоматического принятия решений и выполнения задач.
- Распознавание документов и классификация: упорядочивание больших корпусов документов по типу, разделу или содержимому для последующей обработки.
Принцип работы
Azure Databricks обеспечивает интеллектуальную обработку документов как единый комплексный рабочий процесс в Lakehouse. Прием, разбор, обогащение и анализ на последующих этапах выполняются на единой платформе, благодаря чему все этапы взаимосвязаны без сложной интеграции или перемещения данных.
Загрузка данных и управление процессами
Используйте конвейеры Lakeflow для приема необработанных документов (таких как PDF-файлы, изображения и ФАЙЛЫ DOCX) и оркестрации конвейеров. Так как прием и оркестрация изначально интегрированы с Lakehouse, документы напрямую попадают в низкоуровневую обработку без дополнительной инфраструктуры.
Анализ документов (бронзовый слой)
Применяется
ai_parse_documentдля преобразования необработанных файлов в структурированные представления. Это создает стандартизированный бронзовый слой, который записывает текст, таблицы и описания изображений и структуру документов, формируя согласованную основу для всех вариантов использования нижестоящего уровня.Извлечение и классификация
Используйте
ai_extractиai_classify, чтобы обогатить проанализированные документы структурированными полями и метаданными. Эти функции работают непосредственно на проанализированных выходных данных, что позволяет извлекать ключевые сведения, классифицировать документы и направлять их через рабочие процессы без дополнительных шагов преобразования.Подготовка к извлечению (RAG)
Примените
ai_prep_search(бета-версию) для преобразования проанализированных документов в семантические блоки, обогащенные контекстом уровня документа, такими как заголовки, заголовки разделов и ссылки на страницы. Результат форматируется для индексирования в AI Search, обеспечивая единую основу для RAG и сценариев извлечения данных.Анализ и эксплуатация
Используйте дополнительные функции ИИ или другие инструменты (панели AI/BI, приложения, поиск на основе ИИ) для последующей аналитики, поиска и извлечения данных (RAG), а также рабочих процессов, управляемых агентами. Так как все данные остаются в Lakehouse, структурированные данные документа можно сразу же использовать для поиска, панелей мониторинга и приложений.