Procesamiento inteligente de documentos

El procesamiento inteligente de documentos (IDP) convierte contenido no estructurado (como archivos PDF, archivos DOCX, imágenes y presentaciones) en datos estructurados y enriquecidos que impulsan agentes, aplicaciones y análisis de nivel inferior.

Azure Databricks te ofrece dos formas de ejecutar IDP, ambas basadas en las mismas funciones de IA desarrolladas por investigación:

  • Agent Bricks UI: Una experiencia visual sin código para analizar, extraer y clasificar documentos. Úsalo para probar documentos de muestra, refinar un esquema o etiquetas y validar visualmente los resultados antes de escalar.
  • Funciones de IA para SQL: Ejecute funciones inteligentes para el procesamiento de documentos directamente en el Lakehouse. Úsalos para procesar documentos a gran escala, combinar etapas entre sí y crear canalizaciones con gobernanza y aptas para producción en Lakeflow Pipelines.

Capacidades inteligentes de procesamiento de documentos

Capacidad Interfaz de Agent Bricks Función SQL
Convierta archivos PDF, DOCX, imágenes y PPT en texto estructurado, tablas y descripciones de figura. Análisis de documentos ai_parse_document
Extraiga campos estructurados de documentos o texto sin formato mediante un esquema que defina. Extracción de información ai_extract
Asigne categorías predefinidas a documentos o texto y admita hasta 500 etiquetas. Clasificación ai_classify
Transformar documentos analizados en fragmentos semánticos listos para generación aumentada de recuperación (RAG) e indexación de búsqueda por IA. ai_prep_search (Beta)

Casos de uso comunes

IDP en Azure Databricks potencia una amplia gama de aplicaciones posteriores.

  • Generación aumentada de recuperación (RAG): analiza y estructura documentos para mejorar la fragmentación, la calidad de recuperación y la base conceptual de las aplicaciones LLM.
  • Extracción y análisis de conocimientos: extraiga los campos clave y los metadatos para habilitar la búsqueda, los informes y la inteligencia empresarial en los datos del documento.
  • Flujos de trabajo controlados por agentes: enrutar, clasificar y enriquecer documentos para admitir la toma de decisiones automatizada y la ejecución de tareas.
  • Descripción y clasificación de documentos: organice grandes corporas de documentos por tipo, tema o contenido para el procesamiento descendente.

Cómo funciona

Azure Databricks permite el procesamiento inteligente de documentos como un flujo de trabajo unificado de un extremo a otro en Lakehouse. La ingesta, el análisis, el enriquecimiento y el análisis de bajada se basan en una sola plataforma, por lo que cada fase funciona sin problemas sin necesidad de integración compleja ni movimiento de datos.

  1. Ingesta y orquestación

    Use canalizaciones de Lakeflow para ingerir documentos sin procesar (como archivos PDF, imágenes y archivos DOCX) y organizar las canalizaciones. Dado que la ingesta y la orquestación se integran de forma nativa con Lakehouse, los documentos fluyen directamente al procesamiento posterior sin infraestructura adicional.

  2. Análisis de documentos (capa bronce)

    Aplicar ai_parse_document para convertir archivos sin procesar en representaciones estructuradas. Esto crea una capa de bronce estandarizada que captura texto, tablas/descripciones de imágenes y estructura de documentos, formando una base coherente para todos los casos de uso descendentes.

  3. Extracción y clasificación

    Use ai_extract y ai_classify para enriquecer documentos analizados con campos estructurados y metadatos. Estas funciones funcionan directamente en las salidas analizadas, lo que permite extraer información clave, clasificar documentos y enrutarlos a través de flujos de trabajo sin pasos de transformación adicionales.

  4. Preparación para la recuperación (RAG)

    Aplique ai_prep_search (Beta) para transformar documentos analizados en fragmentos semánticos enriquecidos con contexto de nivel de documento, como títulos, encabezados de sección y referencias de página. La salida está formateada para la indexación de AI Search, lo que proporciona una base coherente para las cargas de trabajo de RAG y recuperación.

  5. Análisis y puesta en funcionamiento

    Aproveche funciones de IA adicionales u otras herramientas (paneles de IA/BI, aplicaciones, búsqueda de IA) para análisis, recuperación (RAG) y flujos de trabajo controlados por agentes. Dado que todos los datos permanecen en Lakehouse, los datos de documentos estructurados se pueden usar inmediatamente para la búsqueda, los paneles y las aplicaciones.