Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
El procesamiento inteligente de documentos (IDP) convierte contenido no estructurado (como archivos PDF, archivos DOCX, imágenes y presentaciones) en datos estructurados y enriquecidos que impulsan agentes, aplicaciones y análisis de nivel inferior.
Azure Databricks te ofrece dos formas de ejecutar IDP, ambas basadas en las mismas funciones de IA desarrolladas por investigación:
- Agent Bricks UI: Una experiencia visual sin código para analizar, extraer y clasificar documentos. Úsalo para probar documentos de muestra, refinar un esquema o etiquetas y validar visualmente los resultados antes de escalar.
- Funciones de IA para SQL: Ejecute funciones inteligentes para el procesamiento de documentos directamente en el Lakehouse. Úsalos para procesar documentos a gran escala, combinar etapas entre sí y crear canalizaciones con gobernanza y aptas para producción en Lakeflow Pipelines.
Capacidades inteligentes de procesamiento de documentos
| Capacidad | Interfaz de Agent Bricks | Función SQL |
|---|---|---|
| Convierta archivos PDF, DOCX, imágenes y PPT en texto estructurado, tablas y descripciones de figura. | Análisis de documentos | ai_parse_document |
| Extraiga campos estructurados de documentos o texto sin formato mediante un esquema que defina. | Extracción de información | ai_extract |
| Asigne categorías predefinidas a documentos o texto y admita hasta 500 etiquetas. | Clasificación | ai_classify |
| Transformar documentos analizados en fragmentos semánticos listos para generación aumentada de recuperación (RAG) e indexación de búsqueda por IA. |
ai_prep_search (Beta) |
Casos de uso comunes
IDP en Azure Databricks potencia una amplia gama de aplicaciones posteriores.
- Generación aumentada de recuperación (RAG): analiza y estructura documentos para mejorar la fragmentación, la calidad de recuperación y la base conceptual de las aplicaciones LLM.
- Extracción y análisis de conocimientos: extraiga los campos clave y los metadatos para habilitar la búsqueda, los informes y la inteligencia empresarial en los datos del documento.
- Flujos de trabajo controlados por agentes: enrutar, clasificar y enriquecer documentos para admitir la toma de decisiones automatizada y la ejecución de tareas.
- Descripción y clasificación de documentos: organice grandes corporas de documentos por tipo, tema o contenido para el procesamiento descendente.
Cómo funciona
Azure Databricks permite el procesamiento inteligente de documentos como un flujo de trabajo unificado de un extremo a otro en Lakehouse. La ingesta, el análisis, el enriquecimiento y el análisis de bajada se basan en una sola plataforma, por lo que cada fase funciona sin problemas sin necesidad de integración compleja ni movimiento de datos.
Ingesta y orquestación
Use canalizaciones de Lakeflow para ingerir documentos sin procesar (como archivos PDF, imágenes y archivos DOCX) y organizar las canalizaciones. Dado que la ingesta y la orquestación se integran de forma nativa con Lakehouse, los documentos fluyen directamente al procesamiento posterior sin infraestructura adicional.
Análisis de documentos (capa bronce)
Aplicar
ai_parse_documentpara convertir archivos sin procesar en representaciones estructuradas. Esto crea una capa de bronce estandarizada que captura texto, tablas/descripciones de imágenes y estructura de documentos, formando una base coherente para todos los casos de uso descendentes.Extracción y clasificación
Use
ai_extractyai_classifypara enriquecer documentos analizados con campos estructurados y metadatos. Estas funciones funcionan directamente en las salidas analizadas, lo que permite extraer información clave, clasificar documentos y enrutarlos a través de flujos de trabajo sin pasos de transformación adicionales.Preparación para la recuperación (RAG)
Aplique
ai_prep_search(Beta) para transformar documentos analizados en fragmentos semánticos enriquecidos con contexto de nivel de documento, como títulos, encabezados de sección y referencias de página. La salida está formateada para la indexación de AI Search, lo que proporciona una base coherente para las cargas de trabajo de RAG y recuperación.Análisis y puesta en funcionamiento
Aproveche funciones de IA adicionales u otras herramientas (paneles de IA/BI, aplicaciones, búsqueda de IA) para análisis, recuperación (RAG) y flujos de trabajo controlados por agentes. Dado que todos los datos permanecen en Lakehouse, los datos de documentos estructurados se pueden usar inmediatamente para la búsqueda, los paneles y las aplicaciones.