Extracción de información

Note

En esta página se describe la nueva versión de Extracción de información. Para obtener información sobre la versión anterior, vea Uso de Extracción de Información (heredado)

La extracción de información transforma documentos y texto no estructurados en información estructurada clave mediante un esquema definido. Esto le permite usar directamente información contenida en texto no estructurado, PDF, imágenes o tablas para su análisis, la elaboración de informes o su uso en agentes y aplicaciones posteriores.

Entre los ejemplos de extracción de información se incluyen:

  • Extracción de las partes legales y las condiciones de los contratos.
  • Extracción de partidas y condiciones de pago de las facturas.
  • Extraer detalles clave de los registros médicos y las notas.

La extracción de información se basa en la función ai_extractde IA . La extracción de información tiene una interfaz de usuario visual para personalizar y optimizar la función con un esquema definido para la extracción.

La extracción de información usa el almacenamiento predeterminado para almacenar transformaciones de datos temporales, puntos de control de modelo y metadatos internos que potencian a cada agente. Al eliminar un agente, Databricks quita todos los datos asociados al agente del almacenamiento predeterminado.

Requirements

Creación de un agente de extracción de información

Vaya al icono Agentes.Agentes en el panel de navegación izquierdo del área de trabajo. Haga clic en Crear Agente>Extracción de Información.

Paso 1. Seleccione los datos para extraer información.

  1. En la página Inicio con los datos , seleccione los archivos o datos de los que desea extraer información. Puede realizar cualquiera de las siguientes acciones:

    • Arrastre y coloque uno o varios archivos en el área de carga o haga clic para buscar archivos que se van a cargar.
    • Haga clic en Seleccionar volumen para seleccionar un volumen de Catálogo de Unity con tipos de archivo admitidos.
    • Haga clic en Seleccionar tabla para seleccionar una tabla de Catálogo de Unity que contenga datos de texto.
  2. Si selecciona una tabla, seleccione la columna de la que se van a extraer los datos. Debe seleccionar una columna con un tipo admitido, como STRING o VARIANT, para poder continuar. Si la tabla no tiene columnas admitidas, seleccione otra tabla.

  3. Haga clic en Crear agente. Este botón solo se habilita después de seleccionar un origen de datos válido y, para una tabla, una columna admitida.

Paso 2. Configuración y refinación del esquema de extracción

Después de que la extracción de información procese los datos, configure y afina los datos que desea extraer de los documentos.

La vista de compilación de AI Extract con el panel de configuración del esquema de extracción, el documento procesado y el resultado JSON extraído.

  1. En Configuración, defina el esquema de extracción. Esto se puede hacer de varias maneras:

    • Escriba lenguaje natural que describa la información que desea extraer y haga clic en Generar esquema. La extracción de información genera automáticamente un esquema JSON con los nombres y las definiciones de los campos para ti. Edite estas descripciones según sea necesario.
    • Como alternativa, haga clic en O, Definir manualmente para definir manualmente el esquema:
      1. Haga clic en Agregar campo.
      2. Escriba el nombre, el tipo y la descripción del campo.
      3. Haga clic en Confirmar.
      4. Repita para cada campo que quiera extraer.
      5. Haga clic en Guardar y ejecutar extracción.
    • También puede hacer clic en JSON para editar el esquema JSON directamente. Haga clic en Aplicar cambios cuando haya finalizado.

    Cada vez que actualice el esquema y haga clic en Guardar y ejecutar la extracción, La extracción de información actualiza el agente de extracción, ejecuta la extracción y muestra los resultados de cada entrada.

  2. A la izquierda, revise el documento analizado y la extracción del agente. Repita los resultados de la extracción de dos maneras. En primer lugar, proporcione comentarios de lenguaje natural sobre una o varias entradas, que optimizan automáticamente las descripciones al presionar Guardar y ejecutar la extracción. En segundo lugar, revise manualmente las descripciones del esquema, que surten efecto al presionar Guardar y ejecutar la extracción.

  3. Use versiones para comparar o revertir a una configuración anterior. Haga clic en Versiones y, a continuación, haga clic en Comparar para comparar la definición de esquema de una versión anterior con la versión actual. Haga clic en Restaurar para restaurar una versión anterior.

Paso 3. Evaluación y mejora de la calidad de extracción

Para medir el rendimiento de su agente y mejorarlo sistemáticamente, evalúe su agente con un conjunto de datos etiquetado. Una evaluación compara cada extracción con un valor de referencia correcto conocido, de modo que puedes hacer un seguimiento de la precisión a nivel de campo en distintas versiones y centrarte en los campos que necesitan mejoras.

Adición de un conjunto de datos de evaluación

Antes de ejecutar una evaluación, debe tener un conjunto de datos de evaluación en el catálogo de Unity. El conjunto de datos debe ser una tabla de Catálogo de Unity con dos columnas:

  • Columna de entrada con el texto o documento del que se va a extraer. Puede ser STRING texto o la VARIANT salida de ai_parse_document.
  • Una columna de valor de referencia con el resultado de extracción esperado en forma de cadena JSON. Cada valor debe ajustarse al esquema de extracción de su agente, conforme al ai_extract esquema avanzado.

Ejecución de una evaluación

Para ejecutar una evaluación de tu agente de extracción:

  1. En workbench, abra la lista desplegable de evaluación y haga clic en Ejecutar evaluación. Esto abre el cuadro de diálogo Crear ejecución de evaluación.
  2. En tabla del conjunto de datos de evaluación, seleccione la tabla de Unity Catalog que contiene sus ejemplos etiquetados.
  3. En Asignación de columnas, seleccione la columna de entrada que contiene la entrada del agente y la columna de referencia que contiene la respuesta esperada.
  4. Haga clic en Ejecutar evaluación. La extracción de información guarda la configuración actual como una nueva versión y puntúa cada fila con respecto a su verdad básica.

Revisión de los resultados de la evaluación

A medida que avanza la ejecución, los documentos se transmiten a la pestaña Documentos y se muestran los campos no coincidentes por documento. Cuando finalice la ejecución, Extracción de información muestra la pestaña Información general , que incluye:

  • Cuadro de mandos con precisión general del campo y Documentos totalmente correctos. Si existe una ejecución anterior de la evaluación, la tarjeta de puntuación muestra el cambio con respecto a esa ejecución.
  • Una tabla de puntuaciones por campo . Haga clic en cualquier campo para abrir su exploración en profundidad, que muestra la precisión, la precisión, la recuperación y F1. Haga clic en Mostrar documentos con errores para ver cada documento que no pudo extraer ese campo y su salida extraída.

Pestaña Resumen de evaluación que muestra la precisión global de los campos, los documentos completamente correctos, las recomendaciones de Genie Code y la tabla de puntuaciones por campo.

Cambie a la pestaña Documentos para inspeccionar documentos individuales. Cada fila muestra la proporción de campos coincidentes y los campos que no coinciden. Use la lista desplegable Campos para filtrar los documentos que tenían un campo no coincidente específico. Haga clic en un documento para comparar la respuesta del agente con la referencia correcta uno al lado del otro.

Aplicar correcciones de código de Genie

Una vez finalizada una ejecución, la extracción de información analiza los resultados y expone los problemas en las recomendaciones de Genie Code, clasificados por número de documentos afectados. Cada hallazgo describe un posible problema de calidad. Haga clic en Corregir con Genie para abrir un chat interactivo de Genie Code que propone cambios de esquema e instrucciones, los valida con los documentos afectados y ofrece volver a ejecutar una evaluación completa.

Panel de Genie Code que muestra los cambios propuestos en el esquema y las instrucciones, validados frente a los documentos afectados.

Paso 4. Usa tu agente de extracción

Una vez que esté satisfecho con el rendimiento del agente, use el agente para extraer información.

Haz clic en Usar agente en la esquina superior derecha. Puede seleccionar una de las dos opciones siguientes:

  • Ejecute una consulta en SQL utilizando el agente para extraer información de todos sus datos. Se abre una consulta SQL que usa ai_extract para extraer información del volumen o tabla mediante el esquema definido. Para obtener más información sobre el uso ai_extract en consultas SQL, vea ai_extract Function.
  • Cree un pipeline de Lakeflow que se ejecute a intervalos programados para invocar a su agente con datos nuevos. Esto crea un pipeline de Lakeflow que actualiza una tabla de streaming con los datos extraídos. Puede configurar la programación de la canalización para que se ejecute cuando llegan nuevos datos. Para más información sobre las canalizaciones de Lakeflow, consulte Canalizaciones declarativas de Spark.

Limitations

  • Los agentes de extracción de información tienen una longitud máxima de contexto del token de 128k.
  • No se admiten los tipos de esquema de unión.