Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Note
Esta página cobre a nova versão do Information Extraction. Para informações sobre a versão anterior, veja Extração de Informação de Uso (legado)
A Extração de Informação transforma documentos e textos não estruturados em insights essenciais e estruturados, utilizando um esquema definido. Isto permite-lhe usar informação incorporada em texto não estruturado, PDFs, imagens ou tabelas diretamente para análise, relatórios ou agentes e aplicações a jusante.
Exemplos de Extração de Informação incluem:
- Extrair termos e partes legais dos contratos.
- Extração de linhas de itens e condições de pagamento das faturas.
- Retirar detalhes importantes de registos médicos e notas.
A extração de informação é construída sobre a função ai_extractde IA. O Information Extraction tem uma interface visual para personalizar e otimizar a função com um esquema definido para extração.
A Extração de Informação utiliza armazenamento padrão para armazenar transformações temporárias de dados, pontos de verificação do modelo e metadados internos que suportam cada agente. Quando elimina um agente, o Databricks remove todos os dados associados ao agente do armazenamento padrão.
Requerimentos
- Um espaço de trabalho que inclui o seguinte:
- Computação sem servidor habilitada. Consulte Requisitos de computação sem servidor.
- Catálogo Unity ativado. Consulte Habilitar um espaço de trabalho para o Unity Catalog.
- Acesso a uma política de utilização sem servidor com um orçamento superior a zero.
- Esta função está disponível apenas em algumas regiões, veja disponibilidade de funções de IA.
- Para espaços de trabalho com o suplemento Enhanced Security and Compliance,
- Consulte o suporte regional relativamente a
ai_extractpara a norma de conformidade adequada. - Consulte Gerir as pré-visualizações do Azure Databricks para saber como ativá-lo no seu espaço de trabalho.
- Consulte o suporte regional relativamente a
- Capacidade de usar a
ai_extractfunção SQL. - Dados não estruturados dos quais queres extrair informação. Os dados devem estar num volume ou tabela do Catálogo Unity.
- Para construir o teu agente, tens de ter pelo menos 1 ficheiro no volume do Unity Catalog ou 1 linha na tua tabela.
Criar um agente de Extração de Informação
Vá para o Agentes no painel de navegação esquerdo do seu espaço de trabalho. Clique Criar Agente>Extração de Informação.
Passo 1. Selecione os dados para extrair informação de
Na página Começar com os seus dados , selecione os ficheiros ou dados de onde quer extrair informação. Pode fazer qualquer uma das seguintes opções:
- Arraste e larga um ou mais ficheiros na área de carregamento, ou clica para procurar ficheiros para carregar.
- Clique em Selecionar volume para selecionar um volume do Catálogo Unity com tipos de ficheiro suportados.
- Clique em Selecionar tabela para selecionar uma tabela do Unity Catalog que contenha dados de texto.
Se selecionares uma tabela, seleciona a coluna que contém os dados a extrair. Deve selecionar uma coluna com um tipo suportado, como STRING ou VARIANT, antes de poder continuar. Se a tabela não tiver colunas suportadas, selecione uma tabela diferente.
Clique em Criar agente. Este botão só é ativado depois de selecionar uma fonte de dados válida e, para uma tabela, uma coluna suportada.
Passo 2. Configura e refina o teu esquema de extração
Depois de a Information Extraction processar os seus dados, configure e refine os dados que pretende extrair dos seus documentos.
Em Configuração, defina o seu esquema de extração. Há várias maneiras de fazer isso:
- Introduza uma linguagem natural que descreva a informação que quer extrair e clique em Gerar Esquema. A Extração de Informação gera automaticamente um esquema JSON com nomes de campos e definições para si. Edite estas descrições conforme necessário.
- Alternativamente, clique em Ou, Definir manualmente para definir manualmente o seu esquema:
- Clica em Adicionar campo.
- Introduza o nome do seu campo, tipo e descrição.
- Clique em Confirmar.
- Repete para cada campo que queres extrair.
- Clique em Guardar e Executar extração.
- Também pode clicar em JSON para editar diretamente o esquema JSON. Clique em Aplicar Alterações quando estiver concluído.
Cada vez que atualiza o seu esquema e clica em Guardar e executar extração, o Information Extraction atualiza o agente de extração, executa a extração e mostra os resultados de cada entrada.
À esquerda, revise o documento analisado e a extração realizada pelo agente. Iterar os resultados da extração de duas formas. Primeiro, forneça feedback em linguagem natural sobre uma ou mais entradas, o que ajusta automaticamente as suas descrições quando carrega em Guardar e executa extração. Segundo, revise manualmente as descrições dos esquemas, que entram em vigor quando carrega em Guardar e executa a extração.
Use versões para comparar ou voltar a uma configuração anterior. Clique em Versões, depois clique em Comparar para comparar a definição do esquema de uma versão anterior com a atual. Clique em Restaurar para restaurar uma versão anterior.
Passo 3. Avaliar e melhorar a qualidade da extração
Para medir o desempenho do seu agente e melhorá-lo sistematicamente, avalie-o em relação a um conjunto de dados rotulado. Numa avaliação, cada extração é pontuada em relação a uma resposta correta conhecida (verdade de referência), para que possa acompanhar a precisão ao nível dos campos entre versões e identificar os campos que precisam de ser melhorados.
Adicionar um conjunto de dados de avaliação
Antes de realizar uma avaliação, precisa de ter um conjunto de dados de avaliação no Unity Catalog. O conjunto de dados deve ser uma tabela do Catálogo Unity com duas colunas:
- Uma coluna de entrada com o texto ou documento para extrair. Isto pode ser
STRINGtexto ou aVARIANTsaída deai_parse_document. - Uma coluna de referência com o resultado esperado da extração sob a forma de uma cadeia JSON. Cada valor deve conformar-se ao esquema de extração do seu agente, correspondendo ao
ai_extractesquema avançado.
Faça uma avaliação
Para realizar uma avaliação do seu agente de extração:
- Na bancada de trabalho, abra o menu suspenso da avaliação e clique em Executar avaliação. Abre o diálogo Criar execução de avaliação.
- Na tabela do conjunto de dados de avaliação, selecione a tabela do Catálogo Unity que contém os seus exemplos rotulados.
- Em Mapeamento de colunas, selecione a coluna de entrada que contém a entrada do agente e a coluna de referência que contém a resposta esperada.
- Clique em Executar avaliação. A Extração de Informação guarda a configuração atual numa nova versão e pontua cada linha com a sua veracidade fundamental.
Rever os resultados da avaliação
À medida que a corrida avança, os documentos fluem para o separador Documentos e quaisquer campos incompatíveis são mostrados por documento. Quando a corrida termina, a Extração de Informação mostra o separador Visão Geral , que inclui:
- Um cartão de resultados com precisão global dos campos e documentos integralmente corretos. Se existir uma corrida de avaliação anterior, o cartão de pontuação mostra a mudança em relação a essa corrida.
- Uma tabela de pontuações por campo . Clique em qualquer campo para abrir a respetiva desagregação, que mostra exatidão, precisão, revocação e F1. Clique em Mostrar documentos falhados para ver cada documento que não extraiu esse campo e a sua saída extraída.
Mude para o separador Documentos para inspecionar documentos individuais. Cada linha mostra a proporção entre os campos combinados e os campos que foram desalinhados. Utilize o menu suspenso Campos para filtrar os documentos que tinham um campo específico não correspondente. Clique num documento para comparar a resposta do agente com a verdade no terreno, lado a lado.
Itere refinando o seu esquema, depois clique novamente em Executar avaliação para ver como as suas alterações afetaram as pontuações.
Passo 4: Use o seu agente de extração
Depois de ficares satisfeito com o desempenho do agente, usa-o para extrair informação.
Clique em Usar Agente no canto superior direito. Você pode selecionar:
-
Executa em SQL para usar o agente e extrair informação de todos os teus dados. Isto abre uma consulta SQL que utiliza
ai_extractpara extrair informações do seu volume ou tabela usando o esquema definido. Para mais informações sobre a utilizaçãoai_extractem consultas SQL, vejaai_extractfunção. - Crie uma canalização do Lakeflow que seja executada em intervalos agendados para invocar o seu agente com novos dados. Isto cria um pipeline Lakeflow que atualiza uma tabela de streaming com os seus dados extraídos. Pode configurar o calendário do pipeline para correr quando chegarem novos dados. Para mais informações sobre oleodutos Lakeflow, consulte Spark Declarative Pipelines.
Limitations
- Os agentes de extração de informações têm um contexto de token com um comprimento máximo de 128k.
- Não há suporte para tipos de esquema de união.