Extrahering av information

Note

Den här sidan beskriver den nya versionen av informationsextrahering. Information om den tidigare versionen finns i Använda informationsextrahering (äldre)

Informationsextrahering omvandlar ostrukturerade dokument och text till viktiga, strukturerade insikter med hjälp av ett definierat schema. På så sätt kan du använda information som är inbäddad i ostrukturerad text, PDF-filer, bilder eller tabeller direkt för analys, rapportering eller underordnade agenter och program.

Exempel på extrahering av information är:

  • Extrahera juridiska parter och avtalsvillkor.
  • Extrahera rader och betalningsvillkor från fakturor.
  • Hämta viktiga detaljer från medicinska journaler och anteckningar.

Informationsextrahering bygger på AI-funktionen ai_extract. Extrahering av information har ett visuellt användargränssnitt för att anpassa och optimera funktionen med ett definierat schema för extrahering.

Extrahering av information använder standardlagring för att lagra tillfälliga datatransformeringar, modellkontrollpunkter och interna metadata som driver varje agent. När du tar bort en agent tar Databricks bort alla data som är associerade med agenten från standardlagringen.

Kravspecifikation

Skapa en informationsextraheringsagent

Gå till agentikonen.Agenter i det vänstra navigeringsfönstret på arbetsytan. Klicka på Skapa agent>Informationsextraktion.

Steg 1. Välj de data som du vill extrahera information från

  1. På sidan Börja med dina data väljer du de filer eller data som du vill extrahera information från. Du kan göra något av följande:

    • Dra och släpp en eller flera filer i uppladdningsområdet eller klicka för att bläddra efter filer som ska laddas upp.
    • Klicka på Välj volym för att välja en Unity Catalog-volym med filtyper som stöds.
    • Klicka på Välj tabell för att välja en Unity Catalog-tabell som innehåller textdata.
  2. Om du väljer en tabell väljer du den kolumn som innehåller de data som du vill extrahera från. Du måste välja en kolumn med en typ som stöds, till exempel STRING eller VARIANT, innan du kan fortsätta. Om tabellen inte har några kolumner som stöds väljer du en annan tabell.

  3. Klicka på Skapa agent. Den här knappen aktiveras endast när du har valt en giltig datakälla och, för en tabell, en kolumn som stöds.

Steg 2. Konfigurera och förfina extraheringsschemat

När informationsextrahering har bearbetat dina data konfigurerar och förfinar du vilka data du vill extrahera från dina dokument.

Vyn AI Extract build med konfigurationspanelen för extraheringsschemat, det tolkade dokumentet och de extraherade JSON-utdata.

  1. Under konfigurationen ska du definiera din extraheringsschema. Det finns flera sätt att göra detta:

    • Ange naturligt språk som beskriver den information som du vill extrahera och klicka på Generera schema. Extrahering av information genererar automatiskt ett JSON-schema med fältnamn och definitioner åt dig. Redigera dessa beskrivningar efter behov.
    • Du kan också klicka på Eller, Definiera manuellt för att manuellt definiera schemat:
      1. Klicka på Lägg till fält.
      2. Ange fältnamn, typ och beskrivning.
      3. Klicka på Bekräfta.
      4. Upprepa för varje fält som du vill extrahera.
      5. Klicka på Spara och kör extrahering.
    • Du kan också klicka på JSON för att redigera JSON-schemat direkt. Klicka på Tillämpa ändringar när du är klar.

    Varje gång du uppdaterar schemat och klickar på Spara och kör extrahering uppdaterar informationsextraheringsagenten, kör extraheringen och visar resultatet för varje indata.

  2. Till vänster, granska det tolkade dokumentet och den av agenten gjorda extraktionen. Iterera extraheringsresultatet på två sätt. Börja med att ge feedback om naturligt språk på en eller flera indata, som automatiskt justerar dina beskrivningar när du trycker på Spara och kör extrahering. För det andra ändrar du schemabeskrivningarna manuellt, vilket träder i kraft när du trycker på Spara och kör extrahering.

  3. Använd versioner för att jämföra eller återgå till en tidigare konfiguration. Klicka på Versioner och klicka sedan på Jämför för att jämföra schemadefinitionen för en tidigare version med den aktuella versionen. Klicka på Återställ för att återställa en tidigare version.

Steg 3. Utvärdera och förbättra extraheringskvaliteten

Om du vill mäta hur bra agenten presterar och förbättra den systematiskt utvärderar du agenten mot en märkt datauppsättning. En utvärdering poängsätter varje extrahering mot ett känt korrekt svar (grundsanning), så att du kan spåra noggrannhet på fältnivå mellan versioner och rikta in dig på de fält som behöver arbete.

Lägga till en utvärderingsdatauppsättning

Innan du kör en utvärdering måste du ha en utvärderingsdatauppsättning i Unity Catalog. Datauppsättningen måste vara en Unity Catalog-tabell med två kolumner:

  • En indatakolumn med texten eller dokumentet att extrahera från. Det kan vara STRING text eller utdata från VARIANTai_parse_document .
  • En grundsanningskolumn med det förväntade extraheringsresultatet som en JSON-sträng. Varje värde måste överensstämma med agentens extraheringsschema som matchar det ai_extract avancerade schemat.

Köra en utvärdering

Att köra en utvärdering för din extraheringsagent:

  1. Öppna listrutan för utvärdering i workbench och klicka på Kör utvärdering. Då öppnas dialogrutan Skapa utvärderingskörning .
  2. I tabellen Utvärderingsdatauppsättning väljer du tabellen Unity Catalog som innehåller dina märkta exempel.
  3. Under Kolumnmappning väljer du den indatakolumn som innehåller agentindata och kolumnen Ground truth som innehåller det förväntade svaret.
  4. Klicka på Kör utvärdering. Information Extrahering sparar den aktuella konfigurationen som en ny version och poängsätter varje rad mot dess grundsanning.

Granska resultatet från utvärderingen

När körningen fortskrider strömmas dokument till fliken Dokument och eventuella fält som inte matchar visas per dokument. När körningen har slutförts visas fliken Översikt, i Information Extraction, som innehåller:

  • Ett resultatkort med Övergripande fältnoggrannhet och Dokument som är helt korrekta. Om det finns en tidigare utvärderingskörning visar styrkortet ändringen från den körningen.
  • En poängtabell per fält . Klicka på valfritt fält för att öppna detaljvyn, som visar träffsäkerhet, precision, täckning och F1. Klicka på Visa misslyckade dokument för att se varje dokument som inte kunde extrahera fältet och deras extraherade utdata.

Fliken Utvärderingsöversikt som visar övergripande fältnoggrannhet, dokument som är helt korrekta, Genie Code-rekommendationer och poängtabellen per fält.

Växla till fliken Dokument för att granska enskilda dokument. Varje rad visar förhållandet mellan matchade fält och de fält som inte matchades. Använd listrutan Fält för att filtrera på dokument som har ett specifikt fält som inte stämmer överens. Klicka på ett dokument för att jämföra agentsvaret med den grundläggande sanningen sida vid sida.

Tillämpa Genie Code-korrigeringar

När en körning har slutförts analyserar Information Extraction resultaten och identifierar problem i Genie Code-rekommendationer, rangordnade efter antalet berörda dokument. Varje resultat beskriver ett potentiellt kvalitetsproblem. Klicka på Åtgärda med Genie för att öppna en interaktiv Genie Code-chatt som föreslår schema- och instruktionsändringar, validerar dem mot de berörda dokumenten och erbjuder sig att köra en fullständig utvärdering igen.

Genie Code-panelen som visar föreslagna schema- och instruktionsändringar som verifieras mot berörda dokument.

Steg 4. Använd din extraheringsagent

När du är nöjd med agentens prestanda använder du agenten för att extrahera information.

Klicka på Använd agent i det övre högra hörnet. Du kan välja något av följande:

  • Kör i SQL för att använda agenten för att extrahera information från alla dina data. Då öppnas en SQL-fråga som använder ai_extract för att extrahera information från volymen eller tabellen med hjälp av det definierade schemat. Mer information om hur du använder ai_extract i SQL-frågor finns i ai_extract funktion.
  • Skapa en Lakeflow-pipeline som körs enligt schemalagda intervall för att anropa din agent på nya data. Detta skapar en Lakeflow-pipeline som uppdaterar en strömmande tabell med dina extraherade data. Du kan konfigurera pipelinens schema så att det körs när nya data kommer. Mer information om Lakeflow-pipelines finns i Deklarativa Spark-pipelines.

Limitations

  • Informationsextraheringsagenter har en maximal kontextlängd på 128 000 token.
  • Union-schematyper stöds inte.