정보 추출

메모

이 페이지에서는 새 버전의 정보 추출에 대해 설명합니다. 이전 버전에 대한 자세한 내용은 정보 추출 사용(레거시)을 참조하세요.

정보 추출은 정의된 스키마를 사용하여 구조화되지 않은 문서와 텍스트를 키로 구조화된 인사이트를 변환합니다. 이렇게 하면 구조화되지 않은 텍스트, PDF, 이미지 또는 테이블에 포함된 정보를 분석, 보고 또는 다운스트림 에이전트 및 애플리케이션에 직접 사용할 수 있습니다.

정보 추출의 예는 다음과 같습니다.

  • 계약에서 법적 당사자 및 약관 추출.
  • 청구서에서 품목 및 결제 조건 추출
  • 의료 기록 및 메모에서 주요 세부 정보를 가져옵니다.

정보 추출은 AI 함수 ai_extract를 기반으로 합니다. 정보 추출에는 추출을 위해 정의된 스키마를 사용하여 함수를 사용자 지정하고 최적화하는 시각적 UI가 있습니다.

정보 추출은 기본 스토리지 를 사용하여 각 에이전트에 전원을 공급하는 임시 데이터 변환, 모델 검사점 및 내부 메타데이터를 저장합니다. 에이전트를 삭제하면 Databricks는 에이전트와 연결된 모든 데이터를 기본 스토리지에서 제거합니다.

Requirements

정보 추출 에이전트 만들기

에이전트 아이콘으로 이동합니다. 작업 영역의 왼쪽 탐색 창에 있는 에이전트입니다. 에이전트>정보 추출 만들기를 클릭합니다.

1단계. 정보를 추출할 데이터 선택

  1. 데이터 시작 페이지에서 정보를 추출할 파일 또는 데이터를 선택합니다. 다음 중 원하는 작업을 수행할 수 있습니다.

    • 하나 이상의 파일을 업로드 영역으로 끌어다 놓거나 클릭하여 업로드할 파일을 찾습니다.
    • 볼륨 선택을 클릭하여 지원되는 파일 형식의 Unity 카탈로그 볼륨을 선택합니다.
    • 테이블 선택을 클릭하여 텍스트 데이터가 포함된 Unity 카탈로그 테이블을 선택합니다.
  2. 테이블을 선택하는 경우 추출할 데이터가 포함된 열을 선택합니다. 계속하려면 먼저 STRING 또는 VARIANT와 같은 지원되는 형식의 열을 선택해야 합니다. 테이블에 지원되는 열이 없으면 다른 테이블을 선택합니다.

  3. 에이전트 만들기를 클릭합니다. 이 단추는 유효한 데이터 원본 및 테이블의 경우 지원되는 열을 선택한 후에만 사용할 수 있습니다.

2단계. 추출 스키마 구성 및 구체화

정보 추출에서 데이터를 처리한 후 문서에서 추출할 데이터를 구성하고 구체화합니다.

추출 스키마 구성 패널, 구문 분석된 문서 및 추출된 JSON 출력이 있는 AI 추출 빌드 뷰입니다.

  1. 구성에서 추출 스키마를 정의합니다. 이 작업을 수행하는 방법은 여러 가지입니다.

    • 추출하려는 정보를 설명하는 자연어를 입력하고 스키마 생성을 클릭합니다. 정보 추출은 필드 이름과 정의가 있는 JSON 스키마를 자동으로 생성합니다. 필요에 따라 이러한 설명을 편집합니다.
    • 대신, 스키마를 수동으로 정의하려면 또는 수동으로 정의를 클릭하십시오.
      1. 필드 추가를 클릭합니다.
      2. 필드 이름, 형식 및 설명을 입력합니다.
      3. 확인을 클릭합니다.
      4. 추출하려는 각 필드에 대해 반복합니다.
      5. 저장 및 실행 추출을 클릭합니다.
    • JSON을 클릭하여 JSON 스키마를 직접 편집할 수도 있습니다. 완료되면 변경 내용 적용 을 클릭합니다.

    스키마를 업데이트하고 저장을 클릭하고 추출을 실행할 때마다 정보 추출은 추출 에이전트를 업데이트하고 추출을 실행하며 각 입력에 대한 결과를 표시합니다.

  2. 왼쪽에서 구문 분석된 문서와 에이전트의 추출을 검토합니다. 두 가지 방법으로 추출 결과를 반복합니다. 먼저 저장을 누르 고 추출을 실행할 때 설명을 자동으로 조정하는 하나 이상의 입력에 대한 자연어 피드백을 제공합니다. 둘째, 저장을 누르 고 추출을 실행할 때 적용되는 스키마 설명을 수동으로 수정합니다.

  3. 버전을 사용하여 이전 구성을 비교하거나 되돌릴 수 있습니다. 버전을 클릭한 다음 비교를 클릭하여 이전 버전의 스키마 정의를 현재 버전과 비교합니다. 복원을 클릭하여 이전 버전을 복원합니다.

3단계. 추출 품질 평가 및 개선

에이전트의 성능을 측정하고 체계적으로 개선하려면 레이블이 지정된 데이터 세트에 대해 에이전트를 평가합니다. 평가는 알려진 정답(지상 진리)에 대해 각 추출 점수를 매겨 버전 간에 필드 수준 정확도를 추적하고 작업이 필요한 필드를 대상으로 지정할 수 있습니다.

평가 데이터 세트 추가

평가를 실행하기 전에 Unity 카탈로그에 평가 데이터 세트가 있어야 합니다. 데이터 세트는 두 개의 열이 있는 Unity 카탈로그 테이블이어야 합니다.

  • 추출할 텍스트 또는 문서가 있는 입력 열 입니다. 이는 STRING텍스트 또는 ai_parse_documentVARIANT출력일 수 있습니다.
  • 예상 추출 결과를 JSON 문자열로 포함하는 정답 열입니다. 각 값은 에이전트의 추출 스키마를 준수해야 하며, 이는 ai_extract고급 스키마와 일치해야 합니다.

평가 실행

추출 에이전트에 대한 평가를 실행하려면 다음을 수행합니다.

  1. 워크벤치에서 평가 드롭다운을 열고 평가 실행을 클릭합니다. 그러면 평가 실행 만들기 대화 상자가 열립니다.
  2. 평가 데이터 세트 테이블에서 레이블이 지정된 예제를 포함하는 Unity 카탈로그 테이블을 선택합니다.
  3. 열 매핑 아래에서 에이전트 입력을 포함하는 입력 열과 예상 응답을 포함하는 Ground 진리 열을 선택합니다.
  4. 평가 실행을 클릭합니다. 정보 추출은 현재 구성을 새 버전으로 저장하고 각 행을 해당 정답 데이터와 비교하여 점수를 매깁니다.

평가 결과 검토

실행이 진행됨에 따라 문서가 문서 탭으로 스트리밍되고 문서당 일치하지 않는 필드가 표시됩니다. 실행이 완료되면 정보 추출에 다음이 포함된 개요 탭이 표시됩니다.

  • 전체 필드 정확도완전히 올바른 문서가 있는 점수표입니다. 이전 평가 실행이 있는 경우 성과 기록표에 해당 실행의 변경 내용이 표시됩니다.
  • 필드별 점수 테이블입니다. 임의의 필드를 클릭하여 정확도, 정밀도, 재현율 및 F1을 표시하는 드릴다운을 엽니다. 실패한 문서 표시를 클릭하여 해당 필드를 추출하지 못한 각 문서와 추출된 출력을 확인합니다.

전체 필드 정확도 성과 기록표 및 필드별 점수 테이블을 보여 주는 평가 개요 탭입니다.

문서 탭으로 전환하여 개별 문서를 검사합니다. 각 행에는 일치하는 필드의 비율과 일치하지 않는 필드가 표시됩니다. 필드 드롭다운을 사용하여 일치하지 않는 특정 필드가 있는 문서를 필터링합니다. 문서를 클릭하여 에이전트의 응답과 정답을 나란히 비교하세요.

스키마를 구체화하여 반복한 다음 평가 실행을 다시 클릭하여 변경 내용이 점수에 미치는 영향을 확인합니다.

4단계. 추출제 사용

에이전트의 성능에 만족하면 에이전트를 사용하여 정보를 추출합니다.

오른쪽 위에서 에이전트 사용을 클릭합니다. 다음 중 하나를 선택할 수 있습니다.

  • SQL에서 실행 하여 에이전트를 사용하여 모든 데이터에서 정보를 추출합니다. 그러면 정의된 스키마를 사용하여 볼륨 또는 테이블에서 정보를 추출하는 데 사용하는 ai_extract SQL 쿼리가 열립니다. SQL 쿼리에서 사용하는 ai_extract 방법에 대한 자세한 내용은 함수를 참조ai_extract하세요.
  • 새 데이터에 대해 에이전트를 호출하도록 예약된 간격으로 실행되는 Lakeflow 파이프라인을 생성합니다. 그러면 추출된 데이터로 스트리밍 테이블을 업데이트하는 Lakeflow 파이프라인이 만들어집니다. 새 데이터가 도착할 때 실행되도록 파이프라인의 일정을 구성할 수 있습니다. Lakeflow 파이프라인에 대한 자세한 내용은 Spark 선언적 파이프라인을 참조하세요.

Limitations

  • 정보 추출 에이전트의 최대 컨텍스트 길이는 128k입니다.
  • 공용 구조체 스키마 형식은 지원되지 않습니다.