AI/LLM을 사용하여 문서 열에서 구조화된 데이터를 추출합니다.
해당 Databricks SQL 함수에 대해 알아보려면 ai_extract 함수를 참조하세요.
Syntax
from pyspark.sql import functions as dbf
dbf.ai_extract(col=<col>, schema=<schema>, options=<options>)
Parameters
| 매개 변수 | Type | 설명 |
|---|---|---|
col |
pyspark.sql.Column 또는 str |
추출할 문서 내용이 포함된 열입니다. |
schema |
dict 또는 list |
Python 받아쓰기(필드 이름) {"type": ..., "description": ...}또는 필드 이름 문자열 목록입니다. JSON 리터럴로 자동으로 직렬화됩니다. |
options |
dict선택적 |
추출 동작을 제어하는 옵션 사전입니다. |
Returns
pyspark.sql.Column: 추출된 필드를 포함하는 VariantType의 새 열입니다.
예제
df.select(ai_extract("text", {"name": {"type": "string", "description": "Name"}}))
df.select(ai_extract("text", ["name", "age"]))