利用 AI/LLM 將文件內容分類為所提供的標籤之一。
關於對應的 Databricks SQL 函式,請參見 ai_classify 函數。
語法
from pyspark.sql import functions as dbf
dbf.ai_classify(col=<col>, labels=<labels>, options=<options>)
Parameters
| 參數 | 類型 | Description |
|---|---|---|
col |
pyspark.sql.Column 或 str |
一欄包含要分類的文件內容。 |
labels |
list、dict、pyspark.sql.Column或 str |
可以是字面標籤集(Python 標籤字串清單,或是將標籤名稱映射到描述的字典,自動序列化成 JSON 字面),或是欄位表達式,其每列值為 JSON 標籤字串陣列,或是將標籤名稱映射到描述的 JSON 物件。 |
options |
dict可選的 |
控制分類行為的選項詞典。 |
Returns
pyspark.sql.Column:一個包含分類結果的新欄位。
預設行為為單一標籤分類。 若要啟用多標籤分類並查看完整支援的選項,請參閱 SQL 語言手冊。
Examples
# Static labels (same set for every row)
df.select(ai_classify("text", ["positive", "negative", "neutral"]))
df.select(ai_classify("text", {"positive": "Happy tone", "negative": "Unhappy tone"}))
# Per-row labels (a column whose value is a JSON array or JSON object string)
df.select(ai_classify("text", col("labels_json")))