ai_classify

利用 AI/LLM 將文件內容分類為所提供的標籤之一。

關於對應的 Databricks SQL 函式,請參見 ai_classify 函數

語法

from pyspark.sql import functions as dbf

dbf.ai_classify(col=<col>, labels=<labels>, options=<options>)

Parameters

參數 類型 Description
col pyspark.sql.Columnstr 一欄包含要分類的文件內容。
labels listdictpyspark.sql.Columnstr 可以是字面標籤集(Python 標籤字串清單,或是將標籤名稱映射到描述的字典,自動序列化成 JSON 字面),或是欄位表達式,其每列值為 JSON 標籤字串陣列,或是將標籤名稱映射到描述的 JSON 物件。
options dict可選的 控制分類行為的選項詞典。

Returns

pyspark.sql.Column:一個包含分類結果的新欄位。

預設行為為單一標籤分類。 若要啟用多標籤分類並查看完整支援的選項,請參閱 SQL 語言手冊

Examples

# Static labels (same set for every row)
df.select(ai_classify("text", ["positive", "negative", "neutral"]))
df.select(ai_classify("text", {"positive": "Happy tone", "negative": "Unhappy tone"}))

# Per-row labels (a column whose value is a JSON array or JSON object string)
df.select(ai_classify("text", col("labels_json")))