ai_classify

Classifie le contenu du document en une des étiquettes fournies à l’aide de l’IA/LLM.

Pour obtenir plus de détails sur la fonction SQL de Databricks correspondante, consultez ai_classify.

Syntax

from pyspark.sql import functions as dbf

dbf.ai_classify(col=<col>, labels=<labels>, options=<options>)

Parameters

Parameter Type Description
col pyspark.sql.Column ou str Colonne contenant le contenu du document à classifier.
labels list, dict, pyspark.sql.Column, ou str Un ensemble d’étiquettes littérales (Python liste de chaînes d’étiquettes ou des noms d’étiquettes de mappage de dictés à des descriptions, sérialisés automatiquement vers un littéral JSON) ou une expression de colonne dont la valeur par ligne est un tableau JSON de chaînes d’étiquettes ou un nom d’étiquette de mappage d’objets JSON à des descriptions.
options dictoptionnel Dictionnaire d’options permettant de contrôler le comportement de classification.

Returns

pyspark.sql.Column: nouvelle colonne contenant le résultat de classification.

Le comportement par défaut est la classification à étiquette unique. Pour activer la classification multi-étiquette et afficher l’ensemble complet d’options prises en charge, consultez le manuel du langage SQL.

Exemples

# Static labels (same set for every row)
df.select(ai_classify("text", ["positive", "negative", "neutral"]))
df.select(ai_classify("text", {"positive": "Happy tone", "negative": "Unhappy tone"}))

# Per-row labels (a column whose value is a JSON array or JSON object string)
df.select(ai_classify("text", col("labels_json")))