Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Classifie le contenu du document en une des étiquettes fournies à l’aide de l’IA/LLM.
Pour obtenir plus de détails sur la fonction SQL de Databricks correspondante, consultez ai_classify.
Syntax
from pyspark.sql import functions as dbf
dbf.ai_classify(col=<col>, labels=<labels>, options=<options>)
Parameters
| Parameter | Type | Description |
|---|---|---|
col |
pyspark.sql.Column ou str |
Colonne contenant le contenu du document à classifier. |
labels |
list, dict, pyspark.sql.Column, ou str |
Un ensemble d’étiquettes littérales (Python liste de chaînes d’étiquettes ou des noms d’étiquettes de mappage de dictés à des descriptions, sérialisés automatiquement vers un littéral JSON) ou une expression de colonne dont la valeur par ligne est un tableau JSON de chaînes d’étiquettes ou un nom d’étiquette de mappage d’objets JSON à des descriptions. |
options |
dictoptionnel |
Dictionnaire d’options permettant de contrôler le comportement de classification. |
Returns
pyspark.sql.Column: nouvelle colonne contenant le résultat de classification.
Le comportement par défaut est la classification à étiquette unique. Pour activer la classification multi-étiquette et afficher l’ensemble complet d’options prises en charge, consultez le manuel du langage SQL.
Exemples
# Static labels (same set for every row)
df.select(ai_classify("text", ["positive", "negative", "neutral"]))
df.select(ai_classify("text", {"positive": "Happy tone", "negative": "Unhappy tone"}))
# Per-row labels (a column whose value is a JSON array or JSON object string)
df.select(ai_classify("text", col("labels_json")))