Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Extrait des données structurées d’une colonne de document à l’aide de l’IA/LLM.
Pour obtenir plus de détails sur la fonction SQL de Databricks correspondante, consultez ai_extract.
Syntax
from pyspark.sql import functions as dbf
dbf.ai_extract(col=<col>, schema=<schema>, options=<options>)
Parameters
| Parameter | Type | Description |
|---|---|---|
col |
pyspark.sql.Column ou str |
Colonne contenant le contenu du document à extraire. |
schema |
dict ou list |
dictée Python (nom de champ à {"type": ..., "description": ...}) ou liste de chaînes de nom de champ. Sérialisé automatiquement vers un littéral JSON. |
options |
dictoptionnel |
Dictionnaire d’options pour contrôler le comportement d’extraction. |
Returns
pyspark.sql.Column: nouvelle colonne de VariantType contenant les champs extraits.
Exemples
df.select(ai_extract("text", {"name": {"type": "string", "description": "Name"}}))
df.select(ai_extract("text", ["name", "age"]))