ai_predict_class-Funktion

Gilt für:Kontrolle markiert ja Databricks SQL Kontrolle ja Databricks Runtime 19.3 und höher

Important

Dieses Feature befindet sich in der Betaversion. Um sie zu nutzen, muss ein Workspace-Administrator die Predictive AI Functions auf der Vorschauenseite aktivieren. Siehe Manage Azure Databricks Previews.

ai_predict_class() trainiert ein Klassifikationsmodell aus Zeilen, in denen die Zielspalte nicht NULL vorhanden ist, und sagt die Klasse für Zeilen vorher, in denen sie ist NULL. Die Funktion gibt nur die Zeilen zurück, die sie bewertet, und fügt Vorhersage- und Konfidenzspalten an die Eingabespalten an.

Anforderungen

  • Ein Pro- oder Serverless-SQL-Warehouse oder ein Cluster, der Databricks Runtime 19.3 oder höher ausführt
  • Melden Sie Ihren Arbeitsbereich in der Vorschau der Predictive AI Functions an. Siehe Manage Azure Databricks Previews.

Syntax

ai_predict_class(
  input => TABLE(input),
  target_col => target_col,
  feature_cols => feature_cols
  [, seed => seed]
)

Arguments

Geben Sie alle skalaren Argumente beim Namen durch. Du kannst nach Namen oder Position weitergeben input .

  • input ist die tabellenwertige Eingabe, die die Trainingszeilen und die zu bewertenden Zeilen enthält. Zeilen, in denen die Zielspalte nicht NULL ist, trainieren das Modell. Zeilen, in denen sich die Zielspalte befindet NULL , werden bewertet.
  • target_col ist eine Konstante STRING , die die Ziel-Spalte benennt. Das Ziel muss eine obere Ziffern-, Boolean- oder String-Spalte sein und darf nicht in erscheinen.feature_cols
  • feature_cols ist eine nicht-leere Konstante ARRAY<STRING> , die die Merkmalsspalten benennt. Jedes Merkmal muss eine obere Nummer, Boolesche oder String-Spalte sein.
  • seed (optional) ist ein Integralwert, der pseudorandomisierte Operationen initialisiert, die während des Modelltrainings verwendet werden. Der Standardwert lautet 0.

Rückkehr

Die Funktion liefert eine Tabelle zurück, die die Eingabezeilen enthält, wobei die Zielspalte ist NULL. Die Ausgabe behält alle Eingabespalten und fügt folgende Spalten hinzu:

  • <target_col>_prediction: Die vorhergesagte Klasse mit demselben Datentyp wie die Zielspalte.
  • <target_col>_confidence: A DOUBLE zwischen 0 und 1 das die Modellwahrscheinlichkeit für die vorhergesagte Klasse enthält.

Wenn keine Eingabezeilen ein NULL Ziel haben, gibt die Funktion eine leere Tabelle zurück.

Example

Das folgende Beispiel trainiert Kunden mit bekannten Churn-Ergebnissen und sagt voraus, ob Kunden mit fehlenden Ergebnissen auch Churnen werden:

WITH customers AS (
  SELECT * FROM VALUES
    (1, 3, 'monthly', true),
    (2, 24, 'annual', false),
    (3, 5, 'monthly', true),
    (4, 30, 'annual', false),
    (5, 8, 'monthly', true),
    (6, 36, 'annual', false),
    (7, 6, 'monthly', NULL),
    (8, 28, 'annual', NULL)
  AS customers(customer_id, tenure_months, plan, churned)
)
SELECT customer_id, churned_prediction, churned_confidence
FROM ai_predict_class(
  input => TABLE(customers),
  target_col => 'churned',
  feature_cols => ARRAY('tenure_months', 'plan'),
  seed => 42
)
ORDER BY customer_id;

Limitations

  • Jede Invocation unterstützt eine Zielspalte und trainiert ein neues Modell. Die Funktion hält das Modell nicht für die Wiederverwendung erhalten.
  • Ziel- und Feature-Spalten müssen Top-Level-Spalten sein. Verschachtelte Felder werden nicht unterstützt.
  • Die Trainingszeilen müssen mindestens zwei unterschiedliche, nicht-zielbezogeneNULL Werte enthalten.
  • Die Eingabe darf nicht bereits Spalten mit dem Namen <target_col>_prediction oder <target_col>_confidenceenthalten.

Fehlerbedingungen

Für ungültige Spalten, Typen oder Argumente siehe AI_PREDICT_INVALID_PARAMETER Fehlerbedingung. Für unzureichende Trainingsdaten siehe AI_PREDICT_INSUFFICIENT_TRAINING_DATA Fehlerbedingung.

Um einen numerischen Wert vorherzusagen, verwenden ai_predict_value Sie die Funktion. Um Text anhand von Labels zu klassifizieren, die du ohne Training auf tabellarischen Zeilen bereitstellst, nutze ai_classify Funktion. Für andere KI-Funktionen siehe Transformieren unstrukturierter Daten mit KI-Funktionen.