ai_classify

Классифицирует содержимое документа в одну из предоставленных меток с помощью ИИ/LLM.

Для соответствующей функции Databricks SQL смотрите функцию ai_classify.

Syntax

from pyspark.sql import functions as dbf

dbf.ai_classify(col=<col>, labels=<labels>, options=<options>)

Parameters

Parameter Тип Описание
col pyspark.sql.Column или str Столбец, содержащий содержимое документа для классификации.
labels list, dict, pyspark.sql.Columnили str Либо литеральный набор меток (Python списке строк меток или имен меток сопоставления диктовок с описаниями, сериализованным в литерал JSON автоматически), либо выражение столбца, значение которого является массивом строк меток JSON или именами меток сопоставления объектов JSON с описаниями.
options dictнеобязательный Словарь параметров для управления поведением классификации.

Returns

pyspark.sql.Column: новый столбец, содержащий результат классификации.

Поведение по умолчанию — это классификация одноклеек. Чтобы включить классификацию нескольких меток и просмотреть полный набор поддерживаемых параметров, ознакомьтесь с руководством по языку SQL.

Примеры

# Static labels (same set for every row)
df.select(ai_classify("text", ["positive", "negative", "neutral"]))
df.select(ai_classify("text", {"positive": "Happy tone", "negative": "Unhappy tone"}))

# Per-row labels (a column whose value is a JSON array or JSON object string)
df.select(ai_classify("text", col("labels_json")))