feature-engineering 命令组

注释

Databricks CLI 的使用须遵守 Databricks 许可Databricks 隐私声明,包括任何数据使用规定。

feature-engineering CLI 中的命令组允许你在 Databricks 功能存储中管理功能。

Databricks 特征工程功能 "create-feature"

创建功能。

databricks feature-engineering create-feature FULL_NAME SOURCE INPUTS FUNCTION TIME_WINDOW [flags]

Arguments

FULL_NAME

    功能的完整三部分名称(目录、架构、名称)。

SOURCE

    功能的数据源。

INPUTS

    从中计算特征的输入列。

FUNCTION

    计算特征的函数。

TIME_WINDOW

    计算该功能的时间范围。

选项

--description string

    功能的说明。

--json JSON

    内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。

全局标志

例子

以下示例创建一个功能:

databricks feature-engineering create-feature my_catalog.my_schema.my_feature my_source my_inputs my_function my_time_window --description "My feature description"

Databricks feature-engineering create-kafka-config

创建一个Kafka配置。

databricks feature-engineering create-kafka-config NAME BOOTSTRAP_SERVERS SUBSCRIPTION_MODE AUTH_CONFIG [flags]

Arguments

NAME

    在元存储库中唯一标识该 Kafka 配置的名称。 这将是Feature对象用来引用这些配置的标识符。 可以与主题名称区分开来。

BOOTSTRAP_SERVERS

    以逗号分隔的主机/商品对列表,均指向 Kafka 群集。

SUBSCRIPTION_MODE

    配置从哪些Kafka主题中提取数据的选项。

AUTH_CONFIG

    连接主题的认证配置。

选项

--json JSON

    内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。

全局标志

Databricks 功能工程创建 具体化特征

创建一个具象化的特征。

databricks feature-engineering create-materialized-feature FEATURE_NAME [flags]

Arguments

FEATURE_NAME

    Unity 目录中该功能的全名。

选项

--cron-schedule string

    定义物质化流程进度的石英克隆表达式。

--json JSON

    内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。

--materialized-feature-id string

    服务器为实体化功能分配的唯一标识符。

--pipeline-schedule-state MaterializedFeaturePipelineScheduleState

    物质化流程的进度状态。 支持的值:ACTIVEPAUSEDSNAPSHOT

全局标志

Databricks 功能工程创建流

创建一个流。

databricks feature-engineering create-stream NAME SOURCE_CONFIG CONNECTION_CONFIG SCHEMA_CONFIG INGESTION_CONFIG [flags]

Arguments

NAME

    流的完整三部分名称(catalog.schema.stream)。

SOURCE_CONFIG

    源代码特定配置。 确定流媒体平台的来源。

CONNECTION_CONFIG

    规定如何连接和认证流平台。

SCHEMA_CONFIG

    流的模式定义。 目前仅支持直接模式。 在未来的里程碑中,我们将通过UC连接支持模式注册。

INGESTION_CONFIG

    流式数据摄取配置:托管表,存储前向填充数据的离线副本,并可选历史回填。

选项

--description string

    用户提供的描述。

--json JSON

    内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。

全局标志

databricks 功能工程删除功能

删除功能。

databricks feature-engineering delete-feature FULL_NAME [flags]

Arguments

FULL_NAME

    要删除的功能的名称。

全局标志

例子

以下示例删除了一项功能:

databricks feature-engineering delete-feature my_catalog.my_schema.my_feature

Databricks feature-engineering delete-kafka-config

删除一个 Kafka 配置。

databricks feature-engineering delete-kafka-config NAME [flags]

Arguments

NAME

    要删除的 Kafka 配置名称。

全局标志

DataBricks 功能工程删除 物质化功能

删除实体化的特征。

databricks feature-engineering delete-materialized-feature MATERIALIZED_FEATURE_ID [flags]

Arguments

MATERIALIZED_FEATURE_ID

    要删除的实体化特征的ID。

全局标志

Databricks 功能工程删除流

删除一个直播。

databricks feature-engineering delete-stream NAME [flags]

Arguments

NAME

    删除流的完整三部分名称(catalog.schema.stream)。

全局标志

databricks 特征工程 获取特征

获取功能。

databricks feature-engineering get-feature FULL_NAME [flags]

Arguments

FULL_NAME

    要获取的功能的名称。

全局标志

例子

以下示例获取一项功能:

databricks feature-engineering get-feature my_catalog.my_schema.my_feature

Databricks feature-engineering get-kafka-config

去做一个Kafka配置。

databricks feature-engineering get-kafka-config NAME [flags]

Arguments

NAME

    要获取的 Kafka 配置名称。

全局标志

Databricks 特性工程 get-materialized-feature

获得具象化的功能。

databricks feature-engineering get-materialized-feature MATERIALIZED_FEATURE_ID [flags]

Arguments

MATERIALIZED_FEATURE_ID

    具象化特征的ID。

全局标志

Databricks feature-engineering get-stream

开个直播吧。

databricks feature-engineering get-stream NAME [flags]

Arguments

NAME

    获取Stream的完整三部分名称(catalog.schema.stream)。

全局标志

databricks 特征工程列表-功能

列出功能。

databricks feature-engineering list-features [flags]

选项

--page-size int

    要返回的最大结果数。

--page-token string

    用于根据上一个查询转到下一页的分页令牌。

全局标志

例子

以下示例列出了所有功能:

databricks feature-engineering list-features

Databricks feature-engineering list-kafka-configs

列出Kafka配置。

databricks feature-engineering list-kafka-configs [flags]

选项

--limit int

    要返回的最大结果数。

--page-size int

    要返回的最大结果数。

全局标志

Databricks 特性-工程列表-具体化-特征

列出具象化的特征。

databricks feature-engineering list-materialized-features [flags]

选项

--feature-name string

    按功能名称筛选。

--limit int

    要返回的最大结果数。

--page-size int

    要返回的最大结果数。

全局标志

Databricks 功能工程列表流

列表流。

databricks feature-engineering list-streams [flags]

选项

--limit int

    要返回的最大结果数。

--page-size int

    要返回的最大结果数。

--parent string

    列出流的两部分名称(catalog.schema)作为父名称。

全局标志

databricks 功能工程更新-功能

更新功能的说明(所有其他字段都是不可变的)。

databricks feature-engineering update-feature FULL_NAME UPDATE_MASK SOURCE INPUTS FUNCTION TIME_WINDOW [flags]

Arguments

FULL_NAME

    功能的完整三部分名称(目录、架构、名称)。

UPDATE_MASK

    要更新的字段列表。

SOURCE

    功能的数据源。

INPUTS

    从中计算特征的输入列。

FUNCTION

    计算特征的函数。

TIME_WINDOW

    计算该功能的时间范围。

选项

--description string

    功能的说明。

--json JSON

    内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。

全局标志

例子

以下示例更新功能的说明:

databricks feature-engineering update-feature my_catalog.my_schema.my_feature description my_source my_inputs my_function my_time_window --description "Updated description"

DataBricks feature-engineering update-kafka-config

更新Kafka配置。

databricks feature-engineering update-kafka-config NAME UPDATE_MASK BOOTSTRAP_SERVERS SUBSCRIPTION_MODE AUTH_CONFIG [flags]

Arguments

NAME

    在元存储库中唯一标识该 Kafka 配置的名称。 这将是Feature对象用来引用这些配置的标识符。 可以与主题名称区分开来。

UPDATE_MASK

    要更新的字段列表。

BOOTSTRAP_SERVERS

    以逗号分隔的主机/商品对列表,均指向 Kafka 群集。

SUBSCRIPTION_MODE

    配置从哪些Kafka主题中提取数据的选项。

AUTH_CONFIG

    连接主题的认证配置。

选项

--json JSON

    内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。

全局标志

Databricks 功能-工程更新-具体化-特性

更新一个实体化的功能。

databricks feature-engineering update-materialized-feature MATERIALIZED_FEATURE_ID UPDATE_MASK FEATURE_NAME [flags]

Arguments

MATERIALIZED_FEATURE_ID

    服务器为实体化功能分配的唯一标识符。

UPDATE_MASK

    提供需要更新的实体化特征字段。 目前,只有pipeline_state字段可以更新。

FEATURE_NAME

    Unity 目录中该功能的全名。

选项

--cron-schedule string

    定义物质化流程进度的石英克隆表达式。

--json JSON

    内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。

--materialized-feature-id string

    服务器为实体化功能分配的唯一标识符。

--pipeline-schedule-state MaterializedFeaturePipelineScheduleState

    物质化流程的进度状态。 支持的值:ACTIVEPAUSEDSNAPSHOT

全局标志

DataBricks 功能工程更新流

更新直播。

databricks feature-engineering update-stream NAME UPDATE_MASK SOURCE_CONFIG CONNECTION_CONFIG SCHEMA_CONFIG INGESTION_CONFIG [flags]

Arguments

NAME

    流的完整三部分名称(catalog.schema.stream)。

UPDATE_MASK

    要更新的字段列表。

SOURCE_CONFIG

    源代码特定配置。 确定流媒体平台的来源。

CONNECTION_CONFIG

    规定如何连接和认证流平台。

SCHEMA_CONFIG

    流的模式定义。 目前仅支持直接模式。 在未来的里程碑中,我们将通过UC连接支持模式注册。

INGESTION_CONFIG

    流式数据摄取配置:托管表,存储前向填充数据的离线副本,并可选历史回填。

选项

--description string

    用户提供的描述。

--json JSON

    内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。

全局标志

全局标志

--debug

  是否启用调试日志记录。

-h--help

    显示 Databricks CLI、相关命令组或相关命令的帮助。

--log-file 字符串

    一个字符串,表示要将输出日志写入到的文件。 如果未指定此标志,则默认会将输出日志写入到 stderr。

--log-format 格式

    日志格式类型,textjson。 默认值为 text

--log-level 字符串

    一个表示日志格式级别的字符串。 如果未指定,则禁用日志格式级别。

-o, --output 类型

    命令输出类型为 textjson。 默认值为 text

-p, --profile 字符串

    要用于运行命令的 ~/.databrickscfg 文件中的配置文件名称。 如果未指定此标志,并且存在命名为 DEFAULT 的配置文件,则使用该配置文件。

--progress-format 格式

    显示进度日志的格式: defaultappendinplacejson

-t, --target 字符串

    如果适用,要使用的捆绑包目标