注释
Databricks CLI 的使用须遵守 Databricks 许可和 Databricks 隐私声明,包括任何数据使用规定。
feature-engineering
CLI 中的命令组允许你在 Databricks 功能存储中管理功能。
Databricks 特征工程功能 "create-feature"
创建功能。
databricks feature-engineering create-feature FULL_NAME SOURCE INPUTS FUNCTION TIME_WINDOW [flags]
Arguments
FULL_NAME
功能的完整三部分名称(目录、架构、名称)。
SOURCE
功能的数据源。
INPUTS
从中计算特征的输入列。
FUNCTION
计算特征的函数。
TIME_WINDOW
计算该功能的时间范围。
选项
--description string
功能的说明。
--json JSON
内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。
例子
以下示例创建一个功能:
databricks feature-engineering create-feature my_catalog.my_schema.my_feature my_source my_inputs my_function my_time_window --description "My feature description"
Databricks feature-engineering create-kafka-config
创建一个Kafka配置。
databricks feature-engineering create-kafka-config NAME BOOTSTRAP_SERVERS SUBSCRIPTION_MODE AUTH_CONFIG [flags]
Arguments
NAME
在元存储库中唯一标识该 Kafka 配置的名称。 这将是Feature对象用来引用这些配置的标识符。 可以与主题名称区分开来。
BOOTSTRAP_SERVERS
以逗号分隔的主机/商品对列表,均指向 Kafka 群集。
SUBSCRIPTION_MODE
配置从哪些Kafka主题中提取数据的选项。
AUTH_CONFIG
连接主题的认证配置。
选项
--json JSON
内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。
Databricks 功能工程创建 具体化特征
创建一个具象化的特征。
databricks feature-engineering create-materialized-feature FEATURE_NAME [flags]
Arguments
FEATURE_NAME
Unity 目录中该功能的全名。
选项
--cron-schedule string
定义物质化流程进度的石英克隆表达式。
--json JSON
内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。
--materialized-feature-id string
服务器为实体化功能分配的唯一标识符。
--pipeline-schedule-state MaterializedFeaturePipelineScheduleState
物质化流程的进度状态。 支持的值:ACTIVE、PAUSED、SNAPSHOT。
Databricks 功能工程创建流
创建一个流。
databricks feature-engineering create-stream NAME SOURCE_CONFIG CONNECTION_CONFIG SCHEMA_CONFIG INGESTION_CONFIG [flags]
Arguments
NAME
流的完整三部分名称(catalog.schema.stream)。
SOURCE_CONFIG
源代码特定配置。 确定流媒体平台的来源。
CONNECTION_CONFIG
规定如何连接和认证流平台。
SCHEMA_CONFIG
流的模式定义。 目前仅支持直接模式。 在未来的里程碑中,我们将通过UC连接支持模式注册。
INGESTION_CONFIG
流式数据摄取配置:托管表,存储前向填充数据的离线副本,并可选历史回填。
选项
--description string
用户提供的描述。
--json JSON
内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。
databricks 功能工程删除功能
删除功能。
databricks feature-engineering delete-feature FULL_NAME [flags]
Arguments
FULL_NAME
要删除的功能的名称。
例子
以下示例删除了一项功能:
databricks feature-engineering delete-feature my_catalog.my_schema.my_feature
Databricks feature-engineering delete-kafka-config
删除一个 Kafka 配置。
databricks feature-engineering delete-kafka-config NAME [flags]
Arguments
NAME
要删除的 Kafka 配置名称。
DataBricks 功能工程删除 物质化功能
删除实体化的特征。
databricks feature-engineering delete-materialized-feature MATERIALIZED_FEATURE_ID [flags]
Arguments
MATERIALIZED_FEATURE_ID
要删除的实体化特征的ID。
Databricks 功能工程删除流
删除一个直播。
databricks feature-engineering delete-stream NAME [flags]
Arguments
NAME
删除流的完整三部分名称(catalog.schema.stream)。
databricks 特征工程 获取特征
获取功能。
databricks feature-engineering get-feature FULL_NAME [flags]
Arguments
FULL_NAME
要获取的功能的名称。
例子
以下示例获取一项功能:
databricks feature-engineering get-feature my_catalog.my_schema.my_feature
Databricks feature-engineering get-kafka-config
去做一个Kafka配置。
databricks feature-engineering get-kafka-config NAME [flags]
Arguments
NAME
要获取的 Kafka 配置名称。
Databricks 特性工程 get-materialized-feature
获得具象化的功能。
databricks feature-engineering get-materialized-feature MATERIALIZED_FEATURE_ID [flags]
Arguments
MATERIALIZED_FEATURE_ID
具象化特征的ID。
Databricks feature-engineering get-stream
开个直播吧。
databricks feature-engineering get-stream NAME [flags]
Arguments
NAME
获取Stream的完整三部分名称(catalog.schema.stream)。
databricks 特征工程列表-功能
列出功能。
databricks feature-engineering list-features [flags]
选项
--page-size int
要返回的最大结果数。
--page-token string
用于根据上一个查询转到下一页的分页令牌。
例子
以下示例列出了所有功能:
databricks feature-engineering list-features
Databricks feature-engineering list-kafka-configs
列出Kafka配置。
databricks feature-engineering list-kafka-configs [flags]
选项
--limit int
要返回的最大结果数。
--page-size int
要返回的最大结果数。
Databricks 特性-工程列表-具体化-特征
列出具象化的特征。
databricks feature-engineering list-materialized-features [flags]
选项
--feature-name string
按功能名称筛选。
--limit int
要返回的最大结果数。
--page-size int
要返回的最大结果数。
Databricks 功能工程列表流
列表流。
databricks feature-engineering list-streams [flags]
选项
--limit int
要返回的最大结果数。
--page-size int
要返回的最大结果数。
--parent string
列出流的两部分名称(catalog.schema)作为父名称。
databricks 功能工程更新-功能
更新功能的说明(所有其他字段都是不可变的)。
databricks feature-engineering update-feature FULL_NAME UPDATE_MASK SOURCE INPUTS FUNCTION TIME_WINDOW [flags]
Arguments
FULL_NAME
功能的完整三部分名称(目录、架构、名称)。
UPDATE_MASK
要更新的字段列表。
SOURCE
功能的数据源。
INPUTS
从中计算特征的输入列。
FUNCTION
计算特征的函数。
TIME_WINDOW
计算该功能的时间范围。
选项
--description string
功能的说明。
--json JSON
内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。
例子
以下示例更新功能的说明:
databricks feature-engineering update-feature my_catalog.my_schema.my_feature description my_source my_inputs my_function my_time_window --description "Updated description"
DataBricks feature-engineering update-kafka-config
更新Kafka配置。
databricks feature-engineering update-kafka-config NAME UPDATE_MASK BOOTSTRAP_SERVERS SUBSCRIPTION_MODE AUTH_CONFIG [flags]
Arguments
NAME
在元存储库中唯一标识该 Kafka 配置的名称。 这将是Feature对象用来引用这些配置的标识符。 可以与主题名称区分开来。
UPDATE_MASK
要更新的字段列表。
BOOTSTRAP_SERVERS
以逗号分隔的主机/商品对列表,均指向 Kafka 群集。
SUBSCRIPTION_MODE
配置从哪些Kafka主题中提取数据的选项。
AUTH_CONFIG
连接主题的认证配置。
选项
--json JSON
内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。
Databricks 功能-工程更新-具体化-特性
更新一个实体化的功能。
databricks feature-engineering update-materialized-feature MATERIALIZED_FEATURE_ID UPDATE_MASK FEATURE_NAME [flags]
Arguments
MATERIALIZED_FEATURE_ID
服务器为实体化功能分配的唯一标识符。
UPDATE_MASK
提供需要更新的实体化特征字段。 目前,只有pipeline_state字段可以更新。
FEATURE_NAME
Unity 目录中该功能的全名。
选项
--cron-schedule string
定义物质化流程进度的石英克隆表达式。
--json JSON
内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。
--materialized-feature-id string
服务器为实体化功能分配的唯一标识符。
--pipeline-schedule-state MaterializedFeaturePipelineScheduleState
物质化流程的进度状态。 支持的值:ACTIVE、PAUSED、SNAPSHOT。
DataBricks 功能工程更新流
更新直播。
databricks feature-engineering update-stream NAME UPDATE_MASK SOURCE_CONFIG CONNECTION_CONFIG SCHEMA_CONFIG INGESTION_CONFIG [flags]
Arguments
NAME
流的完整三部分名称(catalog.schema.stream)。
UPDATE_MASK
要更新的字段列表。
SOURCE_CONFIG
源代码特定配置。 确定流媒体平台的来源。
CONNECTION_CONFIG
规定如何连接和认证流平台。
SCHEMA_CONFIG
流的模式定义。 目前仅支持直接模式。 在未来的里程碑中,我们将通过UC连接支持模式注册。
INGESTION_CONFIG
流式数据摄取配置:托管表,存储前向填充数据的离线副本,并可选历史回填。
选项
--description string
用户提供的描述。
--json JSON
内联 JSON 字符串或包含请求正文的 JSON 文件中的 @path。
全局标志
--debug
是否启用调试日志记录。
-h 或 --help
显示 Databricks CLI、相关命令组或相关命令的帮助。
--log-file 字符串
一个字符串,表示要将输出日志写入到的文件。 如果未指定此标志,则默认会将输出日志写入到 stderr。
--log-format 格式
日志格式类型,text 或 json。 默认值为 text。
--log-level 字符串
一个表示日志格式级别的字符串。 如果未指定,则禁用日志格式级别。
-o, --output 类型
命令输出类型为 text 或 json。 默认值为 text。
-p, --profile 字符串
要用于运行命令的 ~/.databrickscfg 文件中的配置文件名称。 如果未指定此标志,并且存在命名为 DEFAULT 的配置文件,则使用该配置文件。
--progress-format 格式
显示进度日志的格式: default、 append、 inplace或 json
-t, --target 字符串
如果适用,要使用的捆绑包目标