Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Декларативные пакеты автоматизации (ранее известные как наборы ресурсов Databricks) позволяют указать сведения о Azure Databricks ресурсах, используемых пакетом в сопоставлении resources в конфигурации пакета. См. справочник по ресурсам.
Эта страница содержит ссылку на конфигурацию для всех поддерживаемых типов ресурсов для пакетов и содержит подробные сведения и пример для каждого поддерживаемого типа. Дополнительные примеры см. в примерах конфигурации пакета .
Схема JSON для пакетов, используемых для проверки конфигурации YAML, находится в репозитории cli GitHub Databricks CLI.
Tip
Чтобы создать YAML для любого существующего ресурса, используйте команду databricks bundle generate. См. создание пакета databricks.
поддерживаемые ресурсы
В следующей таблице перечислены поддерживаемые типы ресурсов для пакетов (YAML и Python, где это применимо). Некоторые ресурсы можно создать, определив их в пакете и развернув пакет, и некоторые ресурсы можно создать только путем ссылки на существующий ресурс для включения в пакет.
Конфигурация ресурсов определяет объект Databricks, соответствующий объекту REST API Databricks . Поля создающего запроса объекта REST API, выраженные в формате YAML, являются поддерживаемыми ключами ресурса. Ссылки на документацию по соответствующему объекту каждого ресурса приведены в таблице ниже.
Tip
Команда databricks bundle validate возвращает предупреждения, если неизвестные свойства ресурсов находятся в файлах конфигурации пакета.
предупреждение
Type: Map
Ресурс генерации оповещений определяет оповещение SQL (версия 2).
Добавлено в Databricks CLI версии 0.279.0
alerts:
<alert-name>:
<alert-field-name>: <alert-field-value>
| Key | Type | Description |
|---|---|---|
custom_description |
String | Необязательно. Настраиваемое описание оповещения. Поддерживает шаблон усов. Добавлено в Databricks CLI версии 0.279.0 |
custom_summary |
String | Необязательно. Настраиваемая сводка для оповещения. Поддерживает шаблон усов. Добавлено в Databricks CLI версии 0.279.0 |
display_name |
String | Обязательное. Отображаемое имя оповещения, например Example alert.Добавлено в Databricks CLI версии 0.279.0 |
evaluation |
Map | Обязательное. Конфигурация оценки для оповещения. См. оповещение.evaluation. Добавлено в Databricks CLI версии 0.279.0 |
file_path |
String | Локальный путь к файлу ресурса оповещения. Добавлено в Интерфейс командной строки Databricks версии 0.282.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.279.0 |
parent_path |
String | Необязательно. Путь к рабочей области папки, содержащей оповещение. Можно задать только при создании и не подлежит обновлению. Пример: /Users/someone@example.com.Добавлено в Databricks CLI версии 0.279.0 |
permissions |
Sequence | Разрешения на оповещения. Просмотр разрешений. Добавлено в Databricks CLI версии 0.279.0 |
query_text |
String | Обязательное. Например, SELECT 1текст выполняемого запроса.Добавлено в Databricks CLI версии 0.279.0 |
run_as |
Map | Необязательно. Указывает идентификатор, который будет использоваться для выполнения оповещения. Это поле позволяет настроить оповещения для запуска в качестве конкретного пользователя или субъекта-службы. См. run_as.
Добавлено в Databricks CLI версии 0.279.0 |
schedule |
Map | Обязательное. Конфигурация расписания для оповещения. См. alert.schedule. Добавлено в Databricks CLI версии 0.279.0 |
warehouse_id |
String | Обязательное. Идентификатор хранилища SQL, подключенного к оповещению, например a7066a8ef796be84.Добавлено в Databricks CLI версии 0.279.0 |
оповещение.оценка
Type: Map
Конфигурация оценки для оповещения.
| Key | Type | Description |
|---|---|---|
comparison_operator |
String | Оператор, используемый для сравнения в оценке оповещений. |
empty_result_state |
String | Состояние оповещения в случае пустого результата. Избегайте настройки этого поля UNKNOWN , так как UNKNOWN состояние планируется нерекомендуемо. |
notification |
Map | Пользователь или другое место назначения, которого нужно уведомить, когда срабатывает оповещение. См. alert.evaluation.notification. |
source |
Map | Исходный столбец из результата, используемый для оценки оповещения. См. файл alert.evaluation.source. |
threshold |
Map | Пороговое значение, используемое для оценки оповещений. Это может быть столбец или значение. См. предупреждение.evaluation.threshold. |
предупреждение.оценка.уведомление
Type: Map
Пользователь или другое место назначения, которого нужно уведомить, когда срабатывает оповещение.
| Key | Type | Description |
|---|---|---|
notify_on_ok |
Boolean | Необязательно. Следует ли уведомлять подписчиков оповещений, когда оповещение возвращается в нормальное состояние. |
retrigger_seconds |
Integer | Необязательно. Количество секунд, в течение которых оповещение ожидается после активации, прежде чем разрешено отправлять другое уведомление. Если установлено значение 0 или опущено, оповещение не будет отправлять дальнейшие уведомления после первого срабатывания. Задание этого значения 1 позволяет оповещению отправлять уведомление при каждой оценке, если условие выполнено, эффективно обеспечивая его постоянное повторное срабатывание для целей уведомлений. |
subscriptions |
Sequence | Необязательно. Неупорядоченный список подписок на уведомления. См. статью alert.evaluation.notification.subscriptions. |
уведомления о подписках на оценку предупреждений
Type: Sequence
Неупорядоченный список подписок на уведомления.
Каждый элемент в списке — это AlertSubscription:
| Key | Type | Description |
|---|---|---|
destination_id |
String | Идентификатор назначения уведомления. |
user_email |
String | Адрес электронной почты пользователя, который нужно уведомить. |
alert.evaluation.source
Type: Map
Исходный столбец из результата для оценки оповещения.
| Key | Type | Description |
|---|---|---|
aggregation |
String | Метод агрегирования, применяемый к исходному столбцу. Допустимые значения: SUM, , COUNTCOUNT_DISTINCTAVGMEDIANMINMAXSTDDEV |
display |
String | Отображаемое имя исходного столбца. |
name |
String | Имя исходного столбца из результата запроса. |
порог.оценки.оповещения
Type: Map
Пороговое значение, используемое для оценки оповещений, может быть столбцом или значением.
| Key | Type | Description |
|---|---|---|
column |
Map | Ссылка на столбец для использования в качестве порогового значения. См. файл alert.evaluation.source. |
value |
Map | Литеральное значение, используемое в качестве порога. См. параметр alert.evaluation.threshold.value. |
предупреждение.оценка.порог.значение
Type: Map
Литеральное значение, используемое в качестве порога. Укажите один из следующих типов значений.
| Key | Type | Description |
|---|---|---|
bool_value |
Boolean | Необязательно. Логическое значение порога, например true. |
double_value |
Double | Необязательно. Числовое значение порога, например 1.25. |
string_value |
String | Необязательно. Строковое значение порога, например test. |
оповещение.расписание
Type: Map
Конфигурация расписания для оповещения.
| Key | Type | Description |
|---|---|---|
pause_status |
String | Необязательно. Является ли это расписание приостановленным или нет. Допустимые значения: UNPAUSED, PAUSED. По умолчанию: UNPAUSED. |
quartz_cron_schedule |
String | Обязательное. Выражение cron, использующее синтаксис Quartz, который задает расписание для этого потока. Формат кристалла описывается в формате планировщика. |
timezone_id |
String | Обязательное. Идентификатор часового пояса Java. Расписание будет разрешено с помощью этого часового пояса. Это будет объединено с quartz_cron_schedule для определения расписания. Подробные сведения см. в разделе SET TIME ZONE. |
Examples
В следующем примере конфигурации определяется оповещение с простой оценкой:
resources:
alerts:
my_alert:
display_name: my_alert
evaluation:
comparison_operator: EQUAL
source:
name: '1'
threshold:
value:
double_value: 2
query_text: select 2
schedule:
quartz_cron_schedule: '44 19 */1 * * ?'
timezone_id: Europe/Amsterdam
warehouse_id: 799f096837fzzzz4
В следующем примере конфигурации определяется оповещение с разрешениями, которые оцениваются с помощью агрегирования и отправляют уведомления:
resources:
alerts:
my_alert:
permissions:
- level: CAN_MANAGE
user_name: someone@example.com
custom_summary: 'My alert'
display_name: 'My alert'
evaluation:
comparison_operator: 'EQUAL'
notification:
notify_on_ok: false
retrigger_seconds: 1
source:
aggregation: 'MAX'
display: '1'
name: '1'
threshold:
value:
double_value: 2
query_text: 'select 2'
schedule:
pause_status: 'UNPAUSED'
quartz_cron_schedule: '44 19 */1 * * ?'
timezone_id: 'Europe/Amsterdam'
warehouse_id: 799f096837fzzzz4
приложение
Type: Map
Ресурс приложения определяет приложение Databricks . Сведения о приложениях Databricks см. в разделе "Приложения Databricks".
Чтобы добавить приложение, укажите параметры для определения приложения, включая необходимые source_code_path.
Tip
Вы можете инициализировать пакет с приложением Streamlit Databricks с помощью следующей команды:
databricks bundle init https://github.com/databricks/bundle-examples --template-dir contrib/templates/streamlit-app
Добавлено в Интерфейс командной строки Databricks версии 0.239.0
apps:
<app-name>:
<app-field-name>: <app-field-value>
| Key | Type | Description |
|---|---|---|
budget_policy_id |
String | Идентификатор политики бюджета для приложения. Добавлено в Databricks CLI версии 0.243.0 |
compute_size |
String | Размер вычислительных ресурсов для приложения. Допустимые значения: MEDIUMили LARGEXLARGE зависят от конфигурации рабочей области.Добавлено в Databricks CLI версии 0.273.0 |
config |
Map | Команды конфигурации приложений и переменные среды. См. app.config. Добавлено в Databricks CLI версии 0.283.0 |
description |
String | Описание приложения. Добавлено в Интерфейс командной строки Databricks версии 0.239.0 |
git_repository |
Map | Конфигурация репозитория Git для развертываний приложений. При указании развертывания могут ссылаться на код из этого репозитория, предоставляя только ссылку на git (ветвь, тег или фиксацию). См. app.git_repository. Добавлено в Databricks CLI версии 0.283.0 |
git_source |
Map | Конфигурация источника Git для развертываний приложений. Указывает, какая ссылка на Git (ветвь, тег или фиксация) используется при развертывании приложения. Используется в сочетании с git_repository развертыванием кода непосредственно из Git. В пределах source_code_pathgit_source определяется относительный путь к коду приложения в репозитории. См. app.git_source.Добавлено в Интерфейс командной строки Databricks версии 0.290.0 |
lifecycle |
Map | Поведение ресурса при развертывании или уничтожении ресурса. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
name |
String | Имя приложения. Имя должно содержать только буквенно-цифровые символы нижнего регистра и дефисы. Он должен быть уникальным в рабочей области. Добавлено в Интерфейс командной строки Databricks версии 0.239.0 |
permissions |
Sequence | Разрешения приложения. Просмотр разрешений. Добавлено в Интерфейс командной строки Databricks версии 0.239.0 |
resources |
Sequence | Вычислительные ресурсы приложения. См. раздел app.resources. Добавлено в Интерфейс командной строки Databricks версии 0.239.0 |
source_code_path |
String | Локальный ./app путь исходного кода приложения Databricks.Добавлено в Интерфейс командной строки Databricks версии 0.239.0 |
telemetry_export_destinations |
Sequence | Назначения для экспорта данных телеметрии для приложения. См. app.telemetry_export_destinations. Добавлено в Databricks CLI версии 0.294.0 |
usage_policy_id |
String | Идентификатор политики бессерверного использования, используемой для этого приложения. Добавлено в Databricks CLI версии 0.283.0 |
user_api_scopes |
Sequence | Диапазоны пользовательского API. Добавлено в Интерфейс командной строки Databricks версии 0.246.0 |
app.config
Команды конфигурации приложений и переменные среды. См . раздел "Настройка выполнения приложения Databricks с помощью app.yaml".
| Key | Type | Description |
|---|---|---|
command |
Sequence | Команды для запуска приложения, например ["streamlit", "run", "app.py"] |
env |
Sequence | Список name и value пары, которые указывают переменные среды приложения для задания в среде выполнения приложения. Это переопределит переменные среды, указанные в файле app.yaml. Сведения о переменных среды среды приложений по умолчанию см. в среде Databricks Apps.Переменные среды не задаются до запуска приложения. |
app.git_repository
Type: Map
Конфигурация репозитория Git, указывающая расположение репозитория.
| Key | Type | Description |
|---|---|---|
provider |
String | Обязательное. Поставщик Git. Без учета регистра. Поддерживаемые значения: gitHub, gitHubEnterprise, bitbucketCloud, bitbucketServer, azureDevOpsServices, gitLab, gitLabEnterpriseEdition, . awsCodeCommitДобавлено в Databricks CLI версии 0.283.0 |
url |
String | Обязательное. URL-адрес репозитория Git. Добавлено в Databricks CLI версии 0.283.0 |
app.git_source
Type: Map
Конфигурация источника Git для развертываний приложений.
| Key | Type | Description |
|---|---|---|
branch |
String | Извлеченная ветвь Git. |
commit |
String | Git фиксирует SHA, чтобы быть извлечены. |
source_code_path |
String | Относительный путь к исходному коду приложения в репозитории Git. Если он не указан, используется корневой каталог репозитория. |
tag |
String | Извлекаемый тег Git. |
ресурсы приложения
Type: Sequence
Список вычислительных ресурсов для приложения.
Каждый элемент в списке — это AppResource:
| Key | Type | Description |
|---|---|---|
app |
Map | Имя и разрешения приложения |
description |
String | Описание ресурса приложения. |
database |
Map | Параметры, определяющие базу данных подготовки Lakebase для использования. См. app.resources.database. |
experiment |
Map | Параметры, определяющие используемый эксперимент MLflow. См. app.resources.experiment. |
genie_space |
Map | Параметры, определяющие используемый агент Genie. См. app.resources.genie_space. |
job |
Map | Настройки, определяющие ресурс, используемый для задания. См. app.resources.job. |
name |
String | Имя ресурса приложения. |
postgres |
Map | Параметры, определяющие базу данных автомасштабирования Lakebase для использования. См. раздел app.resources.postgres. |
secret |
Map | Параметры, определяющие используемый Azure Databricks секретный ресурс. См. app.resources.secret. |
serving_endpoint |
Map | Параметры, определяющие используемый ресурс конечной точки службы модели. См. app.resources.serving_endpoint. |
sql_warehouse |
Map | Параметры, определяющие используемый ресурс хранилища SQL. См. app.resources.sql_warehouse. |
uc_securable |
Map | Параметры, определяющие защищаемый каталог Unity. См. app.resources.uc_securable. |
приложение.ресурсы.база данных
Type: Map
Параметры, определяющие базу данных Lakebase для использования.
| Key | Type | Description |
|---|---|---|
database_name |
String | Имя базы данных. |
instance_name |
String | Имя экземпляра базы данных. |
permission |
String | Уровень разрешений для базы данных. Допустимые значения: CAN_CONNECT_AND_CREATE. |
app.resources.experiment
Type: Map
Параметры, определяющие используемый эксперимент MLflow.
| Key | Type | Description |
|---|---|---|
experiment_id |
String | Идентификатор эксперимента MLflow. |
permission |
String | Уровень разрешений для эксперимента. Допустимые значения: CAN_READ, CAN_EDITCAN_MANAGE. |
app.resources.genie_space
Type: Map
Параметры, определяющие используемый агент Genie.
| Key | Type | Description |
|---|---|---|
name |
String | Имя агента Genie. |
permission |
String | Уровень разрешений для пространства. Допустимые значения: CAN_VIEW, CAN_EDIT, CAN_MANAGECAN_RUN. |
space_id |
String | Идентификатор агента Genie, например 550e8400-e29b-41d4-a716-999955440000. |
app.resources.job
Type: Map
Настройки, определяющие ресурс, используемый для задания.
| Key | Type | Description |
|---|---|---|
id |
String | Идентификатор задания. |
permission |
String | Уровень разрешений для задания. Допустимые значения: CAN_VIEW, CAN_MANAGE_RUN, CAN_MANAGEIS_OWNER. |
app.resources.postgres
Type: Map
Параметры, определяющие базу данных автомасштабирования Lakebase для использования.
| Key | Type | Description |
|---|---|---|
branch |
String | Имя ветви, например projects/proj-abc123/branches/branch-xyz789. |
database |
String | Например, projects/proj-abc123/branches/branch-xyz789/databases/db-456имя экземпляра базы данных. |
permission |
String | Уровень разрешений для базы данных. Допустимые значения: CAN_CONNECT_AND_CREATE. |
приложение.ресурсы.секрет
Type: Map
Параметры, определяющие используемый Azure Databricks секретный ресурс.
| Key | Type | Description |
|---|---|---|
key |
String | Ключ секрета для предоставления разрешения. |
permission |
String | Уровень разрешений для секрета. Допустимые значения: READ, WRITEMANAGE. |
scope |
String | Имя области секрета. |
app.resources.точка_обслуживания
Type: Map
Параметры, определяющие используемый ресурс конечной точки службы модели.
| Key | Type | Description |
|---|---|---|
name |
String | Имя конечной точки обслуживания. |
permission |
String | Уровень разрешений для конечной точки обслуживания. Допустимые значения: CAN_QUERY, CAN_MANAGECAN_VIEW. |
app.resources.sql_склад
Type: Map
Параметры, определяющие хранилище SQL для использования.
| Key | Type | Description |
|---|---|---|
id |
String | Идентификатор хранилища SQL. |
permission |
String | Уровень разрешений для хранилища SQL. Допустимые значения: CAN_USE, CAN_MANAGEIS_OWNER. |
app.resources.uc_securable
Type: Map
Параметры, определяющие защищаемый каталог Unity. Приложения поддерживают тома, таблицы, функции и подключения в качестве защищаемых ресурсов.
| Key | Type | Description |
|---|---|---|
permission |
String | Уровень разрешений для защищаемого каталога Unity. Допустимые значения зависят от securable_type:
|
securable_full_name |
String | Полное имя защищаемого каталога Unity в формате catalog.schema.name. Для подключения используйте имя подключения. |
securable_type |
String | Тип защищаемого каталога Unity. Допустимые значения: VOLUME, TABLE, FUNCTIONи CONNECTION. |
Note
Для томов, таблиц и функций субъект-служба приложения также нуждается USE CATALOG в USE SCHEMA привилегиях родительского каталога и схемы. Azure Databricks автоматически предоставляет эти привилегии при добавлении защищаемого объекта в качестве ресурса приложения.
app.telemetry_export_destinations
Type: Sequence
Список назначений экспорта телеметрии для приложения.
Добавлено в Databricks CLI версии 0.294.0
Каждый элемент в списке — это AppTelemetryExportDestination:
| Key | Type | Description |
|---|---|---|
unity_catalog |
Map | Назначения каталога Unity для экспорта телеметрии OTEL. Добавлено в Databricks CLI версии 0.294.0 |
Examples
Руководство по созданию пакета, определяющего приложение, см. в разделе "Управление приложениями Databricks с помощью декларативных пакетов автоматизации".
В следующем примере определяется базовое приложение:
resources:
apps:
hello_world_app:
name: 'hello-world-app'
source_code_path: . # This assumes the app source code is at the root of the project.
description: 'A Databricks app'
В следующем примере создается приложение с именем my_app , которое управляет заданием, созданным пакетом. Полный пример см. в разделе bundle-examples GitHub репозиторий.
resources:
jobs:
# Define a job in the bundle
hello_world:
name: hello_world
tasks:
- task_key: task
spark_python_task:
python_file: ../src/main.py
environment_key: default
environments:
- environment_key: default
spec:
environment_version: '2'
# Define an app that manages the job in the bundle
apps:
job_manager:
name: 'job_manager_app'
description: 'An app which manages a job created by this bundle'
# The location of the source code for the app
source_code_path: ../src/app
# The resources in the bundle which this app has access to. This binds the resource in the app with the bundle resource.
resources:
- name: 'app-job'
job:
id: ${resources.jobs.hello_world.id}
permission: 'CAN_MANAGE_RUN'
app.yaml Соответствующий определяет конфигурацию для запуска приложения:
command:
- flask
- --app
- app
- run
- --debug
env:
- name: JOB_ID
valueFrom: 'app-job'
В следующем примере создается приложение, которое имеет доступ к эксперименту MLflow, созданному пакетом:
resources:
experiments:
# Define an MLflow experiment in the bundle
my_experiment:
name: /Users/${workspace.current_user.userName}/my-app-experiment
apps:
my_ml_app:
name: 'my-ml-app'
description: 'An app with access to an MLflow experiment'
source_code_path: ./app
# Grant the app access to the MLflow experiment
resources:
- name: 'app-experiment'
experiment:
experiment_id: ${resources.experiments.my_experiment.id}
permission: 'CAN_MANAGE'
Кроме того, в следующем примере определяется приложение с пользовательской конфигурацией, определенной в конфигурации пакета:
resources:
apps:
my_app:
name: my_app
description: my_app_description
source_code_path: ./app
config:
command: ['flask', '--app', 'app', 'run']
env:
- name: MY_ENV_VAR
value: test_value
- name: ANOTHER_VAR
value: another_value
В следующем примере определяется приложение с ресурсом автомасштабирования Lakebase:
resources:
apps:
my_app:
name: my-app
source_code_path: .
resources:
- name: lakebase-db
postgres:
branch: projects/my-app/branches/production
database: projects/my-app/branches/production/databases/db-xxxx-yyyyyyyy
permission: CAN_CONNECT_AND_CREATE
catalogs
Type: Map
Ресурс каталога позволяет определять каталоги (каталог Unity) в пакете.
Note
Использование декларативных пакетов автоматизации для определения каталогов поддерживается только в том случае, если вы используете подсистему прямого развертывания.
Добавлено в Databricks CLI версии 0.287.0
catalogs:
<catalog-name>:
<catalog-field-name>: <catalog-field-value>
| Key | Type | Description |
|---|---|---|
comment |
String | Текстовое описание каталога, предоставленное пользователем. Добавлено в Databricks CLI версии 0.287.0 |
connection_name |
String | Имя подключения к внешнему источнику данных. Добавлено в Databricks CLI версии 0.287.0 |
custom_max_retention_hours |
Integer | Индивидуальный максимальный срок хранения — часы — для каталога. Добавлено в версии Databricks CLI 1.5.0 |
grants |
Sequence | Гранты, связанные с каталогом. См.грант. Добавлено в Databricks CLI версии 0.287.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.287.0 |
managed_encryption_settings |
Map | Управление шифрованием CMK для данных управляемого каталога. См. catalog.managed_encryption_settings. Добавлено в Databricks CLI версии 0.298.0 |
name |
String | Обязательное. Имя каталога. Добавлено в Databricks CLI версии 0.287.0 |
options |
Object | Карта свойств key-value, присоединенных к защищаемому объекту. Добавлено в Databricks CLI версии 0.287.0 |
properties |
Object | Карта свойств key-value, присоединенных к защищаемому объекту. Добавлено в Databricks CLI версии 0.287.0 |
provider_name |
String | Имя поставщика OpenSharing. Каталог OpenSharing — это каталог, основанный на общей папке OpenSharing на удаленном сервере общего доступа. См. раздел "Что такое OpenSharing?". Добавлено в Databricks CLI версии 0.287.0 |
share_name |
String | Имя общей папки в поставщике общего ресурса. Добавлено в Databricks CLI версии 0.287.0 |
storage_root |
String | URL-адрес корневого хранилища для управляемых таблиц в каталоге. Добавлено в Databricks CLI версии 0.287.0 |
Example
# databricks.yml
bundle:
name: catalogs-example
engine: direct # catalogs require the direct deployment engine
resources:
catalogs:
my_catalog:
name: my_catalog
comment: 'Catalog created by Declarative Automation Bundles'
properties:
purpose: 'Testing'
grants:
- principal: someone@example.com
privileges:
- USE_CATALOG
- CREATE_SCHEMA
schemas:
my_schema:
name: my_schema
catalog_name: ${resources.catalogs.my_catalog.name}
comment: 'Schema in custom catalog'
catalog.managed_encryption_settings
Type: Map
Параметры шифрования для данных управляемого каталога. Используется для настройки управляемого клиентом ключа (CMK).
Добавлено в Databricks CLI версии 0.298.0
| Key | Type | Description |
|---|---|---|
azure_encryption_settings |
Map | Необязательные параметры Azure — требуется только в том случае, если используется Azure CMK. Добавлено в Databricks CLI версии 0.298.0 |
azure_key_vault_key_id |
String | URL-адрес AKV в Azure, значение NULL в противном случае. Добавлено в Databricks CLI версии 0.298.0 |
customer_managed_key_id |
String | UUID CMK в AWS и GCP, в противном случае — значение NULL. Добавлено в Databricks CLI версии 0.298.0 |
кластер
Type: Map
Ресурс кластера определяет кластер.
clusters:
<cluster-name>:
<cluster-field-name>: <cluster-field-value>
| Key | Type | Description |
|---|---|---|
apply_policy_default_values |
Boolean | Если задано значение true, фиксированные и значения по умолчанию из политики будут использоваться для полей, которые опущены. Если задано значение false, будут применены только фиксированные значения из политики. |
autoscale |
Map | Параметры, необходимые для автоматического масштабирования кластеров вверх и вниз на основе нагрузки. См. автомасштабирование. |
autotermination_minutes |
Integer | Автоматически завершает кластер после его бездействия в течение указанного времени в минутах. Если параметры этого кластера не установлены, он не будет автоматически завершен. Если задано, пороговое значение должно составлять от 10 до 10000 минут. Пользователи также могут задать для этого значения значение 0, чтобы явно отключить автоматическое завершение. |
aws_attributes |
Map | Атрибуты, связанные с кластерами, работающими в Amazon Web Services. Если при создании кластера не указано, будет использоваться набор значений по умолчанию. См. aws_attributes. |
azure_attributes |
Map | Атрибуты, связанные с кластерами, работающими на Microsoft Azure. Если при создании кластера не указано, будет использоваться набор значений по умолчанию. См. azure_attributes. |
cluster_log_conf |
Map | Конфигурация доставки журналов Spark в долгосрочное место хранения. См. cluster_log_conf. |
cluster_name |
String | Имя кластера, запрошенное пользователем. Это не обязательно должно быть уникальным. Если он не указан при создании, имя кластера будет пустой строкой. |
custom_tags |
Map | Дополнительные теги для ресурсов кластера. Databricks пометит все ресурсы кластера (например, экземпляры AWS и тома EBS) этими тегами, а также дополнительными default_tags. |
data_security_mode |
String | Модель управления данными, используемая при доступе к данным из кластера. Допустимые значения включают DATA_SECURITY_MODE_AUTO, DATA_SECURITY_MODE_STANDARD, DATA_SECURITY_MODE_DEDICATEDи NONE.
USER_ISOLATION и SINGLE_USER являются устаревшими псевдонимами для DATA_SECURITY_MODE_STANDARD и DATA_SECURITY_MODE_DEDICATEDсоответственно. Режимы LEGACY_* устарели, начиная с Databricks Runtime 15.0. |
dependency_mode |
String | (Бета) Управляет конфигурацией зависимостей для кластера. Допустимые значения: DEPENDENCY_MODE_ENVIRONMENTS, DEPENDENCY_MODE_CLUSTER_LIBRARIES и DEPENDENCY_MODE_AUTO.Добавлено в версии Databricks CLI 1.10.0 |
docker_image |
Map | Пользовательский образ Docker. См. docker_image. |
driver_instance_pool_id |
String | Необязательный идентификатор пула экземпляров, к которому принадлежит драйвер кластера. Кластер пула использует пул экземпляров с идентификатором (экземпляр*pool_id), если пул драйверов не назначен. |
driver_node_type_flexibility |
Map | Конфигурация гибкого типа узла для узла драйвера. См. cluster.driver_node_type_flexibility. Добавлено в Databricks CLI версии 0.285.0 |
driver_node_type_id |
String | Тип узла драйвера Spark. Это поле необязательно. Если не задано, для типа узла драйвера задано значение node_type_id. Это поле, а также node_type_idне должно быть задано, если virtual_cluster_size задано. Если оба driver_node_type_id, node_type_idи указаны, virtual_cluster_size и driver_node_type_idnode_type_id имеют приоритет. |
enable_elastic_disk |
Boolean | Автоматическое масштабирование локального хранилища: когда включено, этот кластер динамически получает дополнительное дисковое пространство, если пользователи Spark испытывают недостаток места на диске. Для правильной работы этой функции требуются определенные разрешения AWS. Дополнительные сведения см. в руководстве пользователя. |
enable_local_disk_encryption |
Boolean | Следует ли включить LUKS на локальных дисках виртуальных машин кластера. |
gcp_attributes |
Map | Атрибуты, связанные с кластерами, работающими на Google Cloud Platform. Если при создании кластера не указано, будет использоваться набор значений по умолчанию. См. gcp_attributes. |
init_scripts |
Sequence | Конфигурация для хранения скриптов инициализации. Можно указать любое количество мест назначения. Скрипты выполняются последовательно в указанном порядке. См. init_scripts. |
instance_pool_id |
String | Необязательный идентификатор пула экземпляров, к которому принадлежит кластер. |
is_single_node |
Boolean | Это поле можно использовать только в том случае kind = CLASSIC_PREVIEW. Если задано значение true, Databricks автоматически установит связанный custom_tagsс одним узлом и spark_confnum_workers.Добавлено в Databricks CLI версии 0.237.0 |
kind |
String | Тип вычислений, описанных в этой спецификации вычислений. Добавлено в Databricks CLI версии 0.237.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
node_type_id |
String | Используя отдельное значение, это поле кодирует доступные ресурсы для каждого узла Spark в этом кластере. Например, узлы Spark могут быть подготовлены и оптимизированы для операций в памяти или для ресурсоемких рабочих нагрузок. Список доступных типов узлов можно получить с помощью API типов узлов списка. |
num_workers |
Integer | Необходимое число рабочих узлов текущего кластера. В кластере есть один драйвер Spark и num_workers исполнитель, всего num_workers + 1 узлов Spark. |
permissions |
Sequence | Разрешения кластера. Просмотр разрешений. |
policy_id |
String | Идентификатор политики кластера, используемой для создания кластера, если это применимо. |
remote_disk_throughput |
Integer | Пропускная способность удаленного диска в байтах в секунду. Добавлено в Databricks CLI версии 0.257.0 |
runtime_engine |
String | Определяет движок выполнения кластера, либо STANDARD, либо PHOTON. |
single_user_name |
String | Одно имя пользователя, если данные*security_mode SINGLE_USER. |
spark_conf |
Map | Объект с набором необязательных, определяемых пользователем пар "ключ-значение" в конфигурации Spark. Пользователи также могут передавать строку дополнительных параметров JVM драйверу и обработчикам через spark.driver.extraJavaOptions и spark.executor.extraJavaOptions соответственно. |
spark_env_vars |
Map | Объект, содержащий набор необязательных пар "ключ-значение", определяемых пользователем переменных среды. |
spark_version |
String | Версия Кластера Spark, например 3.3.x-scala2.11. Список доступных версий Spark можно получить с помощью API доступных версий Spark. |
ssh_public_keys |
Sequence | Содержимое открытого ключа SSH, которое будет добавлено на каждый узел Spark в этом кластере. Соответствующие закрытые ключи можно использовать для входа с именем ubuntu пользователя через порт 2200. Можно указать до 10 ключей. |
total_initial_remote_disk_size |
Integer | Общий начальный размер удаленного диска в байтах. Добавлено в Databricks CLI версии 0.257.0 |
use_ml_runtime |
Boolean | Это поле можно использовать только в том случае kind = CLASSIC_PREVIEW.
effective_spark_version определяется spark_version (выпуск Databricks Runtime), этим полем use_ml_runtime, а также тем, является ли node_type_id узлом GPU или нет.Добавлено в Databricks CLI версии 0.237.0 |
worker_node_type_flexibility |
Map | Конфигурация гибкого типа узла для рабочих узлов. См. cluster.worker_node_type_flexibility. Добавлено в Databricks CLI версии 0.285.0 |
workload_type |
Map | Атрибуты кластера, отображающие типы рабочих нагрузок кластеров. См. workload_type. |
cluster.autoscale (автоматическое масштабирование кластера)
Type: Map
Параметры для автоматического масштабирования кластеров вверх и вниз на основе нагрузки.
| Key | Type | Description |
|---|---|---|
min_workers |
Integer | Минимальное число рабочих ролей, в которых кластер может уменьшиться при недостаточном использовании. Это также начальное число рабочих ролей, которые кластер будет иметь после создания. |
max_workers |
Integer | Максимальное число рабочих ролей, к которым кластер может увеличиваться при перегрузке.
max_workers должно быть строго больше min_workers. |
cluster.aws_attributes
Type: Map
Атрибуты, связанные с кластерами, работающими в Amazon Web Services.
| Key | Type | Description |
|---|---|---|
zone_id |
String | Идентификатор зоны доступности или центра обработки данных, в котором находится кластер. Эта строка будет иметь такой вид us-west-2a. |
availability |
String | Тип доступности, используемый для всех последующих узлов после first_on_demand. Допустимые значения: SPOT, ON_DEMANDSPOT_WITH_FALLBACK. Если first_on_demand равен нулю, этот тип доступности используется для всего кластера. |
spot_bid_price_percent |
Integer | Максимальная цена для точечных экземпляров AWS в процентах от цены соответствующего типа экземпляра по запросу. |
instance_profile_arn |
String | Узлы для этого кластера будут размещаться только в экземплярах AWS с этим профилем экземпляра. |
first_on_demand |
Integer |
first_on_demand Первые узлы кластера будут размещены по запросу. Это значение должно быть больше 0, чтобы убедиться, что узел драйвера кластера помещается в экземпляр по запросу. |
ebs_volume_type |
String | Тип томов EBS, которые будут запущены с помощью этого кластера. Допустимые значения — GENERAL_PURPOSE_SSD или THROUGHPUT_OPTIMIZED_HDD. |
ebs_volume_count |
Integer | Количество томов, запущенных для каждого экземпляра. |
ebs_volume_size |
Integer | Размер каждого тома EBS, запущенного для каждого экземпляра, (в GiB). |
ebs_volume_iops |
Integer | Количество IOPS на объём EBS gp3. |
ebs_volume_throughput |
Integer | Пропускная способность на том EBS gp3 в МиБ в секунду. |
cluster.azure_attributes
Type: Map
Атрибуты, связанные с кластерами, работающими на Microsoft Azure.
| Key | Type | Description |
|---|---|---|
first_on_demand |
Integer |
first_on_demand Первые узлы кластера будут размещены по запросу. |
availability |
String | Тип доступности, используемый для всех последующих узлов после first_on_demand. Допустимые значения: SPOT_AZURE, ON_DEMAND_AZURESPOT_WITH_FALLBACK_AZURE. Если first_on_demand равен нулю, этот тип доступности используется для всего кластера. |
spot_bid_max_price |
Number | Максимальная цена для Azure точечных экземпляров. Используется -1 для указания минимальной цены. |
capacity_reservation_group |
String | Идентификатор ресурсов группы резервирования ёмкости Azure для запуска виртуальных машин в формате /subscriptions/{subscriptionId}/resourceGroups/{resourceGroupName}/providers/Microsoft.Compute/capacityReservationGroups/{capacityReservationGroupName}. При указании виртуальные машины запускаются с использованием предоставленного резерва ёмкости.Резервирование ёмкости можно задать только тогда, когда рабочее пространство использует внедрённый VNet (VNet, определённый клиентом, не управляемый Databricks). databricks-login-prod Enterprise Application должно иметь следующие четыре разрешения: Microsoft.Compute/capacityReservationGroups/read, Microsoft.Compute/capacityReservationGroups/deploy/action, Microsoft.Compute/capacityReservationGroups/capacityReservations/read, и Microsoft.Compute/capacityReservationGroups/capacityReservations/deploy/action.Добавлено в версии Databricks CLI 1.5.0 |
log_analytics_info |
Map | Конфигурация агента Azure Log Analytics. См. log_analytics_info. |
cluster.azure_attributes.log_analytics_info
Type: Map
Конфигурация агента Azure Log Analytics.
| Key | Type | Description |
|---|---|---|
log_analytics_workspace_id |
String | Идентификатор рабочей области Azure Log Analytics. |
log_analytics_primary_key |
String | Первичный ключ для рабочей области Azure Log Analytics. |
cluster.gcp_attributes
Type: Map
Атрибуты, связанные с кластерами, работающими на Google Cloud Platform.
| Key | Type | Description |
|---|---|---|
use_preemptible_executors |
Boolean | Следует ли использовать предварительно подготовленных исполнителей. Предварительно подготовленные исполняемые экземпляры GCE — это экземпляры GCE, которые могут быть восстановлены GCE в любое время. |
google_service_account |
String | Учетная запись службы Google, используемая экземплярами виртуальных машин кластера Databricks. |
local_ssd_count |
Integer | Количество локальных SSD для подключения к каждому узлу в кластере. Значение по умолчанию — 0. |
zone_id |
String | Идентификатор зоны доступности или центра обработки данных, в котором находится кластер. |
availability |
String | Определяет, запланированы ли исполнители Spark на преэмпируемых виртуальных машинах, виртуальных машинах по требованию или преэмптивируемых виртуальных машинах с запасным вариантом использования виртуальных машин по требованию, если первая недоступна. Допустимые значения: PREEMPTIBLE_GCP, ON_DEMAND_GCPPREEMPTIBLE_WITH_FALLBACK_GCP. |
boot_disk_size |
Integer | Размер загрузочного диска в ГБ. Значения обычно варьируются от 100 до 1000. |
cluster.cluster_log_conf
Конфигурация доставки журналов Spark в долгосрочное место хранения.
| Key | Type | Description |
|---|---|---|
dbfs |
Map | Расположение DBFS для доставки логов кластера. См. dbfs. |
s3 |
Map | Место хранения S3 для доставки логов кластера. См. s3. |
volumes |
Map | Расположение томов для передачи журналов кластера. См. объёмы данных. |
cluster.cluster_log_conf.dbfs
Type: Map
Расположение DBFS для доставки логов кластера.
| Key | Type | Description |
|---|---|---|
destination |
String | Путь DBFS для доставки журналов кластера (например, dbfs:/cluster-logs). |
cluster.cluster_log_conf.s3
Type: Map
Место хранения S3 для доставки логов кластера.
| Key | Type | Description |
|---|---|---|
destination |
String | URI S3 для доставки журналов кластера (например, s3://my-bucket/cluster-logs). |
region |
String | Регион AWS контейнера S3. |
endpoint |
String | URL-адрес конечной точки S3 (необязательно). |
enable_encryption |
Boolean | Следует ли включить шифрование для журналов кластера. |
encryption_type |
String | Тип шифрования. Допустимые значения включают SSE_S3, SSE_KMS. |
kms_key |
String | Ключ KMS ARN для шифрования (при использовании SSE_KMS). |
canned_acl |
String | Готовая ACL, применяемая к журналам кластера. |
cluster.cluster_log_conf.томов
Type: Map
Расположение томов для передачи журналов кластера.
| Key | Type | Description |
|---|---|---|
destination |
String | Путь тома для передачи журналов кластера (например, /Volumes/catalog/schema/volume/cluster_log). |
cluster.docker_image
Type: Map
Настраиваемая конфигурация образа Docker.
| Key | Type | Description |
|---|---|---|
url |
String | URL-адрес образа Docker. |
basic_auth |
Map | Базовая проверка подлинности для репозитория Docker. См. basic_auth. |
cluster.docker_image.basic_auth
Type: Map
Базовая проверка подлинности для репозитория Docker.
| Key | Type | Description |
|---|---|---|
username |
String | Имя пользователя для проверки подлинности реестра Docker. |
password |
String | Пароль для проверки подлинности реестра Docker. |
cluster.init_scripts
Type: Map
Конфигурация для хранения скриптов инициализации. Необходимо указать по крайней мере один тип расположения.
| Key | Type | Description |
|---|---|---|
dbfs |
Map | Расположение скрипта инициализации в DBFS. См. dbfs. |
workspace |
Map | Расположение рабочей области скрипта init. См. рабочую область . |
s3 |
Map | Расположение скрипта инициализации S3. См. s3. |
abfss |
Map | Расположение скрипта инициализации ABFSS. См. abfss. |
gcs |
Map | Расположение скрипта инициализации в GCS. См. gcs. |
volumes |
Map | Расположение томов каталога Unity для скрипта инициализации. См. объёмы данных. |
cluster.init_scripts.dbfs
Type: Map
Расположение скрипта инициализации в DBFS.
| Key | Type | Description |
|---|---|---|
destination |
String | Путь DBFS инициализационного скрипта. |
cluster.init_scripts.workspace
Type: Map
Расположение рабочей области скрипта init.
| Key | Type | Description |
|---|---|---|
destination |
String | Путь к рабочей области скрипта инициализации. |
cluster.init_scripts.s3
Type: Map
Расположение скрипта инициализации S3.
| Key | Type | Description |
|---|---|---|
destination |
String | URI-адрес S3 для init script. |
region |
String | Регион AWS контейнера S3. |
endpoint |
String | URL-адрес конечной точки S3 (необязательно). |
cluster.init_scripts.abfss
Type: Map
Расположение скрипта инициализации ABFSS.
| Key | Type | Description |
|---|---|---|
destination |
String | Путь скрипта инициализации ABFSS. |
cluster.init_scripts.gcs
Type: Map
Расположение скрипта инициализации в GCS.
| Key | Type | Description |
|---|---|---|
destination |
String | Путь GCS к скрипту инициализации. |
cluster.init_scripts.томов
Type: Map
Расположение томов скрипта инициализации.
| Key | Type | Description |
|---|---|---|
destination |
String | Путь к томам каталога Unity скрипта инициализации. |
cluster.driver_node_type_flexibility
Type: Map
Конфигурация гибкого типа узла для узла драйвера.
Добавлено в Databricks CLI версии 0.285.0
| Key | Type | Description |
|---|---|---|
alternate_node_type_ids |
Sequence | Список идентификаторов типов узлов, используемых в качестве резервных копий, когда тип основного узла недоступен. Добавлено в Databricks CLI версии 0.285.0 |
cluster.worker_node_type_flexibility
Type: Map
Конфигурация гибкого типа узла для рабочих узлов.
Добавлено в Databricks CLI версии 0.285.0
| Key | Type | Description |
|---|---|---|
alternate_node_type_ids |
Sequence | Список идентификаторов типов узлов, используемых в качестве резервных копий, когда тип основного узла недоступен. Добавлено в Databricks CLI версии 0.285.0 |
кластер.тип_нагрузки
Type: Map
Атрибуты кластера, показывающие типы рабочих нагрузок кластера.
| Key | Type | Description |
|---|---|---|
clients |
Map | Определяет тип клиентов, которые могут использовать кластер. Просмотр клиентов. |
cluster.workload_type.клиенты
Type: Map
Тип клиентов для этой вычислительной рабочей нагрузки.
| Key | Type | Description |
|---|---|---|
jobs |
Boolean | Может ли кластер выполнять задания. |
notebooks |
Boolean | Может ли кластер запускать ноутбуки. |
Examples
В следующем примере создается выделенный (один пользователь) кластер для текущего пользователя с Databricks Runtime 15.4 LTS и политикой кластера:
resources:
clusters:
my_cluster:
num_workers: 0
node_type_id: 'i3.xlarge'
driver_node_type_id: 'i3.xlarge'
spark_version: '15.4.x-scala2.12'
spark_conf:
'spark.executor.memory': '2g'
autotermination_minutes: 60
enable_elastic_disk: true
single_user_name: ${workspace.current_user.userName}
policy_id: '000128DB309672CA'
enable_local_disk_encryption: false
data_security_mode: SINGLE_USER
runtime_engine: STANDARD
В этом примере создается простой кластер my_cluster, который затем используется для запуска блокнота в my_job.
bundle:
name: clusters
resources:
clusters:
my_cluster:
num_workers: 2
node_type_id: 'i3.xlarge'
autoscale:
min_workers: 2
max_workers: 7
spark_version: '13.3.x-scala2.12'
spark_conf:
'spark.executor.memory': '2g'
jobs:
my_job:
tasks:
- task_key: test_task
notebook_task:
notebook_path: './src/my_notebook.py'
existing_cluster_id: ${resources.clusters.my_cluster.id}
панель мониторинга
Type: Map
Ресурс панели мониторинга позволяет управлять панелями мониторинга AI/BI в пакете. Сведения о панелях мониторинга AI/BI см. в панелях мониторинга.
Если вы развернули пакет, содержащий панель мониторинга из локальной среды, а затем используйте пользовательский интерфейс для изменения этой панели мониторинга, изменения, внесенные с помощью пользовательского интерфейса, не применяются к JSON-файлу панели мониторинга в локальном пакете, если вы явно не обновите его с помощью bundle generate. Вы можете использовать параметр --watch для непрерывного опроса и получения изменений на панели мониторинга. См. создание пакета databricks.
Кроме того, если вы пытаетесь развернуть пакет из локальной среды, содержащей JSON-файл панели мониторинга, отличный от одного из них в удаленной рабочей области, возникнет ошибка. Чтобы выполнить развертывание и перезаписать панель мониторинга в удаленной рабочей области с локальной версией, используйте параметр --force. См. сведения о развертывании пакета databricks.
Добавлено в Databricks CLI версии 0.232.0
Note
При использовании декларативного пакета автоматизации с поддержкой Git панели мониторинга не создавайте повторяющиеся панели мониторинга путем добавления сопоставления синхронизации , чтобы исключить синхронизацию панелей мониторинга в виде файлов:
sync:
exclude:
- src/*.lvdash.json
dashboards:
<dashboard-name>:
<dashboard-field-name>: <dashboard-field-value>
| Key | Type | Description |
|---|---|---|
dataset_catalog |
String | Значение каталога по умолчанию, используемое всеми наборами данных на панели мониторинга, если оно не указано в запросе. Пример конфигурации, задающей это поле, см. в каталоге панелей мониторинга и параметризации схем. Добавлено в Databricks CLI версии 0.283.0 |
dataset_schema |
String | Значение схемы по умолчанию, используемое всеми наборами данных на панели мониторинга, если оно не указано в запросе. Пример конфигурации, задающей это поле, см. в каталоге панелей мониторинга и параметризации схем. Добавлено в Databricks CLI версии 0.283.0 |
display_name |
String | Отображаемое имя панели мониторинга. Добавлено в Databricks CLI версии 0.232.0 |
embed_credentials |
Boolean | Используются ли учетные данные удостоверения развертывания пакета для выполнения запросов для всех пользователей панелей мониторинга? Если задано значение false, используются учетные данные средства просмотра. Значение по умолчанию — false.Добавлено в Databricks CLI версии 0.232.0 |
etag |
String | Etag для панели мониторинга. При обновлении можно при необходимости обеспечить, чтобы панель мониторинга не была изменена с момента последнего чтения. Добавлено в Интерфейс командной строки Databricks версии 0.234.0 |
file_path |
String | Локальный путь к ресурсу панели мониторинга, включая имя файла. Экспортированные панели мониторинга всегда имеют расширение .lvdash.jsonфайла.Добавлено в Databricks CLI версии 0.232.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. |
parent_path |
String | Путь к рабочей области папки, содержащей панель мониторинга. Включает косую черту и без косой черты. Добавлено в Databricks CLI версии 0.232.0 |
path |
String | Путь к рабочей области ресурса панели мониторинга, включая имя ресурса. Добавлено в Интерфейс командной строки Databricks версии 0.234.0 |
permissions |
Sequence | Разрешения панели мониторинга. Просмотр разрешений. Добавлено в Databricks CLI версии 0.232.0 |
serialized_dashboard |
Any | Содержимое панели мониторинга в сериализованной строковой форме. Добавлено в Databricks CLI версии 0.232.0 |
warehouse_id |
String | Идентификатор хранилища, используемый для запуска панели мониторинга. Добавлено в Databricks CLI версии 0.232.0 |
Example
Пример ниже демонстрирует и развертывает образец панели мониторинга NYC Taxi Trip Analysis в рабочей области Databricks.
resources:
dashboards:
nyc_taxi_trip_analysis:
display_name: 'NYC Taxi Trip Analysis'
file_path: ../src/nyc_taxi_trip_analysis.lvdash.json
warehouse_id: ${var.warehouse_id}
каталог базы данных
Type: Map
Ресурс каталога базы данных позволяет определить каталоги баз данных , соответствующие экземплярам базы данных в пакете. Каталог базы данных — это база данных Lakebase, зарегистрированная в качестве каталога каталога Unity.
Сведения о каталогах баз данных см. в разделе "Создание каталога".
Добавлено в Databricks CLI версии 0.265.0
database_catalogs:
<database_catalog-name>:
<database_catalog-field-name>: <database_catalog-field-value>
| Key | Type | Description |
|---|---|---|
create_database_if_not_exists |
Boolean | Следует ли создать базу данных, если она не существует. Добавлено в Databricks CLI версии 0.265.0 |
database_instance_name |
String | Имя экземпляра, в который будет встроена база данных. Добавлено в Databricks CLI версии 0.265.0 |
database_name |
String | Название базы данных (в экземпляре), связанной с каталогом. Добавлено в Databricks CLI версии 0.265.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса, включая поведение ресурса при его развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.265.0 |
name |
String | Имя каталога в каталоге Unity. Добавлено в Databricks CLI версии 0.265.0 |
Example
В следующем примере определяется экземпляр базы данных с соответствующим каталогом базы данных:
resources:
database_instances:
my_instance:
name: my-instance
capacity: CU_1
database_catalogs:
my_catalog:
database_instance_name: ${resources.database_instances.my_instance.name}
name: example_catalog
database_name: my_database
create_database_if_not_exists: true
database_instance
Type: Map
Ресурс экземпляра базы данных позволяет определять экземпляры базы данных в пакете. Экземпляр базы данных Lakebase управляет хранилищем и вычислительными ресурсами и предоставляет конечные точки, к которым подключаются пользователи.
Note
Новые экземпляры базы данных, созданные ресурсом database_instances , теперь создаются как проекты автомасштабирования Lakebase. Дополнительные сведения см. в разделе "Автомасштабирование по умолчанию ". Для новой работы Lakebase рекомендуется использовать postgres_projects ресурс.
Это важно
При развертывании пакета с экземпляром базы данных экземпляр немедленно запускается и подлежит ценообразованию. См. цены на Lakebase.
Сведения об экземплярах базы данных см. в разделе "Подготовлено" в Lakebase.
Добавлено в Databricks CLI версии 0.265.0
database_instances:
<database_instance-name>:
<database_instance-field-name>: <database_instance-field-value>
| Key | Type | Description |
|---|---|---|
capacity |
String | SKU экземпляра. Допустимые значения: CU_1, CU_2, CU_4, CU_8.Добавлено в Databricks CLI версии 0.265.0 |
custom_tags |
Sequence | Список пар "ключ-значение", указывающих пользовательские теги, связанные с экземпляром. Добавлено в Databricks CLI версии 0.273.0 |
enable_pg_native_login |
Boolean | Включен ли в экземпляре имя входа в собственный пароль PG. По умолчанию — true.Добавлено в Databricks CLI версии 0.267.0 |
enable_readable_secondaries |
Boolean | Следует ли включить передачу трафика, доступного только для чтения. По умолчанию — false.Добавлено в Databricks CLI версии 0.265.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
name |
String | Имя экземпляра. Это уникальный идентификатор для экземпляра. Добавлено в Databricks CLI версии 0.265.0 |
node_count |
Integer | Количество узлов в экземпляре, состоящее из 1 первичного и 0 или более секундных файлов. По умолчанию используется 1 основной и 0 секундных файлов. Добавлено в Databricks CLI версии 0.265.0 |
parent_instance_ref |
Map | Ссылка на родительский объект. Это доступно только в том случае, если экземпляр является дочерним экземпляром. См. родительский экземпляр. Добавлено в Databricks CLI версии 0.265.0 |
permissions |
Sequence | Разрешения экземпляра базы данных. Просмотр разрешений. Добавлено в Databricks CLI версии 0.265.0 |
retention_window_in_days |
Integer | Окно хранения для экземпляра. Это период времени в днях, в течение которых хранятся исторические данные. Значение по умолчанию — 7 дней. Допустимые значения — от 2 до 35 дней. Добавлено в Databricks CLI версии 0.265.0 |
stopped |
Boolean | Останавливается ли экземпляр. Добавлено в Databricks CLI версии 0.265.0 |
usage_policy_id |
String | Требуемая политика бессерверного использования, связанная с экземпляром. Добавлено в Databricks CLI версии 0.273.0 |
database_instance.parent_instance_ref
Type: Map
Ссылка на родительский объект. Это доступно только в том случае, если экземпляр является дочерним экземпляром.
| Key | Type | Description |
|---|---|---|
branch_time |
String | Время ветвления экземпляра базы данных ref. Для родительского экземпляра ссылок это точка во времени родительского экземпляра, из которого был создан экземпляр. Для дочернего экземпляра это момент во времени на родительском экземпляре, из которого был создан дочерний экземпляр. |
lsn |
String | Указанный пользователем WAL LSN экземпляра эталонной базы данных. |
name |
String | Имя экземпляра ref базы данных. |
Example
В следующем примере определяется экземпляр базы данных с соответствующим каталогом базы данных:
resources:
database_instances:
my_instance:
name: my-instance
capacity: CU_1
database_catalogs:
my_catalog:
database_instance_name: ${resources.database_instances.my_instance.name}
name: example_catalog
database_name: my_database
create_database_if_not_exists: true
Пример пакета, демонстрирующего определение экземпляра базы данных и соответствующего каталога баз данных, см. в разделе bundle-examples GitHub репозиторий.
эксперимент
Type: Map
Ресурс эксперимента позволяет определить эксперименты MLflow в составе пакета. Сведения об экспериментах MLflow см. в разделе Упорядочить тренировочные запуски с помощью экспериментов MLflow.
experiments:
<experiment-name>:
<experiment-field-name>: <experiment-field-value>
| Key | Type | Description |
|---|---|---|
artifact_location |
String | Расположение, в котором хранятся артефакты для эксперимента. Расположение должно содержать схему URI, например dbfs: или s3:. Для хранения артефактов в томе каталога Unity (рекомендуется, требуется MLflow 2.15.0 или более поздней версии), используйте путь к форме dbfs:/Volumes/<catalog>/<schema>/<volume>/<path>. См. статью "Создание эксперимента" из рабочей области. |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
name |
String | Понятное имя, определяющее эксперимент. Имя эксперимента должно быть абсолютным путем в рабочей области Databricks, например /Workspace/Users/someone@example.com/my_experiment. |
permissions |
Sequence | Разрешения эксперимента. Просмотр разрешений. |
tags |
Sequence | Дополнительные пары "ключ-значение" метаданных. См. теги. Чтобы задать описание эксперимента, используйте mlflow.note.content тег. Чтобы подключить бессерверную политику бюджета, используйте mlflow.workload_creation_policy_id тег. См. раздел "Использование атрибутов с бессерверными политиками". |
Example
В следующем примере определяется эксперимент, который могут просматривать все пользователи:
resources:
experiments:
experiment:
name: /Workspace/Users/someone@example.com/my_experiment
permissions:
- level: CAN_READ
group_name: users
tags:
- key: mlflow.note.content
value: MLflow experiment used to track runs
external_location (каталог Unity)
Type: Map
Ресурс внешнего расположения позволяет определить внешние расположения (каталог Unity) в пакете.
Note
Использование декларативных пакетов автоматизации для определения внешних расположений поддерживается только в том случае, если вы используете подсистему прямого развертывания.
Добавлено в Databricks CLI версии 0.289.0
external_locations:
<external-location-name>:
<external-location-field-name>: <external-location-field-value>
| Key | Type | Description |
|---|---|---|
comment |
String | Текстовое описание внешнего расположения, предоставленного пользователем. Добавлено в Databricks CLI версии 0.289.0 |
credential_name |
String | Обязательное. Имя учетных данных хранилища, используемых в этом расположении. Добавлено в Databricks CLI версии 0.289.0 |
enable_file_events |
Boolean | Следует ли включить события файлов в этом внешнем расположении. По умолчанию — true. Фактическое примененное значение может отличаться из-за значений по умолчанию на стороне сервера. Проверьте effective_enable_file_events эффективное состояние.Добавлено в Databricks CLI версии 0.289.0 |
encryption_details |
Map | Параметры шифрования, применяемые к клиентам, подключающимся к облачному хранилищу. См. раздел external_location.encryption_details. Добавлено в Databricks CLI версии 0.289.0 |
fallback |
Boolean | Указывает, включен ли резервный режим для этого внешнего расположения. Если включен резервный режим, доступ к расположению возвращается к учетным данным кластера, если учетные данные каталога Unity недостаточно. Добавлено в Databricks CLI версии 0.289.0 |
file_event_queue |
Map | Параметры очереди событий файла для этого внешнего расположения. Если enable_file_events это не falseтак, этот ключ должен быть определен и иметь именно одно из документированных свойств. См. раздел external_location.file_event_queue.Добавлено в Databricks CLI версии 0.289.0 |
grants |
Sequence | Гранты, связанные с внешним расположением. См.грант. Добавлено в Databricks CLI версии 0.289.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.289.0 |
name |
String | Обязательное. Имя внешнего расположения. Добавлено в Databricks CLI версии 0.289.0 |
read_only |
Boolean | Указывает, является ли внешнее расположение доступным только для чтения. Добавлено в Databricks CLI версии 0.289.0 |
skip_validation |
Boolean | Пропускает проверку учетных данных хранилища, связанных с внешним расположением. Добавлено в Databricks CLI версии 0.289.0 |
url |
String | Обязательное. URL путь внешнего местоположения. Добавлено в Databricks CLI версии 0.289.0 |
external_location.encryption_details
Type: Map
Параметры шифрования, применяемые к клиентам, подключающимся к облачному хранилищу.
| Key | Type | Description |
|---|---|---|
sse_encryption_details |
Map | Свойства шифрования на стороне сервера для клиентов, взаимодействующих с Amazon S3. |
external_location.file_event_queue
Type: Map
Параметры очереди событий файла для этого внешнего расположения.
| Key | Type | Description |
|---|---|---|
managed_aqs |
Map | Управляемые Хранилище очередей Azure параметры. |
managed_pubsub |
Map | Управляемые параметры Google Cloud Pub/Sub. |
managed_sqs |
Map | Управляемые параметры Amazon SQS. |
provided_aqs |
Map | Предоставленные пользователем параметры Хранилище очередей Azure. |
provided_pubsub |
Map | Пользовательские параметры Google Cloud Pub/Sub. |
provided_sqs |
Map | Параметры Amazon SQS, предоставленные пользователем. |
Example
# databricks.yml
bundle:
name: external-locations-example
engine: direct # External locations require the direct deployment engine
resources:
external_locations:
my_external_location:
name: my_external_location
url: 's3://my-bucket/my-path'
credential_name: my_storage_credential
comment: 'External location created by Databricks Asset Bundles'
grants:
- principal: someone@example.com
privileges:
- CREATE_EXTERNAL_TABLE
- READ_FILES
genie_space
Type: Map
Ресурс агента Genie позволяет определять агенты Genie в пакете. Дополнительные сведения об агентах Genie см. в разделе "Агенты Genie".
Note
Использование декларативных пакетов автоматизации для определения агентов Genie поддерживается только в том случае, если вы используете подсистему прямого развертывания.
Добавлено в Databricks CLI версии 1.3.0
genie_spaces:
<genie_space-name>:
<genie_space-field-name>: <genie_space-field-value>
| Key | Type | Description |
|---|---|---|
description |
String | Описание агента Genie. Добавлено в Databricks CLI версии 1.3.0 |
file_path |
String | Путь к локальному файлу (например, sales_analytics.geniespace.json), который будет использоваться вместо serialized_space записи. |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 1.3.0 |
parent_path |
String | Путь к родительской папке, в которой будет зарегистрирован агент Genie. Добавлено в Databricks CLI версии 1.3.0 |
permissions |
Sequence | Разрешения агента Genie. Просмотр разрешений. Добавлено в Databricks CLI версии 1.3.0 |
serialized_space |
String | Обязательное. Содержимое агента Genie в сериализованной строковой форме. Это поле предоставляет структуру строки JSON, представляющей макет и компоненты пространства. Если file_path задано, оно принимает предопределенность serialized_space.Добавлено в Databricks CLI версии 1.3.0 |
title |
String | Необязательный заголовок переопределяется для агента Genie. Добавлено в Databricks CLI версии 1.3.0 |
warehouse_id |
String | Обязательное. Идентификатор хранилища SQL для связывания с новым пространством. Добавлено в Databricks CLI версии 1.3.0 |
Examples
В следующем примере определяется ресурс агента Genie:
# databricks.yml
bundle:
name: nyc-taxi-genie
engine: direct # genie_spaces require the direct deployment engine
resources:
genie_spaces:
nyc_taxi_genie:
title: 'NYC Taxi Trip Analysis'
description: 'Ask questions about NYC taxi trip data in natural language'
warehouse_id: <warehouse-id>
file_path: ./nyc_taxi_genie.geniespace.json
permissions:
- level: CAN_RUN
group_name: users
nyc_taxi_genie.geniespace.json Соответствующий файл содержит сериализованное определение пространства, включая источники данных, инструкции и примеры вопросов. Вместо этого его можно указать в serialized_space YAML.
// nyc_taxi_genie.geniespace.json
{
"version": 2,
"config": {
"sample_questions": [
{
"id": "11111111111111111111111111111111",
"question": ["What is the average fare per trip?"]
}
]
},
"data_sources": {
"tables": [
{
"identifier": "samples.nyctaxi.trips",
"column_configs": [
{ "column_name": "fare_amount" },
{ "column_name": "pickup_zip" },
{ "column_name": "tpep_pickup_datetime" },
{ "column_name": "trip_distance" }
]
}
]
},
"instructions": {
"text_instructions": [
{
"id": "22222222222222222222222222222222",
"content": ["Fare amounts are in USD. When asked about revenue, use SUM(fare_amount)."]
}
]
}
}
instance_pool
Type: Map
Ресурс instance_pool позволяет задавать пулы экземпляров в бандле. Пул инстансов сохраняет набор неактивных, готовых к использованию облачных экземпляров, чтобы кластеры, связанные с пулом, начинались и масштабировались быстрее. Для информации о пулах экземпляров см. раздел «Соединить пулы».
Note
Использование Declarative Automation Bundles для определения пулов инстансов поддерживается только при использовании движка прямого развертывания.
Добавлено в Databricks CLI версии 1.9.0
instance_pools:
<instance_pool-name>:
<instance_pool-field-name>: <instance_pool-field-value>
| Key | Type | Description |
|---|---|---|
aws_attributes |
Map | Атрибуты, связанные с пулами экземпляров, работающими на Amazon Web Services. Если при создании пула не указано, используется набор значений по умолчанию. См. instance_pool.aws_attributes. Добавлено в Databricks CLI версии 1.9.0 |
azure_attributes |
Map | Атрибуты, связанные с пулами экземпляров, работающими на Azure. Если при создании пула не указано, используется набор значений по умолчанию. См. instance_pool.azure_attributes. Добавлено в Databricks CLI версии 1.9.0 |
custom_tags |
Map | Дополнительные теги для ресурсов пула. Databricks объединяет все ресурсы (например, экземпляры AWS и тома EBS) этими тегами в дополнение default_tagsк . Databricks поддерживает максимум 45 пользовательских тегов.Добавлено в Databricks CLI версии 1.9.0 |
disk_spec |
Map | Спецификация дисков для подключения ко всем контейнерам Spark. См. instance_pool.disk_spec. Добавлено в Databricks CLI версии 1.9.0 |
enable_elastic_disk |
Boolean | Автоматическое масштабирование локального хранилища: при включении экземпляры в этом пуле динамически получают дополнительное место на диске, когда их Spark-работники заканчиваются на диске. В AWS для корректной работы этой функции требуется определённые разрешения AWS. Добавлено в Databricks CLI версии 1.9.0 |
gcp_attributes |
Map | Атрибуты, связанные с пулами экземпляров, работающими на Google Cloud Platform. Если при создании пула не указано, используется набор значений по умолчанию. См. instance_pool.gcp_attributes. Добавлено в Databricks CLI версии 1.9.0 |
idle_instance_autotermination_minutes |
Integer | Автоматически завершает дополнительные экземпляры в кэше пула после их неактивности в течение этого времени за несколько минут, если требование min_idle_instances уже выполнено. Если экземпляры не настроены, дополнительные экземпляры пула автоматически завершаются после тайм-аута по умолчанию. Если указано, порог должен быть между 0 и 10000 минутами. Установите это значение так 0 , чтобы мгновенно удалять простоящие экземпляры из кэша, если минимальный размер кэша всё ещё удерживается.Добавлено в Databricks CLI версии 1.9.0 |
instance_pool_name |
String | Обязательное. Имя пула. Название пула должно быть уникальным, а его длина — от 1 до 100 символов. Добавлено в Databricks CLI версии 1.9.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 1.9.0 |
max_capacity |
Integer | Максимальное количество невыплаченных экземпляров для сохранения в пуле, включая как экземпляры, используемые кластерами, так и простаивающими. Кластеры, требующие дополнительной настройки экземпляров, не работают во время запросов на апсайз. Добавлено в Databricks CLI версии 1.9.0 |
min_idle_instances |
Integer | Минимальное количество простающих экземпляров для хранения в пуле экземпляров. Добавлено в Databricks CLI версии 1.9.0 |
node_type_flexibility |
Map | Гибкая конфигурация типов узлов для пула. См. instance_pool.node_type_flexibility. Добавлено в Databricks CLI версии 1.9.0 |
node_type_id |
String | Обязательное. Это поле кодирует через одно значение ресурсы, доступные каждому узлу Spark в кластерах, использующих этот пул. Например, узлы Spark могут быть подготовлены и оптимизированы для операций в памяти или для ресурсоемких рабочих нагрузок. Список доступных типов узлов можно получить с помощью API типов узлов списка. Добавлено в Databricks CLI версии 1.9.0 |
permissions |
Sequence | Права на пул экземпляров. Допустимые уровни — CAN_MANAGE и CAN_ATTACH_TO. Просмотр разрешений.Добавлено в Databricks CLI версии 1.9.0 |
preloaded_docker_images |
Sequence | Пользовательские образы Docker для предварительной загрузки на экземплярах пула. См. instance_pool.preloaded_docker_images. Добавлено в Databricks CLI версии 1.9.0 |
preloaded_spark_versions |
Sequence | Список, содержащий максимум одну предзагруженную версию Spark для пула. Кластеры с базой пула начинались с предустановленной версии Spark быстрее. Список доступных версий Spark можно получить с помощью API доступных версий Spark. Добавлено в Databricks CLI версии 1.9.0 |
remote_disk_throughput |
Integer | Настраиваемая пропускная способность в МБ в секунду для удалённого диска. В настоящее время поддерживается только для типов GCP HYPERDISK_BALANCED .Добавлено в Databricks CLI версии 1.9.0 |
total_initial_remote_disk_size |
Integer | Общий начальный размер тома — в ГБ — удалённых дисков. В настоящее время поддерживается только для типов GCP HYPERDISK_BALANCED .Добавлено в Databricks CLI версии 1.9.0 |
instance_pool.aws_атрибуты
Type: Map
Атрибуты, связанные с пулами экземпляров, работающими на Amazon Web Services. Если при создании пула не указано, используется набор значений по умолчанию.
Добавлено в Databricks CLI версии 1.9.0
| Key | Type | Description |
|---|---|---|
availability |
String | Тип доступности, используемый для спотовых узлов. Допустимые значения — SPOT и ON_DEMAND.Добавлено в Databricks CLI версии 1.9.0 |
instance_profile_arn |
String | (Бета) Все экземпляры AWS, входящие в пул экземпляров, имеют этот профиль. Если это отсутствует, экземпляры изначально запускаются с профилем экземпляра рабочего пространства по умолчанию. Если это определено, кластеры, использующие пул, наследуют профиль экземпляра и не должны указывать свой собственный профиль при создании или обновлении кластера. Если пул не указывает профиль экземпляра, кластеры, использующие этот пул, могут указывать любой профиль экземпляра. Профиль экземпляра должен быть ранее добавлен в среду Databricks администратором учетной записи. Эта функция может быть доступна только для определённых клиентов. Добавлено в Databricks CLI версии 1.9.0 |
spot_bid_price_percent |
Integer | Вычисляет цену ставки для спотовых инстансов AWS в процентах от цены по запросу соответствующего типа экземпляра. Например, если это поле установлено как 50 и пулу нужен новый r3.xlarge спотовый экземпляр, то цена ставки составляет половину цены инстанса по запросу r3.xlarge . Если не задано, по умолчанию используется значение 100. Это поле не должно быть больше 10000.Добавлено в Databricks CLI версии 1.9.0 |
zone_id |
String | Идентификатор зоны доступности/дата-центра, в котором находится пул, например us-west-2a. Предоставленная зона доступности должна находиться в том же регионе, что и развертывание Databricks. Это необязательное поле, и если оно не указано, используется стандартная зона. Список доступных зон, а также значение по умолчанию можно найти с помощью API зон списка.Добавлено в Databricks CLI версии 1.9.0 |
instance_pool.azure_attributes
Type: Map
Атрибуты, связанные с пулами экземпляров, работающими на Azure. Если при создании пула не указано, используется набор значений по умолчанию.
Добавлено в Databricks CLI версии 1.9.0
| Key | Type | Description |
|---|---|---|
availability |
String | Тип доступности, используемый для спотовых узлов. Допустимые значения — SPOT_AZURE и ON_DEMAND_AZURE.Добавлено в Databricks CLI версии 1.9.0 |
capacity_reservation_group |
String | Идентификатор ресурса группы резервирования емкости Azure для запуска виртуальных машин в этом пуле. При указании виртуальные машины запускаются с использованием предоставленного резерва ёмкости. Исключение этого поля очищает существующую настроенную группу резервирования пропускной способности в бассейне. Резервирование ёмкости можно задать только тогда, когда рабочее пространство использует внедрённый VNet (VNet, определённый клиентом, не управляемый Databricks). Корпоративному databricks-login-prod приложению должны быть предоставлены следующие четыре разрешения:
Используйте формат /subscriptions/{subscriptionId}/resourceGroups/{resourceGroupName}/providers/Microsoft.Compute/capacityReservationGroups/{capacityReservationGroupName}.Добавлено в Databricks CLI версии 1.9.0 |
spot_bid_max_price |
Number | Максимальная цена для спотовых экземпляров Azure — в долларах США (USD). Например, значение 2 устанавливает максимальную цену $2.00 USD в час. Установите максимальную цену -1 , чтобы виртуальная машина не была выселена из-за цены. Цена для виртуальной машины — это текущая цена для спота или цена стандартной виртуальной машины, в зависимости от того, что меньше, при условии, что есть доступная ёмкость и квота.Добавлено в Databricks CLI версии 1.9.0 |
instance_pool.disk_spec
Type: Map
Спецификация дисков для подключения ко всем контейнерам Spark.
Добавлено в Databricks CLI версии 1.9.0
| Key | Type | Description |
|---|---|---|
disk_count |
Integer | Количество запущенных дисков для каждого экземпляра. Эта функция включена только для поддерживаемых типов узлов, и вы можете выбрать до предела дисков, поддерживаемых типом узла. Для типов узлов без диска ОС должен быть указан как минимум один диск, иначе создание кластера неудачно. Если диски подключены, Databricks настраивает Spark так, чтобы использовать диски только для нулевого хранилища, поскольку гетерогенные скретч-устройства могут привести к неэффективному использованию диска. Если диски не подключены, Databricks настраивает Spark на использование дисков хранилища экземпляров. Если указаны диски, то конфигурация spark.local.dir Spark переопределяется.Диски монтируются в /ebs0, /ebs1, и так далее для AWS, и в /remote_volume0, /remote_volume1, и так далее для Azure.Добавлено в Databricks CLI версии 1.9.0 |
disk_iops |
Integer | Количество IOPS для обеспечения для каждого подключённого диска. Добавлено в Databricks CLI версии 1.9.0 |
disk_size |
Integer | Размер каждого диска, в ГиБ, запускался для каждого экземпляра. Значения должны попадать в поддерживаемый диапазон для определённого типа экземпляра. Для AWS универсальный SSD — 100–4096 ГиБ, а HDD с оптимизированной пропускной способностью — 500–4096 ГиБ. Для Azure премиум-LRS (SSD) — 1–1023 ГиБ, а стандартный LRS (HDD) — 1–1023 ГиБ. Добавлено в Databricks CLI версии 1.9.0 |
disk_throughput |
Integer | Пропускная способность диска для каждого подключённого диска — в МБ в секунду. Добавлено в Databricks CLI версии 1.9.0 |
disk_type |
Map | Тип дисков для запуска с экземплярами пула. Установить либо azure_disk_volume_type (допустимые значения — PREMIUM_LRS и STANDARD_LRS) или ebs_volume_type (допустимые значения — GENERAL_PURPOSE_SSD и THROUGHPUT_OPTIMIZED_HDD).Добавлено в Databricks CLI версии 1.9.0 |
instance_pool.gcp_атрибуты
Type: Map
Атрибуты, связанные с пулами экземпляров, работающими на Google Cloud Platform. Если при создании пула не указано, используется набор значений по умолчанию.
Добавлено в Databricks CLI версии 1.9.0
| Key | Type | Description |
|---|---|---|
gcp_availability |
String | Определяет, содержит ли пул экземпляров прерываемые виртуальные машины, виртуальные машины по запросу или преемппируемые виртуальные машины с резервным вариантом использования виртуальных машин по требованию, если первая недоступна. Допустимые значения: PREEMPTIBLE_GCP, ON_DEMAND_GCP и PREEMPTIBLE_WITH_FALLBACK_GCP.Добавлено в Databricks CLI версии 1.9.0 |
local_ssd_count |
Integer | Если это предусмотрено, каждый узел в пуле экземпляров имеет это количество локальных SSD. Каждый локальный SSD имеет размер 375 ГБ. Для поддерживаемого количества локальных SSD для каждого типа экземпляра см. документацию GCP. Добавлено в Databricks CLI версии 1.9.0 |
zone_id |
String | Идентификатор зоны доступности/дата-центра, в котором находится пул, например us-west1-a. Предоставленная зона доступности должна находиться в том же регионе, что и рабочее пространство Databricks. Это необязательное поле, и если оно не указано, используется стандартная зона. Установите это поле на HA высокодоступность, что распределяет узлы по зонам доступности для региона развертывания Databricks или в одну из доступных зон для типа и региона машины. Если пусто, Databricks выбирает зону доступности.Добавлено в Databricks CLI версии 1.9.0 |
instance_pool.node_type_flexibility
Type: Map
Гибкая конфигурация типов узлов для пула.
Добавлено в Databricks CLI версии 1.9.0
| Key | Type | Description |
|---|---|---|
alternate_node_type_ids |
Sequence | Список идентификаторов типов узлов, используемых в качестве резервных копий, когда тип основного узла недоступен. Добавлено в Databricks CLI версии 1.9.0 |
instance_pool.preloaded_docker_images
Type: Sequence
Пользовательские образы Docker для предварительной загрузки на экземплярах пула.
Добавлено в Databricks CLI версии 1.9.0
| Key | Type | Description |
|---|---|---|
basic_auth |
Map | Базовая аутентификация для репозитория Docker. Установить username и password.Добавлено в Databricks CLI версии 1.9.0 |
url |
String | URL изображения Docker. Добавлено в Databricks CLI версии 1.9.0 |
Example
Следующий пример определяет пул экземпляров и кластер, использующий его:
resources:
instance_pools:
my_pool:
instance_pool_name: my-pool
node_type_id: i3.xlarge
min_idle_instances: 2
max_capacity: 10
idle_instance_autotermination_minutes: 15
preloaded_spark_versions:
- '15.4.x-scala2.12'
clusters:
my_cluster:
cluster_name: my-cluster
instance_pool_id: ${resources.instance_pools.my_pool.id}
spark_version: '15.4.x-scala2.12'
num_workers: 2
работа
Type: Map
Задания поддерживаются в Python для декларативных пакетов автоматизации. См. databricks.bundles.jobs.
Ресурс задания позволяет вам определить работы и их соответствующие задачи в вашем пакете.
Сведения о заданиях см. в разделе "Задания Lakeflow". Учебник, использующий шаблон декларативных пакетов автоматизации для создания задания, см. в статье "Разработка задания с помощью декларативных пакетов автоматизации".
jobs:
<job-name>:
<job-field-name>: <job-field-value>
| Key | Type | Description |
|---|---|---|
budget_policy_id |
String | Идентификатор указанной пользователем политики бюджета, используемой для этого задания. Если не указано, при создании или изменении задания может применяться политика бюджета по умолчанию. Смотрите effective_budget_policy_id для ознакомления с политикой бюджета, используемой данной рабочей нагрузкой.Добавлено в Databricks CLI версии 0.231.0 |
continuous |
Map | Необязательное непрерывное свойство для этого задания. Непрерывное свойство гарантирует, что всегда выполняется одно выполнение. Можно использовать только один из schedule и continuous. См. непрерывный просмотр. |
deployment |
Map | Сведения о развертывании заданий, управляемых внешними источниками. См. развертывание. |
description |
String | Необязательное описание задания. Максимальная длина — 27700 символов в кодировке UTF-8. |
email_notifications |
Map | Необязательный набор адресов электронной почты, который уведомляется при запуске или завершении задания, а также при его удалении. См. email_notifications. |
environments |
Sequence | Список спецификаций среды выполнения задач, на которые можно ссылаться бессерверными задачами этого задания. Среда должна присутствовать для бессерверных задач. Для бессерверных задач записной книжки среда доступна на панели среды записной книжки. Для других бессерверных задач необходимо указать среду задач с помощью environment_key в параметрах задач. См. среды. |
format |
String | Deprecated. Формат задания. |
git_source |
Map | Необязательная спецификация для удаленного репозитория Git, содержащего исходный код, используемый задачами. См. job.git_source. Важно: Поле git_source и поле задачи source, установленное в GIT, не рекомендуется использовать для пакетов, так как локальные относительные пути могут не указывать на одно и то же содержимое в репозитории Git, а пакеты ожидают, что развернутое задание имеет такое же содержимое, как и локальная копия, из которой оно было развернуто.Вместо этого клонируйте репозиторий локально и настройте проект сборки в этом репозитории, чтобы источник задач был частью рабочей области. |
health |
Map | Необязательный набор правил здоровья, которые можно определить для этой работы. См. здоровье. |
job_clusters |
Sequence | Список спецификаций кластера заданий, которые могут совместно использоваться и повторно использоваться в задачах этой работы. См. job_clusters. |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
max_concurrent_runs |
Integer | Максимально допустимое количество (необязательно) параллельных процессов выполнения задания. Задайте это значение, если требуется одновременное выполнение нескольких процессов выполнения одного и того же задания. |
name |
String | Опциональное имя для задания. Максимальная длина — 4096 байт в кодировке UTF-8. |
notification_settings |
Map | Необязательные параметры уведомлений, используемые при отправке уведомлений в каждую из email_notifications и webhook_notifications для этой задачи. См. notification_settings. |
parameters |
Sequence | Определения параметров уровня задания. См. сведения о job.parameters. |
performance_target |
String | Определяет, насколько производительным или экономичным должно быть выполнение в среде без серверов. Добавлено в Databricks CLI версии 0.241.0 |
permissions |
Sequence | Разрешения работы. Просмотр разрешений. |
queue |
Map | Параметры очереди задания. См . очередь. |
run_as |
Map | Пользователь или принципал сервиса, под которым выполняется задание. Это поле указывает явную конфигурацию задачи run_as . Если задание не указано, задание выполняется от имени пользователя, создавшего задание. Необходимо указать либо user_name, либо service_principal_name. В противном случае возникает ошибка. См. run_as. |
schedule |
Map | Расписание (необязательно) с периодическим выполнением этого задания. Поведение по умолчанию заключается в том, что задание выполняется только при активации, щелкнув "Запустить сейчас" в пользовательском интерфейсе заданий или отправив запрос API в runNow. См. расписание. |
tags |
Map | Карта тегов, связанных с заданием. Они перенаправляются в кластер в виде тегов кластера для кластеров заданий и имеют те же ограничения, что и теги кластера. В задание можно добавить не более 25 тегов. |
tasks |
Sequence | Список спецификаций задач, выполняемых этим заданием. См. раздел "Добавление задач в задания" в декларативных пакетах автоматизации. Добавлено в Databricks CLI версии 0.237.0 |
timeout_seconds |
Integer | Необязательное время ожидания, применяемое к каждому запуску этой задачи. Значение 0 означает, что время ожидания не истекло. |
trigger |
Map | Конфигурация для активации запуска при выполнении определенных условий. См. триггер. |
usage_policy_id |
String | Идентификатор бессерверной политики использования, используемой для этого задания. Добавлено в Databricks CLI версии 0.273.0 |
webhook_notifications |
Map | Коллекция идентификаторов системных уведомлений для оповещения о начале или завершении выполнения каждого запуска этого задания. См. webhook_notifications. |
задача.непрерывный
Type: Map
Конфигурация для непрерывного выполнения задания.
| Key | Type | Description |
|---|---|---|
pause_status |
String | Независимо от того, приостановлено непрерывное задание или нет. Допустимые значения: PAUSED, UNPAUSED. |
task_retry_mode |
String | Укажите, как непрерывное задание применяет повторные попытки уровня задач. Допустимые значения — NEVER и ON_FAILURE. По умолчанию — NEVER. |
задача.развертывание
Type: Map
Сведения о развертывании заданий, управляемых внешними источниками.
| Key | Type | Description |
|---|---|---|
kind |
String | Тип развертывания. Например: BUNDLE. |
metadata_file_path |
String | Путь к файлу метаданных для развертывания. |
задача.уведомления_по_электронной_почте
Type: Map
Параметры уведомлений по электронной почте для выполнения задания.
| Key | Type | Description |
|---|---|---|
on_start |
Sequence | Список адресов электронной почты, которые нужно уведомить при запуске. |
on_success |
Sequence | Список адресов электронной почты для уведомления в случае успешного выполнения. |
on_failure |
Sequence | Список адресов электронной почты для уведомления о сбое выполнения. |
on_duration_warning_threshold_exceeded |
Sequence | Список адресов электронной почты для уведомления о превышении длительности выполнения порогового значения предупреждения. |
no_alert_for_skipped_runs |
Boolean | Следует ли игнорировать отправку оповещений для пропущенных запусков. |
on_streaming_backlog_exceeded |
Sequence | Список адресов электронной почты для уведомления о превышении пороговых значений невыполненной потоковой передачи для любого потока. Пороговые значения невыполненной работы потоковой передачи можно задать в health поле с помощью следующих метрик: STREAMING_BACKLOG_BYTES, , STREAMING_BACKLOG_RECORDSSTREAMING_BACKLOG_SECONDSили STREAMING_BACKLOG_FILES. Оповещение основано на 10-минутном среднем этих метрик. Если проблема сохраняется, уведомления будут обидены каждые 30 минут. |
Not needed as the translation remains the same: job.environments
Type: Sequence
Список спецификаций среды выполнения задач, на которые можно ссылаться бессерверными задачами задания.
Каждый элемент в списке JobEnvironment— это :
| Key | Type | Description |
|---|---|---|
environment_key |
String | Ключ среды. Он должен быть уникальным в задании. |
spec |
Map | Сущность, представляющая бессерверную среду. См. job.environments.spec. |
job.environments.spec
Type: Map
Сущность, представляющая бессерверную среду.
| Key | Type | Description |
|---|---|---|
client |
String | Deprecated. Версия клиента. |
dependencies |
Sequence | Список зависимостей pip, поддерживаемых версией pip в этой среде. |
environment_version |
String | Обязательное. Версия среды, используемая средой. Каждая версия поставляется с определенной версией Python и набором пакетов Python. Версия — это строка, состоящая из целого числа. |
job.git_source
Type: Map
Конфигурация репозитория Git для исходного кода задания.
| Key | Type | Description |
|---|---|---|
git_branch |
String | Имя ветви, которую необходимо извлечь и использовать в этом задании. Это поле нельзя указать в сочетании с git_tag или git_commit. |
git_commit |
String | Фиксация для проверки и использования этим заданием. Это поле нельзя указать в сочетании с git_branch или git_tag. |
git_provider |
String | Уникальный идентификатор службы, используемой для размещения репозитория Git. Значение регистронезависимо. Допустимые значения: gitHub, bitbucketCloud, gitLabazureDevOpsServices, gitHubEnterprise, bitbucketServer. gitLabEnterpriseEdition |
git_snapshot |
Map | Состояние удаленного репозитория в режиме только для чтения на момент запуска задания. Это поле используется только в процессах выполнения заданий. См. git_snapshot. |
git_tag |
String | Имя тега, который будет извлечен и использован этим заданием. Это поле нельзя указать в сочетании с git_branch или git_commit. |
git_url |
String | URL-адрес репозитория, клонированного этим заданием. |
sparse_checkout |
Map | Разреженная конфигурация извлечения для репозитория Git. См. раздел job.git_source.sparse_checkout. Добавлено в Интерфейс командной строки Databricks версии 0.290.0 |
job.git_source.sparse_checkout
Type: Map
Разреженная конфигурация извлечения для репозитория Git.
Добавлено в Интерфейс командной строки Databricks версии 0.290.0
| Key | Type | Description |
|---|---|---|
patterns |
Sequence | Список шаблонов для разреженного извлечения. Добавлено в Интерфейс командной строки Databricks версии 0.290.0 |
job.git_source.git_snapshot
Type: Map
Моментальный снимок сведений о коммите, доступный только для чтения.
| Key | Type | Description |
|---|---|---|
used_commit |
String | Фиксация, используемая для выполнения выполнения. Если git_branch был указан, это указывает на HEAD ветви во время выполнения; если git_tag был указан, это указывает на коммит, на который ссылается тег. |
Работа.здоровье
Type: Map
Конфигурация мониторинга работоспособности для задания.
| Key | Type | Description |
|---|---|---|
rules |
Sequence | Список правил состояния заданий. Каждое правило содержит metric и (оператор) и opvalue. См. job.health.rules. |
job.health.rules
Type: Sequence
Список правил состояния заданий.
Каждый элемент в списке JobHealthRule— это :
| Key | Type | Description |
|---|---|---|
metric |
String | Указывает метрику работоспособности, которая оценивается для определенного правила контроля работоспособности.
|
op |
String | Указывает оператор, используемый для сравнения значения метрик работоспособности с указанным пороговым значением. |
value |
Integer | Указывает пороговое значение, которое метрика работоспособности должна соответствовать правилу работоспособности. |
задача.job_clusters
Type: Sequence
Список спецификаций кластера заданий, которые могут совместно использоваться и повторно использоваться в задачах этой работы. Библиотеки нельзя объявлять в общем кластере заданий. Необходимо объявить зависимые библиотеки в параметрах задач.
Каждый элемент в списке JobCluster— это :
| Key | Type | Description |
|---|---|---|
job_cluster_key |
String | Уникальное имя кластера заданий. Это поле является обязательным и должно быть уникальным в задании.
JobTaskSettings Может ссылаться на это поле, чтобы определить, какой кластер будет запущен для выполнения задачи. |
new_cluster |
Map | Если new_cluster, описание кластера, созданного для каждой задачи. См. кластер. |
работа.параметры_уведомлений
Type: Map
Настройки уведомлений, применяемые ко всем уведомлениям по работе.
| Key | Type | Description |
|---|---|---|
no_alert_for_skipped_runs |
Boolean | Следует ли игнорировать отправку оповещений для пропущенных запусков. |
no_alert_for_canceled_runs |
Boolean | Следует ли пропускать отправку оповещений для отмененных запусков. |
job.parameters
Type: Sequence
Список определений параметров задания.
Каждый элемент в списке JobParameter— это :
| Key | Type | Description |
|---|---|---|
default |
String | Обязательное. Значение параметра по умолчанию, например "users". |
name |
String | Обязательное. Имя определенного параметра, например "table". Допустимые значения содержат только буквенно-цифровые символы, _а -также .. |
очередь.задач
Type: Map
Параметры очереди для задания.
| Key | Type | Description |
|---|---|---|
enabled |
Boolean | Следует ли включить очередь для задания. |
график_задач
Type: Map
Конфигурация для планирования периодического выполнения задачи.
| Key | Type | Description |
|---|---|---|
quartz_cron_expression |
String | Выражение Cron с использованием синтаксиса Quartz, которое определяет, когда выполняется задание. Например, 0 0 9 * * ? каждый день выполняет задачу в 9:00 утра по UTC. |
timezone_id |
String | Часовой пояс расписания. Например, America/Los_Angeles или UTC. |
pause_status |
String | Независимо от того, приостановлено ли расписание. Допустимые значения: PAUSED, UNPAUSED. |
задание.триггер
Type: Map
Настройка триггера для выполнения задания на основе событий.
| Key | Type | Description |
|---|---|---|
file_arrival |
Map | Триггер на основе прибытия файла. См. file_arrival. |
table |
Map | Триггер на основе таблицы. См. таблицу. |
table_update |
Map | Триггер, основанный на обновлениях таблицы. См. table_update. |
periodic |
Map | Периодический триггер. Периодический |
pause_status |
String | Независимо от того, поставлен ли спусковой крючок на паузу или нет. Допустимые значения: PAUSED, UNPAUSED. |
задача.триггер.приход_файла
Type: Map
Настройка триггера на основе прибытия файла.
| Key | Type | Description |
|---|---|---|
url |
String | Путь к директории для отслеживания новых файлов. |
min_time_between_triggers_seconds |
Integer | Минимальное время в секундах между событиями триггера. |
wait_after_last_change_seconds |
Integer | Время ожидания в секундах после последнего изменения файла перед активацией. |
задача.триггер.таблица
Type: Map
Настройка триггера на основе таблицы.
| Key | Type | Description |
|---|---|---|
table_names |
Sequence | Список имен таблиц для отслеживания. |
condition |
String | Условие SQL, которое должно быть выполнено для активации задания. |
задача.триггер.обновление_таблицы
Type: Map
Настройка триггера на основе обновлений таблиц.
| Key | Type | Description |
|---|---|---|
table_names |
Sequence | Список имен таблиц для отслеживания обновлений. |
condition |
String | Условие SQL, которое должно быть выполнено для активации задания. |
wait_after_last_change_seconds |
Integer | Время ожидания в секундах после последнего обновления таблицы перед активацией. |
задача.триггер.повторный
Type: Map
Конфигурация периодического триггера.
| Key | Type | Description |
|---|---|---|
interval |
Integer | Значение интервала для периодического триггера. |
unit |
String | Единица времени интервала. Допустимые значения: HOURS, , DAYSWEEKS. |
задача.webhook_notifications
Type: Map
Параметры уведомлений для вебхуков при запуске заданий.
| Key | Type | Description |
|---|---|---|
on_start |
Sequence | Список идентификаторов уведомлений веб-перехватчика, которые нужно уведомить при запуске. |
on_success |
Sequence | Список идентификаторов уведомлений веб-перехватчика для уведомления о успешном завершении выполнения. |
on_failure |
Sequence | Список идентификаторов уведомлений вебхуков для уведомления о сбое выполнения. |
on_duration_warning_threshold_exceeded |
Sequence | Список идентификаторов уведомлений веб-перехватчика для уведомления о превышении порогового значения времени выполнения. |
on_streaming_backlog_exceeded |
Sequence | Список идентификаторов системных уведомлений для вызова при превышении пороговых значений невыполненной потоковой передачи для любого потока. Пороговые значения невыполненной работы потоковой передачи можно задать в health поле с помощью следующих метрик: STREAMING_BACKLOG_BYTES, , STREAMING_BACKLOG_RECORDSSTREAMING_BACKLOG_SECONDSили STREAMING_BACKLOG_FILES. Оповещение основано на 10-минутном среднем этих метрик. Если проблема сохраняется, уведомления будут обидены каждые 30 минут. Можно указать не более 3 назначений. |
Examples
В следующем примере описывается задание с ключом ресурса hello-job с одной задачей в блокноте.
resources:
jobs:
hello-job:
name: hello-job
tasks:
- task_key: hello-task
notebook_task:
notebook_path: ./hello.py
В следующем примере определяется задание с записной книжкой SQL:
resources:
jobs:
job_with_sql_notebook:
name: 'Job to demonstrate using a SQL notebook with a SQL warehouse'
tasks:
- task_key: notebook
notebook_task:
notebook_path: ./select.sql
warehouse_id: 799f096837fzzzz4
Дополнительные примеры конфигурации заданий см. в разделе "Конфигурация задания".
Сведения об определении задач задания и переопределении параметров задания см. в следующем разделе:
- Добавление задач в задания в декларативных пакетах автоматизации
- Переопределение параметров задачи задания
job_run
Type: Map
Ресурс job_run запускает выполнение существующей задачи в рамках развертывания пакетов. В отличие от работы, которая определяет работу, запуск заданий ссылается на существующую работу по ID.
Note
Использование Declarative Automation Bundles для определения запусков заданий поддерживается только при использовании движка прямого развертывания.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
job_runs:
<job_run-name>:
<job_run-field-name>: <job_run-field-value>
| Key | Type | Description |
|---|---|---|
job_id |
Integer | Обязательное. Идентификатор выполняемого задания. Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
job_parameters |
Map | Параметры на уровне задания, используемые при запуске, например param: overriding_val.Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
only |
Sequence | Список ключей задач, выполняемых внутри задания. Если это поле не предусмотрено, все задачи в работе выполняются. Префикс клавиши + задачи также для выполнения её восходящих задач или суффикс + для выполнения нижних задач. Например, +my_task работает my_task и всё, что выше по течению my_task+ , и my_task всё, что ниже по течению, и +my_task+ работает и то, и другое. Ключ задачи без + этого запускает только эту задачу.Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
performance_target |
String | Режим производительности для бессерверного задания. Целевой показатель производительности определяет уровень вычислительной производительности или экономичность для запуска и переопределяет целевой показатель, определённый на уровне задачи. Допустимые значения — STANDARD, что обеспечивает экономичное выполнение безсерверных рабочих нагрузок, и PERFORMANCE_OPTIMIZED, которое отдаёт приоритет быстрому запуску и выполнению за счёт быстрого масштабирования и оптимизации производительности кластера.Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
pipeline_params |
Map | Настройки обновления для задачи конвейера во время запуска. См. job_run.pipeline_params. Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
queue |
Map | Настройки очереди во время забега. Установите enabled на true включение очереди для запуска.Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
job_run.pipeline_params
Type: Map
Настройки обновления для задачи конвейера во время запуска.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
| Key | Type | Description |
|---|---|---|
full_refresh |
Boolean | Стоит ли запускать полное обновление декларативного конвейера Spark. Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
full_refresh_selection |
Sequence | (Бета) Список таблиц для обновления с полным обновлением. Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
refresh_flow_selection |
Sequence | (Бета) Имена потоков для выборочного обновления. Они объединяются с другими опциями refresh_selection селективного обновления, и full_refresh_selection, чтобы определить окончательный набор потоков для обновления.Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
refresh_selection |
Sequence | (Бета) Список таблиц для обновления без полного обновления. Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
reset_checkpoint_selection |
Sequence | (Бета) Список потоковых потоков, для которых можно сбросить контрольные точки без очистки данных. Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
Example
Следующий пример запускает запуск существующей задачи, переопределяя один параметр и ограничивая запуск одной задачей и её предыдущими задачами:
resources:
job_runs:
my_job_run:
job_id: 123456789
job_parameters:
catalog: main
only:
- +my_task
модель (устаревшая версия)
Type: Map
Ресурс модели позволяет определять устаревшие модели в пакетах. Databricks рекомендует вместо этого использовать зарегистрированные модели в каталоге Unity.
конечная_точка_обслуживания_моделей
Type: Map
Ресурс model_serving_endpoint позволяет определить модели обслуживания конечных точек. См. раздел Управление конечными точками обслуживания моделей.
model_serving_endpoints:
<model_serving_endpoint-name>:
<model_serving_endpoint-field-name>: <model_serving_endpoint-field-value>
| Key | Type | Description |
|---|---|---|
ai_gateway |
Map | Конфигурация шлюза ИИ для конечной точки обслуживания. ПРИМЕЧАНИЕ. В настоящее время поддерживаются только внешние модели и подготовленные конечные точки пропускной способности. См. ai_gateway. Добавлено в Databricks CLI версии 0.230.0 |
budget_policy_id |
String | Идентификатор политики бюджета, используемой для этой конечной точки. Добавлено в Интерфейс командной строки Databricks версии 0.244.0 |
config |
Map | Базовая конфигурация конечной точки обслуживания. См. конфигурацию. |
description |
String | Описание конечной точки обслуживания. Добавлено в Databricks CLI версии 0.260.0 |
email_notifications |
Map | Конфигурация уведомлений по электронной почте для конечной точки обслуживания. См. email_notifications. Добавлено в Databricks CLI версии 0.264.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
name |
String | Имя конечной точки обслуживания. Это поле является обязательным и должно быть уникальным в рабочей области Databricks. Имя конечной точки может состоять из буквенно-цифровых символов, дефисов и символов подчеркивания. |
permissions |
Sequence | Разрешения конечной точки обслуживания модели. Просмотр разрешений. |
rate_limits |
Sequence | Deprecated. Ограничения скорости, применяемые к конечной точке обслуживания. Используйте шлюз искусственного интеллекта для управления ограничениями скорости. |
route_optimized |
Boolean | Включите оптимизацию маршрута для конечной точки обслуживания. |
tags |
Sequence | Теги, которые прикрепляются к точке доступа обслуживания и автоматически распространяются в журналы выставления счетов. |
telemetry_config |
Map | Конфигурация сохраняющейся телеметрии конечных точек (логи, трассы и метрики) в таблицы Unity Catalog. См. telemetry_config. Добавлено в Databricks CLI версии 1.6.0 |
model_serving_endpoint.telemetry_config
Type: Map
Конфигурация сохраняющейся телеметрии конечных точек (логи, трассы и метрики) в таблицы Unity Catalog.
Добавлено в Databricks CLI версии 1.6.0
| Key | Type | Description |
|---|---|---|
inference_table_config |
Map | Конфигурация для логирования полезной нагрузки в таблице выводов, включая отбор проб. Добавлено в Databricks CLI версии 1.6.0 |
table_names |
Map | Таблицы Unity Catalog, в которые экспортируется телеметрия конечных точек (логи, трассы и метрики). Предоставьте это для создания нового телеметрического профиля для конечной точки из указанных таблиц. Добавлено в версии Databricks CLI 1.10.0 |
telemetry_profile_id |
String | ID существующего телеметрического профиля для применения к этой конечной точке. Введите это для повторного использования уже созданного телеметрического профиля, вместо указания table_names.Добавлено в версии Databricks CLI 1.10.0 |
model_serving_endpoint.email_notifications
Type: Map
Конфигурация уведомлений по электронной почте для конечной точки обслуживания.
| Key | Type | Description |
|---|---|---|
on_update_failure |
Sequence | Список адресов электронной почты, которые необходимо уведомить, когда конечная точка не сможет обновить конфигурацию или состояние. |
on_update_success |
Sequence | Список адресов электронной почты, которые необходимо уведомить, когда конечная точка успешно обновляет конфигурацию или состояние. |
Конечная точка обслуживания модели.ai_gateway
Type: Map
Конфигурация шлюза ИИ для конечной точки обслуживания.
| Key | Type | Description |
|---|---|---|
fallback_config |
Map | Конфигурация резервного трафика, которая автоматически резервирует другие обслуживаемые сущности, если запрос к обслуживаемой сущности завершается сбоем с определенными кодами ошибок, чтобы повысить доступность. См. fallback_config. |
guardrails |
Map | Конфигурация Guardrail. См. ограничения. |
inference_table_config |
Map | Настройка ведения журнала вывода в таблицы каталога Unity. См. inference_table_config. |
rate_limits |
Sequence | Конфигурации ограничения скорости. |
usage_tracking_config |
Map | Конфигурация для отслеживания использования. См. usage_tracking_config. |
model_serving_endpoint.ai_gateway.fallback_config
Type: Map
Конфигурация резервного трафика, которая автоматически резервируется на другие обслуживаемые сущности, если запрос завершается сбоем с определенными кодами ошибок.
| Key | Type | Description |
|---|---|---|
enabled |
Boolean | Включена ли резервная обратная связь для этой конечной точки. |
модель_обслуживания_точки.ai_gateway.ограждения
Type: Map
Конфигурация ограничений шлюза ИИ.
| Key | Type | Description |
|---|---|---|
input |
Map | Конфигурация ограничений входных данных с такими полями, как safety, pii. |
output |
Map | Конфигурация ограничителей вывода с такими полями, как safety, pii. |
invalid_keywords |
Sequence | Список ключевых слов для блокировки. |
конфигурация_таблицы_инференции_шлюза_ИИ_для_конечной_точки_подачи_модели
Type: Map
Настройка ведения журнала вывода в таблицы каталога Unity.
| Key | Type | Description |
|---|---|---|
catalog_name |
String | Имя каталога в каталоге Unity. |
schema_name |
String | Имя схемы в каталоге Unity. |
table_name_prefix |
String | Префикс для имен таблиц вывода. |
enabled |
Boolean | Включена ли ведение журнала таблиц вывода заключений. |
model_serving_endpoint.ai_gateway.контроль_использования_конфигурация
Type: Map
Конфигурация шлюза ИИ для отслеживания использования.
| Key | Type | Description |
|---|---|---|
enabled |
Boolean | Включена ли функция отслеживания использования. |
конфигурация_точки_обслуживания_модели.config
Type: Map
Базовая конфигурация конечной точки обслуживания.
| Key | Type | Description |
|---|---|---|
served_entities |
Sequence | Список обслуживаемых сущностей для конечной точки. Каждая обслуживаемая сущность содержит такие поля, как entity_name, entity_version, workload_size, scale_to_zero_enabledworkload_typeenvironment_vars. |
served_models |
Sequence | (Не рекомендуется: используйте served_entities вместо этого список обслуживаемых моделей для конечной точки. |
traffic_config |
Map | Конфигурация трафика, определяющая способ маршрутизации вызовов к конечной точке обслуживания. См. traffic_config. |
конфигурация_конечной_точки_обслуживания_модели.config.traffic_config
Type: Map
Конфигурация трафика, определяющая способ маршрутизации вызовов к конечной точке обслуживания.
| Key | Type | Description |
|---|---|---|
routes |
Sequence | Список маршрутов для распределения трафика. Каждый маршрут содержит served_model_name и traffic_percentage. |
Example
В следующем примере определяется конечная точка обслуживания модели каталога Unity:
resources:
model_serving_endpoints:
uc_model_serving_endpoint:
name: 'uc-model-endpoint'
config:
served_entities:
- entity_name: 'myCatalog.mySchema.my-ads-model'
entity_version: '10'
workload_size: 'Small'
scale_to_zero_enabled: 'true'
traffic_config:
routes:
- served_model_name: 'my-ads-model-10'
traffic_percentage: '100'
tags:
- key: 'team'
value: 'data science'
конвейер
Type: Map
Конвейеры поддерживаются в Python для декларативных пакетов автоматизации. См. databricks.bundles.pipelines.
Ресурс конвейера позволяет создавать конвейеры. Сведения о конвейерах см. в разделе "Декларативные конвейеры Spark". Учебник, использующий шаблон декларативных пакетов автоматизации для создания конвейера, см. в разделе "Разработка конвейеров с помощью декларативных пакетов автоматизации".
pipelines:
<pipeline-name>:
<pipeline-field-name>: <pipeline-field-value>
| Key | Type | Description |
|---|---|---|
allow_duplicate_names |
Boolean | Если установлено значение false, развертывание завершится ошибкой, если имя конфликтует с именем другого конвейера. Добавлено в Databricks CLI версии 0.261.0 |
budget_policy_id |
String | Бюджетная политика этого проекта. Добавлено в Databricks CLI версии 0.230.0 |
cascade_on_destroy |
Boolean | Удаляет ли уничтожение конвейера его наборы данных (материализованные виды, таблицы потока и просмотры). При отключении сервера по умолчанию действует. Установлен на false сохранение наборов данных при уничтожении. Поддерживается движком прямого развертывания.Добавлено в Databricks CLI версии 1.12.0 |
catalog |
String | Каталог в каталоге Unity для публикации данных из этого конвейера. Если target задано, таблицы в этом конвейере публикуются в схеме target внутри catalog (например, catalog.target.table). Если target не указано, данные не публикуются в каталоге Unity. |
channel |
String | Канал выпуска конвейеров Lakeflow, указывающий, какая версия конвейеров Lakeflow будет использоваться. |
clusters |
Sequence | Параметры кластера для этого развертывания конвейера. См. кластер. |
configuration |
Map | Конфигурация для запуска этого конвейера. |
continuous |
Boolean | Выполняется ли конвейер непрерывным или запускается. Это заменяет trigger. |
deployment |
Map | Тип развертывания этого конвейера. См. развертывание. |
development |
Boolean | Указывает, находится ли конвейер в режиме разработки. По умолчанию false. |
dry_run |
Boolean | Указывает, является ли конвейер сухим запуском. |
edition |
String | Выпуск конвейерного продукта. |
environment |
Map | Спецификация среды для этого конвейера, используемая для установки зависимостей на бессерверных вычислениях. См. среду. Этот ключ поддерживается только в Databricks CLI версии 0.258 и выше. Добавлено в Databricks CLI версии 0.257.0 |
event_log |
Map | Конфигурация журнала событий для этого конвейера. См. event_log. Добавлено в Интерфейс командной строки Databricks версии 0.246.0 |
filters |
Map | Фильтры, определяющие, какие пакеты конвейера необходимо включить в развернутый граф. См. фильтры. |
gateway_definition |
Map | Конфигурация конвейера шлюза. Эти параметры нельзя использовать с ingestion_definition параметрами. |
id |
String | Уникальный идентификатор для этого конвейера. |
ingestion_definition |
Map | Конфигурация для управляемого конвейера приема данных. Эти параметры нельзя использовать с параметрами libraries, schema, target или catalog. См. ingestion_definition. |
libraries |
Sequence | Список библиотек или кода, необходимых для этого развертывания. См. статью pipeline.libraries. |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
name |
String | Дружественное имя для этого конвейера. |
notifications |
Sequence | Параметры уведомлений для этого конвейера. См. уведомления. |
parameters |
Map | Параметры по умолчанию используются для выполнения конвейера, где каждый ключ — это имя параметра, а значение — значение параметра. Максимальный общий размер — 10 тысяч символов в формате JSON. |
permissions |
Sequence | Разрешения конвейера. Просмотр разрешений. |
photon |
Boolean | Включён ли фотон для этого конвейера. Этот ключ игнорируется, если serverless задано значение true. |
restart_window |
Map | Определяет окно перезапуска для этого конвейера. Конвейеры можно перезапустить в этом окне без отставания. |
root_path |
String | Корневой путь для этого конвейера. Это используется в качестве корневого каталога при редактировании конвейера в пользовательском интерфейсе Databricks и добавляется в sys.path при выполнении Python источников во время выполнения конвейера. Добавлено в Databricks CLI версии 0.253.0 |
run_as |
Map | Идентификация, под которой работает конвейер. Если не указано иное, конвейер запускается от имени пользователя, который его создал. Можно указать только user_name или service_principal_name. Если указаны оба, возникает ошибка. См. run_as.Добавлено в Databricks CLI версии 0.241.0 |
schema |
String | Схема по умолчанию (база данных), из которой извлекаются таблицы или в которую они записываются. Добавлено в Databricks CLI версии 0.230.0 |
serverless |
Boolean | Включена ли бессерверная вычислительная мощность для этого конвейера? |
storage |
String | Корневой каталог DBFS для хранения контрольных точек и таблиц. |
tags |
Map | Карта тегов, связанных с конвейером. Они перенаправляются в кластер в виде тегов кластера и поэтому подвергаются таким же ограничениям. В конвейер можно добавить не более 25 тегов. Добавлено в Databricks CLI версии 0.256.0 |
target |
String | Целевая схема (база данных) для добавления таблиц в этот конвейер. Точно один из schema или target должен быть указан. Для публикации в каталоге Unity также укажите catalog. Это устаревшее поле больше не следует использовать для создания конвейера; вместо него следует использовать поле schema. |
usage_policy_id |
String | Идентификатор политики бессерверного использования, используемой для этого конвейера. Добавлено в Databricks CLI версии 0.273.0 |
pipeline.deployment
Type: Map
Конфигурация типа развертывания для конвейера.
| Key | Type | Description |
|---|---|---|
kind |
String | Тип развертывания. Например: BUNDLE. |
metadata_file_path |
String | Путь к файлу метаданных для развертывания. |
конвейер.окружение
Type: Map
Спецификация среды для установки зависимостей на бессерверных вычислениях.
| Key | Type | Description |
|---|---|---|
dependencies |
Sequence | Список зависимостей pip, поддерживаемых версией pip в этой среде. Каждая зависимость — это строка файла требований pip. |
environment_version |
String | (Бета) Версия среды бессерверной среды Python, используемая для выполнения клиентского кода Python, например4. Каждая версия среды включает определённую версию Python и тщательно отобранный набор предустановленных библиотек с определёнными версиями, обеспечивая стабильную и воспроизводимую среду выполнения. Databricks поддерживает трёхлетний жизненный цикл для каждой версии среды. Для доступных версий и включённых пакетов см. раздел «Версии окружения».Добавлено в Databricks CLI версии 0.294.0 |
pipeline.журнал_событий
Type: Map
Конфигурация журнала событий для конвейера.
| Key | Type | Description |
|---|---|---|
catalog |
String | Каталог каталога Unity, в котором публикуется журнал событий. |
name |
String | Имя журнала событий публикуется в каталоге Unity. |
schema |
String | Схема каталога Unity, в котором публикуется журнал событий. |
конвейер.фильтры
Type: Map
Фильтры, определяющие, какие пакеты конвейера необходимо включить в развернутый граф.
| Key | Type | Description |
|---|---|---|
include |
Sequence | Список имен пакетов для включения. |
exclude |
Sequence | Список имен пакетов, которые следует исключить. |
pipeline.ingestion_definition
Type: Map
Конфигурация для управляемой загрузки данных. Эти параметры нельзя использовать с параметрами libraries, schema, target или catalog.
| Key | Type | Description |
|---|---|---|
connection_name |
String | Имя подключения, которое следует использовать для поглощения. Чтобы создать подключения программным способом для соединителей, поддерживающих проверку подлинности только API, используйте databricks connections create в задаче предварительного развертывания скрипта или задания. См. раздел "Развертывание". |
connector_type |
String | Необязательно. Тип соединителя для источников. Допустимые значения — CDC и QUERY_BASED.Добавлено в Databricks CLI версии 0.296.0 |
data_staging_options |
Map | Необязательно. Расположение промежуточного хранилища данных. Это необходимо для миграции из управляемого конвейера приема CDC с конвейером шлюза в объединенный управляемый конвейер приема CDC. Если не указано, том для промежуточных данных создается в каталоге и схеме или целевом объекте, указанном в определении конвейера верхнего уровня. Добавлено в Databricks CLI версии 0.296.0 |
full_refresh_window |
Map | Необязательно. Окно, указывающее набор диапазонов времени для запросов моментальных снимков в CDC. |
ingest_from_uc_foreign_catalog |
Boolean | Неизменяемый. Если задано значение true, конвейер будет получать таблицы из внешних каталогов каталога Unity напрямую без необходимости указывать подключение каталога Unity или шлюз приема. Поля source_catalog в объектах IngestionConfig интерпретируются как внешние каталоги каталога Unity для приема.Добавлено в Databricks CLI версии 0.279.0 |
ingestion_gateway_id |
String | Идентификатор шлюза приема. |
objects |
Sequence | Обязательное. Параметры, указывающие таблицы для репликации и назначения для реплицированных таблиц. Каждый объект может быть SchemaSpec, TableSpec или ReportSpec. |
source_type |
String | Обязательный при использовании source_configurations. Указывает тип соединителя (например, POSTGRESQL, MYSQL). |
source_configurations |
Sequence | Параметры конфигурации источника на уровне каталога. При использовании этого поля также необходимо указать source_type. См. source_configurations. |
table_configuration |
Map | Конфигурация для таблиц поглощения. См. table_configuration. |
SchemaSpec
Type: Map
Спецификация объекта схемы для приема всех таблиц из схемы.
| Key | Type | Description |
|---|---|---|
source_schema |
String | Имя исходной схемы для обработки. |
destination_catalog |
String | Имя целевого каталога в Unity Catalog. |
destination_schema |
String | Имя схемы назначения в Unity Catalog. |
table_configuration |
Map | Конфигурация для применения ко всем таблицам в этой схеме. См. pipeline.ingestion_definition.table_configuration. |
Спецификация таблицы
Type: Map
Спецификация объекта таблицы для загрузки конкретной таблицы.
| Key | Type | Description |
|---|---|---|
source_schema |
String | Имя исходной схемы, содержащей таблицу. |
source_table |
String | Имя исходной таблицы для импорта. |
destination_catalog |
String | Имя целевого каталога в Unity Catalog. |
destination_schema |
String | Имя схемы назначения в Unity Catalog. |
destination_table |
String | Имя таблицы назначения в Unity Catalog. |
table_configuration |
Map | Конфигурация для этой конкретной таблицы. См. pipeline.ingestion_definition.table_configuration. |
Спецификация отчета
Type: Map
Спецификация отчётного объекта для приема аналитических отчетов.
| Key | Type | Description |
|---|---|---|
source_url |
String | URL-адрес исходного отчета. |
source_report |
String | Имя или идентификатор исходного отчета. |
destination_catalog |
String | Имя целевого каталога в Unity Catalog. |
destination_schema |
String | Имя схемы назначения в Unity Catalog. |
destination_table |
String | Имя целевой таблицы для данных отчета. |
table_configuration |
Map | Конфигурация для таблицы отчета. См. pipeline.ingestion_definition.table_configuration. |
pipeline.ingestion_definition.source_configurations
Type: Sequence
Конфигурация источника. Каждый элемент в последовательности — это карта, содержащая конфигурацию уровня каталога.
| Key | Type | Description |
|---|---|---|
catalog |
Map | Параметры конфигурации источника на уровне каталога. См. каталог. |
pipeline.ingestion_definition.source_configurations.catalog
Type: Map
Параметры конфигурации источника на уровне каталога
| Key | Type | Description |
|---|---|---|
postgres |
Map | Параметры конфигурации уровня каталога для postgres. Содержит один slot_config ключ, представляющий Map конфигурацию слота Postgres для логической репликации. |
source_catalog |
String | Имя исходного каталога. |
pipeline.определение_погрузки.конфигурация_таблицы
Type: Map
Параметры конфигурации для таблиц ингестии.
| Key | Type | Description |
|---|---|---|
exclude_columns |
Sequence | Список имен столбцов, которые следует исключить для приема. Если не указано, include_columns полностью контролирует, какие столбцы следует загружать. Когда указано, все остальные столбцы, включая будущие, будут автоматически включены для обработки. Это поле является взаимоисключающим с include_columns. |
include_columns |
Sequence | Список имен столбцов, которые необходимо включить для импорта. Если не указано, все столбцы, кроме тех в exclude_columns, будут включены. Будущие столбцы будут автоматически включены. При их указании все другие будущие столбцы будут автоматически исключены из обработки. Это поле является взаимоисключающим с exclude_columns. |
primary_keys |
Sequence | Список имен столбцов, используемых в качестве первичных ключей для таблицы. |
sequence_by |
Sequence | Имена столбцов, определяющие логический порядок событий в исходных данных. Декларативные конвейеры Spark используют эту последовательность для обработки событий изменений, поступающих вне порядка. |
pipeline.libraries
Type: Sequence
Определяет список библиотек или кода, необходимых для этого конвейера.
Каждый элемент в списке — это определение:
| Key | Type | Description |
|---|---|---|
file |
Map | Путь к файлу, который определяет конвейер и хранится в Databricks Repos. См. файл pipeline.libraries.file. |
glob |
Map | Унифицированное поле для включения исходного кода. Каждая запись может быть путь к записной книжке, путь к файлу или путь к папке, который заканчивается /**. Это поле нельзя использовать вместе с notebook или file. См. pipeline.libraries.glob. |
notebook |
Map | Путь к записной книжке, которая определяет конвейер и хранится в рабочей области Databricks. См. pipeline.libraries.notebook. |
whl |
String | Это поле устарело |
pipeline.libraries.file
Type: Map
Путь к файлу, который определяет конвейер и хранится в Repos Databricks.
| Key | Type | Description |
|---|---|---|
path |
String | Абсолютный путь исходного кода. |
pipeline.libraries.glob
Type: Map
Унифицированное поле для включения исходного кода. Каждая запись может быть путь к записной книжке, путь к файлу или путь к папке, который заканчивается /**. Это поле нельзя использовать вместе с notebook или file.
| Key | Type | Description |
|---|---|---|
include |
String | Исходный код, который следует включить в конвейеры |
pipeline.libraries.notebook
Type: Map
Путь к записной книжке, которая определяет конвейер и хранится в рабочей области Databricks.
| Key | Type | Description |
|---|---|---|
path |
String | Абсолютный путь исходного кода. |
pipeline.notifications
Type: Sequence
Параметры уведомлений для этого конвейера. Каждый элемент в последовательности — это конфигурация уведомлений.
| Key | Type | Description |
|---|---|---|
alerts |
Sequence | Список оповещений, которые активируют уведомления. Допустимые значения: on-update-success, on-update-failure, on-update-fatal-failureon-flow-failure. |
email_recipients |
Sequence | Список адресов электронной почты для уведомления о активации настроенного оповещения. |
Example
В следующем примере определяется конвейер с ключом ресурса hello-pipeline:
resources:
pipelines:
hello-pipeline:
name: hello-pipeline
clusters:
- label: default
num_workers: 1
development: true
continuous: false
channel: CURRENT
edition: CORE
photon: false
libraries:
- notebook:
path: ./pipeline.py
Дополнительные примеры конфигурации конвейера см. в разделе "Конфигурация конвейера".
postgres_branch
Это важно
Эта функция доступна в бета-версии.
Type:Map
Ресурс ветви Postgres позволяет определять ветви Lakebase в пакете. Необходимо также определить соответствующие проекты Postgres и вычислительные конечные точки.
Добавлено в Databricks CLI версии 0.287.0
postgres_branches:
<postgres_branch-name>:
<postgres_branch-field-name>: <postgres_branches-field-value>
| Key | Type | Description |
|---|---|---|
branch_id |
String | Идентификатор, используемый для ветви. Это становится окончательным компонентом имени ресурса ветви. Идентификатор является обязательным и должен иметь длину 1–63 символов, начинаться с строчной буквы и содержать только строчные буквы, цифры и дефисы. Например, development преобразуется в projects/my-app/branches/development.Добавлено в Databricks CLI версии 0.287.0 |
expire_time |
String | Абсолютная метка времени окончания срока действия. При установке ветвь истекает в это время. Добавлено в Databricks CLI версии 0.287.0 |
is_protected |
Boolean | Если задано значение true, защищает ветвь от удаления и сброса. Связанные конечные точки вычислений и проект не могут быть удалены во время защиты ветви. Добавлено в Databricks CLI версии 0.287.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.287.0 |
no_expiry |
Boolean | Явно отключить срок действия. Если задано значение true, срок действия ветви не истекает. Если задано значение false, запрос недопустим; вместо этого укажите ttl или expire_time. Добавлено в Databricks CLI версии 0.287.0 |
parent |
String | Проект, в котором будет создана эта ветвь. Формат: projects/{project_id}Добавлено в Databricks CLI версии 0.287.0 |
purge_on_delete |
Boolean | Вопрос о том, нужно ли удалять данные ветки при их удалении. Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
replace_existing |
Boolean | Следует ли заменить существующую ветвь с тем же идентификатором при развертывании. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
source_branch |
String | Имя исходной ветви, из которой была создана эта ветвь (происхождение данных для восстановления на определенный момент времени). Если не указано, по умолчанию используется ветвь проекта. Формат: projects/{project_id}/branches/{branch_id}Добавлено в Databricks CLI версии 0.287.0 |
source_branch_lsn |
String | Номер последовательности журнала (LSN) в исходной ветви, из которой была создана эта ветвь. Добавлено в Databricks CLI версии 0.287.0 |
source_branch_time |
String | Точка во времени исходной ветви, из которой была создана эта ветвь. Добавлено в Databricks CLI версии 0.287.0 |
ttl |
String | Относительная продолжительность жизни. Если задано, срок действия ветви истекает по creation_time + ttl. Добавлено в Databricks CLI версии 0.287.0 |
Example
См . пример postgres_projects.
postgres_catalog
Это важно
Эта функция доступна в бета-версии.
Type: Map
Ресурс каталога Postgres позволяет определять каталоги Postgres Lakebase в пакете. Каждый каталог привязывает каталог каталога Unity к базе данных Postgres в ветви автомасштабирования Lakebase.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
postgres_catalogs:
<postgres_catalog-name>:
<postgres_catalog-field-name>: <postgres_catalog-field-value>
| Key | Type | Description |
|---|---|---|
branch |
String | Ветвь автомасштабирования Lakebase, которая поддерживает каталог. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
catalog_id |
String | Обязательное. Идентификатор каталога каталога Unity для привязки к базе данных Postgres. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
create_database_if_missing |
Boolean | Следует ли создать базу данных Postgres, если она еще не существует. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
postgres_database |
String | Обязательное. Имя базы данных Postgres для привязки к каталогу. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
Example
resources:
postgres_projects:
project:
project_id: test-pg-project
display_name: Test Postgres Project
postgres_catalogs:
catalog:
catalog_id: test_catalog
branch: ${resources.postgres_projects.project.name}/branches/production
postgres_database: appdb
create_database_if_missing: true
postgres_database
Это важно
Эта функция доступна в бета-версии.
Type: Map
Ресурс базы данных Postgres позволяет определять базы данных Lakebase Postgres в пакете. Каждая база данных создается в ветви автомасштабирования Lakebase.
Добавлено в Databricks CLI версии 1.4.0
postgres_databases:
<postgres_database-name>:
<postgres_database-field-name>: <postgres_database-field-value>
| Key | Type | Description |
|---|---|---|
database_id |
String | Обязательное. Идентификатор, используемый для базы данных. Это становится окончательным компонентом имени ресурса базы данных. Добавлено в Databricks CLI версии 1.4.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 1.4.0 |
parent |
String | Обязательное. Ветвь, в которой создается эта база данных. Формат: projects/{project_id}/branches/{branch_id}.Добавлено в Databricks CLI версии 1.4.0 |
postgres_database |
String | Имя базы данных Postgres. Добавлено в Databricks CLI версии 1.4.0 |
replace_existing |
Boolean | Следует ли заменить существующую базу данных с тем же идентификатором при развертывании. Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
role |
String | Требуется при создании. Имя ресурса роли Postgres, которая владеет базой данных. Формат: projects/{project_id}/branches/{branch_id}/roles/{role_id}.Добавлено в Databricks CLI версии 1.4.0 |
Examples
resources:
postgres_projects:
my_project:
project_id: test-pg-proj
display_name: 'Test Project for Database'
pg_version: 16
history_retention_duration: '604800s'
postgres_branches:
main:
parent: ${resources.postgres_projects.my_project.id}
branch_id: main
no_expiry: true
postgres_roles:
owner:
parent: ${resources.postgres_branches.main.id}
role_id: app-owner
postgres_role: app_owner
postgres_databases:
my_database:
parent: ${resources.postgres_branches.main.id}
database_id: my-database
postgres_database: app_db
# The live API requires `role`. Declare an explicit role so the bundle is
# portable across users (the auto-created project-owner role's id is
# derived from the creator's identity).
role: ${resources.postgres_roles.owner.id}
postgres_endpoint
Это важно
Эта функция доступна в бета-версии.
Type: Map
Ресурс Postgres позволяет определить вычислительные конечные точки Lakebase в наборе. Необходимо также определить соответствующие проекты Lakebase и ветви Lakebase.
Добавлено в Databricks CLI версии 0.287.0
postgres_endpoints:
<postgres_endpoint-name>:
<postgres_endpoint-field-name>: <postgres_endpoint-field-value>
| Key | Type | Description |
|---|---|---|
autoscaling_limit_max_cu |
Number | Максимальное количество единиц вычислений. Минимальное значение — 0,5. Добавлено в Databricks CLI версии 0.287.0 |
autoscaling_limit_min_cu |
Number | Минимальное количество единиц вычислений. Минимальное значение — 0,5. Добавлено в Databricks CLI версии 0.287.0 |
disabled |
Boolean | Следует ли ограничить подключения к конечной точке вычислений. Включение этого параметра запланирует приостановку операции вычислений. Отключенная конечная точка вычислений не может быть включена действием подключения или консоли. Добавлено в Databricks CLI версии 0.287.0 |
endpoint_id |
String | Идентификатор, используемый для конечной точки. Это становится окончательным компонентом имени ресурса конечной точки. Идентификатор является обязательным и должен иметь длину 1–63 символов, начинаться с строчной буквы и содержать только строчные буквы, цифры и дефисы. Например, primary преобразуется в projects/my-app/branches/development/endpoints/primary.Добавлено в Databricks CLI версии 0.287.0 |
endpoint_type |
String | Тип конечной точки. Ветвь может иметь только одну конечную точку READ_WRITE. Возможные значения: ENDPOINT_TYPE_READ_WRITE, ENDPOINT_TYPE_READ_ONLY.Добавлено в Databricks CLI версии 0.287.0 |
group |
Map | Конфигурация группы конечных точек. См. раздел postgres_endpoint.group. |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.287.0 |
no_suspension |
Boolean | Если задано значение true, явным образом отключает автоматическую приостановку (никогда не приостанавливается). Значение true должно быть задано при указании. Добавлено в Databricks CLI версии 0.287.0 |
parent |
String | Ветвь, в которой будет создана эта конечная точка. Формат: projects/{project_id}/branches/{branch_id}Добавлено в Databricks CLI версии 0.287.0 |
replace_existing |
Boolean | Следует ли заменить существующую конечную точку вычислений с тем же идентификатором при развертывании. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
settings |
Map | Коллекция параметров для вычислительной конечной точки. Добавлено в Databricks CLI версии 0.287.0 |
suspend_timeout_duration |
String | Длительность бездействия, после которой конечная точка вычислений автоматически приостановлена. Если задано значение от 60 до 604800 (1 минуты до 1 недели). Добавлено в Databricks CLI версии 0.287.0 |
postgres_endpoint.group
Type: Map
Конфигурация группы конечных точек.
| Key | Type | Description |
|---|---|---|
enable_readable_secondaries |
Boolean | Разрешить ли подключения только для чтения конечным точкам записи. Применимо только для конечных точек чтения и записи, где group.max > 1. |
max |
Integer | Обязательное. Максимальное количество вычислений в группе конечных точек. В настоящее время это должно быть равно min.
1 Установите значение для отдельных вычислительных конечных точек, чтобы отключить высокий уровень доступности (HA). Чтобы вручную приостановить все вычисления в группе конечных точек, установите значение disabledtrue в конечной точке. |
min |
Integer | Обязательное. Минимальное количество вычислений в группе конечных точек. В настоящее время это должно быть равно max. Это должно быть больше или равно 1. |
Example
См . пример postgres_projects.
postgres_project
Это важно
Эта функция доступна в бета-версии.
Type: Map
Ресурс проекта Postgres позволяет определить проекты баз данных Postgres Autoscaling Postgres в пакете. Необходимо также определить соответствующие ветви Postgres и вычислительные конечные точки.
Добавлено в Databricks CLI версии 0.287.0
postgres_projects:
<postgres_project-name>:
<postgres_project-field-name>: <postgres_project-field-value>
| Key | Type | Description |
|---|---|---|
budget_policy_id |
String | Идентификатор политики бюджета для этого проекта. |
custom_tags |
Sequence | Настраиваемые теги для этого проекта. См. раздел postgres_project.custom_tags. |
default_branch |
String | Ветвь по умолчанию для проекта в формате projects/{project_id}/branches/{branch_id}. |
default_endpoint_settings |
Map | Коллекция параметров для вычислительной конечной точки. См. раздел postgres_project.default_endpoint_settings. Добавлено в Databricks CLI версии 0.287.0 |
display_name |
String | Имя проекта, доступного для чтения пользователем. Длина должна составлять от 1 до 256 символов. Добавлено в Databricks CLI версии 0.287.0 |
enable_pg_native_login |
Boolean | Следует ли включить собственное имя входа Postgres для проекта. Добавлено в Databricks CLI версии 0.294.0 |
history_retention_duration |
String | Количество секунд для хранения общей истории для восстановления на определенный момент времени для всех ветвей в этом проекте. Значение должно быть от 0 до 2592000 (до 30 дней). Добавлено в Databricks CLI версии 0.287.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.287.0 |
permissions |
Sequence | Разрешения для проекта Postgres. Просмотр разрешений. Добавлено в Databricks CLI версии 0.292.0 |
pg_version |
Integer | Основной номер версии Postgres. Поддерживаемые версии: 16 и 17. Добавлено в Databricks CLI версии 0.287.0 |
project_id |
String | Идентификатор, используемый для Project. Это становится окончательным компонентом имени ресурса проекта. Идентификатор является обязательным и должен иметь длину 1–63 символов, начинаться с строчной буквы и содержать только строчные буквы, цифры и дефисы. Например, my-app преобразуется в projects/my-app.Добавлено в Databricks CLI версии 0.287.0 |
purge_on_delete |
Boolean | Следует ли очищать данные проекта при удалении. Добавлено в Databricks CLI версии 1.2.0 |
Пример
resources:
postgres_projects:
my_db:
project_id: test-prod-app
display_name: 'Production Database'
pg_version: 17
postgres_branches:
main:
parent: ${resources.postgres_projects.my_db.id}
branch_id: main
is_protected: false
no_expiry: true
postgres_endpoints:
primary:
parent: ${resources.postgres_branches.main.id}
endpoint_id: primary
endpoint_type: ENDPOINT_TYPE_READ_WRITE
autoscaling_limit_min_cu: 0.5
autoscaling_limit_max_cu: 4
postgres_project.custom_tags
Type: Sequence
Список пользовательских тегов для проекта.
| Key | Type | Description |
|---|---|---|
key |
String | Ключ пользовательского тега. |
value |
String | Значение настраиваемого тега. |
postgres_project.default_endpoint_settings.
Type: Map
| Key | Type | Description |
|---|---|---|
autoscaling_limit_max_cu |
Number | Максимальное количество единиц вычислений. Минимальное значение — 0,5. |
autoscaling_limit_min_cu |
Number | Минимальное количество единиц вычислений. Минимальное значение — 0,5. |
no_suspension |
Boolean | Если задано значение true, явным образом отключает автоматическую приостановку (никогда не приостанавливается). Значение true должно быть задано при указании. Взаимоисключающ с suspend_timeout_duration. При обновлении используйте spec.project_default_settings.suspension в update_mask. |
pg_settings |
Map | Необработанное представление параметров Postgres. |
suspend_timeout_duration |
String | Длительность бездействия, после которой конечная точка вычислений автоматически приостановлена. Если задано значение от 60 до 604800 (1 минуты до 1 недели). Взаимоисключающ с no_suspension. При обновлении используйте spec.project_default_settings.suspension в update_mask. |
postgres_role
Это важно
Эта функция доступна в бета-версии.
Type: Map
Ресурс роли Postgres позволяет определять роли Lakebase Postgres в пакете. Каждая роль создается в ветви автомасштабирования Lakebase.
Добавлено в Databricks CLI версии 1.4.0
postgres_roles:
<postgres_role-name>:
<postgres_role-field-name>: <postgres_role-field-value>
| Key | Type | Description |
|---|---|---|
attributes |
Map | Требуемые атрибуты роли Postgres, предоставляемые API для связывания с ролью. См. postgres_role.атрибуты. Добавлено в Databricks CLI версии 1.4.0 |
auth_method |
String | Как роль проходит проверку подлинности при подключении к Postgres. Если не указано, от него identity_typeизвлекается значимый метод проверки подлинности. Допустимые значения: NO_LOGIN, PG_PASSWORD_SCRAM_SHA_256LAKEBASE_OAUTH_V1.Добавлено в Databricks CLI версии 1.4.0 |
identity_type |
String | Тип управляемого удостоверения Databricks, который представляет эта роль. Оставьте пустым, чтобы создать обычную роль Postgres, не связанную с удостоверением Databricks. Допустимые значения: USER, SERVICE_PRINCIPALGROUP.Добавлено в Databricks CLI версии 1.4.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 1.4.0 |
membership_roles |
Sequence | Стандартные роли, которые эта роль является членом. Добавлено в Databricks CLI версии 1.4.0 |
parent |
String | Обязательное. Ветвь, в которой создается эта роль. Формат: projects/{project_id}/branches/{branch_id}.Добавлено в Databricks CLI версии 1.4.0 |
postgres_role |
String | Имя роли Postgres. Требуется при создании роли. Чтобы создать роль Postgres, поддерживаемую управляемым удостоверением Databricks, postgres_role необходимо выполнить одно из следующих действий:
Добавлено в Databricks CLI версии 1.4.0 |
replace_existing |
Boolean | Следует ли заменить существующую роль с тем же идентификатором при развертывании. Добавлено в Интерфейс командной строки Databricks версии 1.7.0 |
role_id |
String | Обязательное. Идентификатор указанной пользователем роли; становится окончательным компонентом имени ресурса роли. Должно быть 4–63 символов, строчных букв, чисел и дефисов (RFC 1123). Добавлено в Databricks CLI версии 1.4.0 |
postgres_role.атрибуты
Type: Map
Требуемые атрибуты роли Postgres, предоставляемые API для связывания с ролью.
Добавлено в Databricks CLI версии 1.4.0
| Key | Type | Description |
|---|---|---|
bypassrls |
Boolean | Указывает, проходит ли роль безопасность на уровне строк. |
createdb |
Boolean | Может ли роль создавать базы данных. |
createrole |
Boolean | Может ли роль создавать, изменять, удалять, комментировать и изменять метку безопасности других ролей. |
Examples
resources:
postgres_projects:
my_project:
project_id: my-pg-proj
display_name: 'Test Project for Role'
pg_version: 16
history_retention_duration: '604800s'
postgres_branches:
main:
parent: ${resources.postgres_projects.my_project.id}
branch_id: main
no_expiry: true
postgres_roles:
my_role:
parent: ${resources.postgres_branches.main.id}
role_id: my-role
postgres_role: app_role
attributes:
createdb: true
postgres_synced_table
Это важно
Эта функция доступна в бета-версии.
Type: Map
Ресурс синхронизированной таблицы Postgres позволяет определить синхронизированные таблицы Lakebase Postgres в пакете. Каждая синхронизированная таблица непрерывно реплицирует исходную таблицу каталога Unity в таблицу Postgres в экземпляре автомасштабирования Lakebase.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
postgres_synced_tables:
<postgres_synced_table-name>:
<postgres_synced_table-field-name>: <postgres_synced_table-field-value>
| Key | Type | Description |
|---|---|---|
branch |
String | Ветвь автомасштабирования Lakebase, в которой создается синхронизированная таблица. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
create_database_objects_if_missing |
Boolean | Следует ли создавать логическую базу данных и ресурсы схемы синхронизированной таблицы, если они еще не существуют. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
existing_pipeline_id |
String | Идентификатор существующего конвейера. Если это задано, синхронизированная таблица будет упакована в существующий конвейер, на который ссылается ссылка. Это позволяет избежать создания нового конвейера и позволяет совместно использовать существующие вычислительные ресурсы. В этом случае синхронизированная таблица scheduling_policy должна соответствовать политике планирования существующего конвейера. Не более одного из existing_pipeline_id и new_pipeline_spec должно быть определено.Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
extra_columns |
Sequence | Дополнительные столбцы PostgreSQL для добавления в синхронизированную таблицу, помимо тех, что реплицируются из исходной таблицы. Добавлено в версии Databricks CLI 1.10.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
new_pipeline_spec |
Map | Спецификация нового конвейера. См. раздел postgres_synced_table.new_pipeline_spec. Не более одного из existing_pipeline_id и new_pipeline_spec должно быть определено.Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
postgres_database |
String | Имя целевой базы данных Postgres для синхронизированной таблицы. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
primary_key_columns |
Sequence | Список имен столбцов, формающих первичный ключ. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
scheduling_policy |
String | Политика планирования базового конвейера синхронизированной таблицы. Допустимые значения: CONTINUOUS, TRIGGEREDSNAPSHOT.Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
source_table_full_name |
String | Полное имя исходной таблицы в формате catalog.schema.table.Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
synced_table_id |
String | Обязательное. Идентификатор, используемый для синхронизированной таблицы. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
timeseries_key |
String | Ключ для временных рядов для удаления дубликатов строк с одинаковым первичным ключом. Добавлено в Интерфейс командной строки Databricks версии 1.0.0 |
type_overrides |
Sequence | Переопределяет стандартное отображение типов Delta-to-PostgreSQL для определённых столбцов. См. postgres_synced_table.type_overrides. Добавлено в версии Databricks CLI 1.5.0 |
postgres_synced_table.new_pipeline_spec
Type: Map
Спецификация нового конвейера, используемого синхронизированной таблицей.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
| Key | Type | Description |
|---|---|---|
budget_policy_id |
String | Политика бюджета, установленная в только что созданном конвейере. |
storage_catalog |
String | Каталог для конвейера для хранения промежуточных файлов, таких как контрольные точки и журналы событий. Это должен быть стандартный каталог, в котором у пользователя есть разрешения на создание таблиц Delta. |
storage_schema |
String | Схема конвейера для хранения промежуточных файлов, таких как контрольные точки и журналы событий. Это должно быть в стандартном каталоге, где у пользователя есть разрешения на создание таблиц Delta. |
postgres_synced_table.type_overrides
Type: Sequence
Переопределяет стандартное отображение типов Delta-to-PostgreSQL для одного столбца.
Добавлено в версии Databricks CLI 1.5.0
| Key | Type | Description |
|---|---|---|
column_name |
String | Обязательное. (Бета) Название исходного столбца, целевой тип PostgreSQL, должно быть переписано. Добавлено в версии Databricks CLI 1.5.0 |
pg_type |
String | Обязательное. (Бета) Специфический для PostgreSQL тип цели для столбца. Единственным допустимым значением является PG_SPECIFIC_TYPE_VECTOR.Добавлено в версии Databricks CLI 1.5.0 |
size |
Integer | (Бета) Параметр размера для целевого типа для типов, которые принимают один, например, векторная размерность или длина варчара. Требуется, когда выбранному pg_type требуется определённый размер.Добавлено в версии Databricks CLI 1.5.0 |
Example
resources:
schemas:
pipeline_storage:
name: test_pipeline_storage
catalog_name: main
comment: 'Pipeline storage for the synced-table test'
postgres_projects:
my_project:
project_id: test-pg-proj
display_name: 'Test Project for Synced Table'
pg_version: 17
postgres_catalogs:
my_catalog:
catalog_id: lakebase_test
branch: ${resources.postgres_projects.my_project.id}/branches/production
postgres_database: appdb
create_database_if_missing: true
postgres_synced_tables:
my_table:
synced_table_id: ${resources.postgres_catalogs.my_catalog.catalog_id}.public.trips_synced
source_table_full_name: main.source_test.trips_source
primary_key_columns: ['tpep_pickup_datetime']
scheduling_policy: SNAPSHOT
postgres_database: appdb
branch: ${resources.postgres_projects.my_project.id}/branches/production
create_database_objects_if_missing: true
new_pipeline_spec:
storage_catalog: ${resources.schemas.pipeline_storage.catalog_name}
storage_schema: ${resources.schemas.pipeline_storage.name}
монитор качества (каталог Unity)
Type: Map
Ресурс quality_monitor позволяет определить монитор таблицы каталога Unity. Сведения о мониторах см. в разделе "Профилирование данных".
quality_monitors:
<quality_monitor-name>:
<quality_monitor-field-name>: <quality_monitor-field-value>
| Key | Type | Description |
|---|---|---|
assets_dir |
String | Каталог для хранения ресурсов мониторинга (например, панелей мониторинга, таблиц метрик). |
baseline_table_name |
String | Имя базовой таблицы, из которой вычисляются метрики смещения. Столбцы в отслеживаемой таблице также должны присутствовать в базовой таблице. |
custom_metrics |
Sequence | Пользовательские метрики для вычислений в отслеживаемой таблице. Это могут быть статистические метрики, производные метрики (от уже вычисляемых статистических метрик) или метрики смещения (сравнение метрик в течение нескольких периодов времени). См. custom_metrics. |
inference_log |
Map | Конфигурация для журналов вывода выводов. См. inference_log. |
latest_monitor_failure_msg |
String | Последнее сообщение об ошибке монитора. Это поле только для чтения, которое заполняется при сбое монитора. Добавлено в Databricks CLI версии 0.264.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
notifications |
Map | Параметры уведомлений для монитора. См. уведомления. |
output_schema_name |
String | Схема, в которой создаются выходные таблицы метрик. |
schedule |
Map | Расписание автоматического обновления и перезагрузки метрических таблиц. См. расписание. |
skip_builtin_dashboard |
Boolean | Следует ли пропустить создание панели мониторинга по умолчанию, в котором суммируются метрики качества данных. |
slicing_exprs |
Sequence | Список выражений столбцов для среза данных с целевым анализом. Данные группируются по каждому выражению независимо, что приводит к отдельному срезу для каждого предиката и его дополнений. Для столбцов высокой кардинальности только первые 100 уникальных значений по частоте будут использоваться для создания срезов. |
snapshot |
Map | Конфигурация для мониторинга таблиц моментальных снимков. См. снэпшот. |
table_name |
String | Полное имя таблицы. Добавлено в Databricks CLI версии 0.235.0 |
time_series |
Map | Конфигурация для мониторинга таблиц временных рядов. См. time_series. |
warehouse_id |
String | Необязательный аргумент для указания хранилища для создания панели мониторинга. Если не указано, будет использоваться первый работающий склад. |
quality_monitor.пользовательские_метрики
Type: Sequence
Список настраиваемых определений метрик.
Каждый элемент в списке CustomMetric— это :
| Key | Type | Description |
|---|---|---|
definition |
String | Шаблон Jinja для выражения SQL, указывающего способ вычисления метрики. См. определение метрик. |
input_columns |
Sequence | Список названий столбцов входной таблицы, для которых необходимо вычислить метрику. Может использоваться :table для указания того, что метрика нуждается в информации из нескольких столбцов. |
name |
String | Имя метрики в выходных таблицах. |
output_data_type |
String | Тип выходных данных пользовательской метрики. |
type |
String | Может быть только одним из CUSTOM_METRIC_TYPE_AGGREGATE, CUSTOM_METRIC_TYPE_DERIVEDили CUSTOM_METRIC_TYPE_DRIFT.
CUSTOM_METRIC_TYPE_AGGREGATE
CUSTOM_METRIC_TYPE_DERIVED Метрики вычисляются в одной таблице, а CUSTOM_METRIC_TYPE_DRIFT метрики сравниваются между базовыми и входными таблицами или двумя последовательными периодами времени.
|
quality_monitor.inference_log
Type: Map
Конфигурация для журналов вывода выводов.
| Key | Type | Description |
|---|---|---|
granularities |
Sequence | Степень детализации времени для агрегирования журналов вывода (например, ["1 day"]). |
model_id_col |
String | Имя столбца, содержащего идентификатор модели. |
prediction_col |
String | Имя столбца, содержащего прогноз. |
timestamp_col |
String | Имя столбца, содержащего метку времени. |
problem_type |
String | Тип проблемы машинного обучения. Допустимые значения включают PROBLEM_TYPE_CLASSIFICATION, PROBLEM_TYPE_REGRESSION. |
label_col |
String | Имя столбца, содержащего метку (земная истина). |
prediction_proba_col |
String | Имя столбца, содержащего вероятности прогнозирования. |
монитор_качества.уведомления
Type: Map
Параметры уведомлений для монитора.
| Key | Type | Description |
|---|---|---|
on_failure |
Map | Параметры уведомлений при сбое монитора. См. on_failure. |
on_new_classification_tag_detected |
Map | Параметры уведомлений при обнаружении новых тегов классификации. См. on_new_classification_tag_detected. |
Уведомления мониторинга качества при сбое
Type: Map
Параметры уведомлений при сбое монитора.
| Key | Type | Description |
|---|---|---|
email_addresses |
Sequence | Список адресов электронной почты для уведомления о сбое монитора. |
quality_monitor.notifications.обнаружен_новый_тег_классификации
Type: Map
Параметры уведомлений при обнаружении новых тегов классификации.
| Key | Type | Description |
|---|---|---|
email_addresses |
Sequence | Список адресов электронной почты для уведомления о обнаружении новых тегов классификации. |
quality_monitor.расписание
Type: Map
Планирование автоматического обновления таблиц метрик.
| Key | Type | Description |
|---|---|---|
quartz_cron_expression |
String | Выражение Cron с использованием синтаксиса Quartz. Например, 0 0 8 * * ? ежедневно выполняется в 8:00 утра. |
timezone_id |
String | Часовой пояс расписания (например, UTC, America/Los_Angeles). |
pause_status |
String | Приостановлено ли расписание. Допустимые значения: PAUSED, UNPAUSED. |
снимок_качества_мониторинга
Type: Map
Конфигурация для мониторинга таблиц моментальных снимков.
монитор_качества.временной_ряд
Конфигурация для мониторинга таблиц временных рядов.
| Key | Type | Description |
|---|---|---|
granularities |
Sequence | Детализация временных интервалов для объединения данных временных рядов (например, ["30 minutes"]). |
timestamp_col |
String | Имя столбца, содержащего метку времени. |
Examples
В следующих примерах определяются мониторы качества для типов профилей InferenceLog, TimeSeries и Snapshot.
# InferenceLog profile type
resources:
quality_monitors:
my_quality_monitor:
table_name: dev.mlops_schema.predictions
output_schema_name: ${bundle.target}.mlops_schema
assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
inference_log:
granularities: [1 day]
model_id_col: model_id
prediction_col: prediction
label_col: price
problem_type: PROBLEM_TYPE_REGRESSION
timestamp_col: timestamp
schedule:
quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
timezone_id: UTC
# TimeSeries profile type
resources:
quality_monitors:
my_quality_monitor:
table_name: dev.mlops_schema.predictions
output_schema_name: ${bundle.target}.mlops_schema
assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
time_series:
granularities: [30 minutes]
timestamp_col: timestamp
schedule:
quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
timezone_id: UTC
# Snapshot profile type
resources:
quality_monitors:
my_quality_monitor:
table_name: dev.mlops_schema.predictions
output_schema_name: ${bundle.target}.mlops_schema
assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
snapshot: {}
schedule:
quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
timezone_id: UTC
В следующем примере настраивается монитор качества и соответствующее задание переобучения модели на основе мониторинга:
# Quality monitoring workflow
resources:
quality_monitors:
mlops_quality_monitor:
table_name: ${bundle.target}.mlops_demo.predictions
output_schema_name: ${bundle.target}.mlops_demo
assets_dir: /Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
inference_log:
granularities: [1 hour]
model_id_col: model_version
prediction_col: prediction
label_col: fare_amount
problem_type: PROBLEM_TYPE_REGRESSION
timestamp_col: inference_timestamp
schedule:
quartz_cron_expression: 57 0 14 * * ? # refresh monitoring metrics every day at 7 am PT
timezone_id: UTC
jobs:
retraining_job:
name: ${bundle.target}-mlops_demo-monitoring-retraining-job
tasks:
- task_key: monitored_metric_violation_check
notebook_task:
notebook_path: ../monitoring/notebooks/MonitoredMetricViolationCheck.py
base_parameters:
env: ${bundle.target}
table_name_under_monitor: ${bundle.target}.mlops_demo.predictions
metric_to_monitor: r2_score
metric_violation_threshold: 0.7
num_evaluation_windows: 24
num_violation_windows: 5 # 5 out of the past 24 windows have metrics lower than threshold
- task_key: is_metric_violated
depends_on:
- task_key: monitored_metric_violation_check
condition_task:
op: EQUAL_TO
left: '{{tasks.monitored_metric_violation_check.values.is_metric_violated}}'
right: 'true'
- task_key: trigger_retraining
depends_on:
- task_key: is_metric_violated
outcome: 'true'
run_job_task:
job_id: ${resources.jobs.model_training_job.id}
schedule:
quartz_cron_expression: '0 0 15 * * ?' # daily at 8 am PDT
timezone_id: UTC
# To get notifications, provide a list of emails to the on_failure argument.
#
# email_notifications:
# on_failure:
# - someone@example.com
зарегистрированная модель (каталог Unity)
Type: Map
Ресурс зарегистрированной модели позволяет определять модели в каталоге Unity. Сведения о зарегистрированных моделях в каталоге Unity смотрите в статье Управление жизненным циклом модели в каталоге Unity.
registered_models:
<registered_model-name>:
<registered_model-field-name>: <registered_model-field-value>
| Key | Type | Description |
|---|---|---|
aliases |
Sequence | Список псевдонимов, связанных с зарегистрированной моделью. См. registered_model.aliases. Добавлено в Databricks CLI версии 0.273.0 |
catalog_name |
String | Имя каталога, в котором находится схема и зарегистрированная модель. |
comment |
String | Комментарий, присоединенный к зарегистрированной модели. |
created_at |
Integer | Метка времени создания зарегистрированной модели в миллисекундах с эпохи Unix. Добавлено в Databricks CLI версии 0.273.0 |
created_by |
String | Идентификатор пользователя, создавшего зарегистрированную модель. Добавлено в Databricks CLI версии 0.273.0 |
full_name |
String | Трехуровневое (полностью квалифицированное) имя зарегистрированной модели. Добавлено в Databricks CLI версии 0.273.0 |
grants |
Sequence | Гранты, ассоциированные с зарегистрированной моделью. См.грант. |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
metastore_id |
String | Уникальный идентификатор хранилища метаданных. Добавлено в Databricks CLI версии 0.273.0 |
name |
String | Имя зарегистрированной модели. |
owner |
String | Идентификатор пользователя, которому принадлежит зарегистрированная модель. Добавлено в Databricks CLI версии 0.273.0 |
schema_name |
String | Имя схемы, в которой находится зарегистрированная модель. |
storage_location |
String | Расположение хранилища в облаке, в котором хранятся файлы данных версии модели. |
updated_at |
String | Метка времени последнего обновления зарегистрированной модели в миллисекундах с эпохи Unix. Добавлено в Databricks CLI версии 0.273.0 |
updated_by |
String | Идентификатор пользователя, который в последний раз обновил зарегистрированную модель. Добавлено в Databricks CLI версии 0.273.0 |
зарегистрированная_модель.алиасы ("registered_model.aliases")
Type: Sequence
Список псевдонимов, связанных с зарегистрированной моделью.
Каждый элемент в списке — это Alias:
| Key | Type | Description |
|---|---|---|
alias_name |
String | Имя псевдонима, например "чемпион" или "latest_stable" |
catalog_name |
String | Имя каталога, содержащего версию модели |
id |
String | Уникальный идентификатор псевдонима |
model_name |
String | Имя зарегистрированной родительской модели версии модели относительно исходной схемы. |
schema_name |
String | Имя схемы, содержащей версию модели, относительно родительского каталога |
version_num |
Integer | Целочисленный номер версии модели, к которой указывает этот псевдоним. |
Example
В следующем примере определяется зарегистрированная модель в каталоге Unity:
resources:
registered_models:
model:
name: my_model
catalog_name: ${bundle.target}
schema_name: mlops_schema
comment: Registered model in Unity Catalog for ${bundle.target} deployment target
grants:
- privileges:
- EXECUTE
principal: account users
схема (каталог Unity)
Type: Map
Схемы поддерживаются в Python для декларативных пакетов автоматизации. См. databricks.bundles.schemas.
Тип ресурса схемы позволяет определять схемы каталога Unity для таблиц и других ресурсов в рабочих процессах и конвейерах, созданных в составе пакета. Схема, отличная от других типов ресурсов, имеет следующие ограничения:
- Владелец ресурса схемы всегда является пользователем развертывания и не может быть изменен. Если
run_asуказан в пакете, он будет игнорироваться операциями схемы. - Доступны только поля, поддерживаемые соответствующим объектом schemas create API для ресурса схемы. Например,
enable_predictive_optimizationне поддерживается, так как он доступен только в API обновления.
schemas:
<schema-name>:
<schema-field-name>: <schema-field-value>
| Key | Type | Description |
|---|---|---|
catalog_name |
String | Имя родительского каталога. |
comment |
String | Описание текста свободной формы, предоставленное пользователем. |
custom_max_retention_hours |
Integer | Максимальный срок хранения — часы — для схемы. Добавлено в версии Databricks CLI 1.5.0 |
grants |
Sequence | Гранты, связанные с схемой. См.грант. |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
name |
String | Имя схемы относительно родительского каталога. |
properties |
Map | Карта свойств key-value, присоединенных к схеме. |
storage_root |
String | URL-адрес корневого хранилища для управляемых таблиц в схеме. |
Examples
В следующем примере определяется конвейер с ключом my_pipeline ресурса, который создает схему каталога Unity с ключом my_schema в качестве целевого объекта. В этом примере используются подстановки.
resources:
pipelines:
my_pipeline:
name: test-pipeline
libraries:
- notebook:
path: ../src/nb.ipynb
- file:
path: ../src/range.sql
development: true
catalog: ${resources.schemas.my_schema.catalog_name}
target: ${resources.schemas.my_schema.id}
schemas:
my_schema:
name: test-schema
catalog_name: main
comment: This schema was created by Declarative Automation Bundles.
Сопоставление грантов верхнего уровня не поддерживается декларативными пакетами автоматизации, поэтому если вы хотите задать гранты для схемы, определите гранты для схемы в сопоставлении schemas . Для получения дополнительной информации о правах доступа см. раздел Показать, предоставить и отозвать привилегии.
В следующем примере определяется схема каталога Unity с грантами:
resources:
schemas:
my_schema:
name: test-schema
grants:
- principal: users
privileges:
- SELECT
- principal: my_team
privileges:
- MANAGE
catalog_name: main
секрет (Unity Catalog)
Type: Map
Секретный ресурс позволяет определить секрет, хранящийся в Unity Catalog. Секреты — это объекты трёхуровневого пространства имён (catalog.schema.secret), которые безопасно хранят чувствительные данные учетных данных, такие как пароли, токены и ключи.
Note
Использование декларативных автоматизированных пакетов для определения секретов поддерживается только при использовании движка прямого развертывания.
Добавлено в Databricks CLI версии 1.12.0
secrets:
<secret-name>:
<secret-field-name>: <secret-field-value>
| Key | Type | Description |
|---|---|---|
catalog_name |
String | Обязательное. Название каталога, где хранятся схема и секрет. Добавлено в Databricks CLI версии 1.12.0 |
comment |
String | Пользовательское свободное текстовое описание секрета. Должно быть от 1 до 65536 символов. Добавлено в Databricks CLI версии 1.12.0 |
expire_time |
String | Срок действия секрета, предоставленный пользователем. Это поле указывает, когда секрет больше не следует использовать, и может отображаться как предупреждение в интерфейсе. Это чисто информационный характер и не вызывает автоматических действий и не влияет на жизненный цикл секрета. Добавлено в Databricks CLI версии 1.12.0 |
grants |
Sequence | Гранты для подачи заявки на этот секрет. См.грант. Добавлено в Databricks CLI версии 1.12.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 1.12.0 |
name |
String | Обязательное. Название секрета относительно её родительской схемы. Добавлено в Databricks CLI версии 1.12.0 |
owner |
String | Владелец секрета. По умолчанию используется принцип создания при созданиях. Можно обновить для передачи права собственности на секрет другому принципалу. Добавлено в Databricks CLI версии 1.12.0 |
schema_name |
String | Обязательное. Название схемы, где хранится секрет. Добавлено в Databricks CLI версии 1.12.0 |
value |
String | Обязательное. Секретная ценность для хранения. Это поле является только входным и не возвращается в ответах — используйте effective_value поле ( GetSecret через с include_value установленным в true) для чтения секретного значения. Максимальный размер — 60 КиБ (до шифрования). Допустимый контент включает пароли, жетоны, ключи и другие чувствительные данные учетных данных. Должно быть от 1 до 61440 символов.Добавлено в Databricks CLI версии 1.12.0 |
Examples
Следующий пример определяет секрет Unity Catalog, значение которого предоставляется переменной bundle во время развертывания:
bundle:
name: my-bundle
variables:
my_secret_value:
description: 'Secret value passed at deploy time'
resources:
secrets:
my_secret:
catalog_name: main
schema_name: default
name: my_api_key
value: ${var.my_secret_value}
comment: 'API key for external service'
секретное_пространство
Type: Map
Ресурс secret_scope позволяет определять области секретов в пакете. Сведения о областях секретов см. в разделе "Управление секретами".
Добавлено в Databricks CLI версии 0.252.0
secret_scopes:
<secret_scope-name>:
<secret_scope-field-name>: <secret_scope-field-value>
| Key | Type | Description |
|---|---|---|
backend_type |
String | Тип бэкенда, с использованием которого будет создана область. Если этот параметр не указан, по умолчанию будет использовано значение DATABRICKS.Добавлено в Databricks CLI версии 0.252.0 |
keyvault_metadata |
Map | Метаданные для секретной области, если backend_type — это AZURE_KEYVAULT. См. keyvault_metadata.Добавлено в Databricks CLI версии 0.252.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
name |
String | Имя области, запрашиваемое пользователем. Имена областей уникальны. Добавлено в Databricks CLI версии 0.252.0 |
permissions |
Sequence | Разрешения для применения к области секретного пространства. Разрешения управляются через ACL секретного масштаба, поэтому каждое group_name, user_name, или service_principal_name переводится в principal поле ACL. Допустимые уровни — READ, WRITEи MANAGE. Просмотр разрешений.Добавлено в Databricks CLI версии 0.252.0 |
secret_scope.keyvault_metadata
Type: Map
Метаданные для областей секретов, поддерживаемых Azure Key Vault.
| Key | Type | Description |
|---|---|---|
resource_id |
String | Идентификатор ресурса Azure Key Vault. |
dns_name |
String | DNS-имя Azure Key Vault. |
Examples
В следующем примере определяется секретная область, которая использует бэкенд хранилища ключей.
resources:
secret_scopes:
secret_scope_azure:
name: test-secrets-azure-backend
backend_type: 'AZURE_KEYVAULT'
keyvault_metadata:
resource_id: my_azure_keyvault_id
dns_name: my_azure_keyvault_dns_name
В следующем примере устанавливается пользовательский список управления доступом (ACL) с помощью областей секретов и разрешений.
resources:
secret_scopes:
my_secret_scope:
name: my_secret_scope
permissions:
- user_name: admins
level: WRITE
- user_name: users
level: READ
Пример пакета, демонстрирующий определение области секрета и задания с задачей, считывающей из него в пакете, см. в примерах bundle-examples GitHub репозитория.
SQL_хранилище
Type: Map
Ресурс хранилища SQL позволяет определить хранилище SQL в пакете. Дополнительные сведения о хранилищах SQL см. в разделе Хранилище Данных на Azure Databricks.
Добавлено в Databricks CLI версии 0.260.0
sql_warehouses:
<sql-warehouse-name>:
<sql-warehouse-field-name>: <sql-warehouse-field-value>
| Key | Type | Description |
|---|---|---|
auto_stop_mins |
Integer | Время в минутах, в течение которых хранилище SQL должно быть бездействующим (например, без выполнения запросов), прежде чем оно будет остановлено автоматически. Допустимые значения — 0, что означает отсутствие автоостановки, или больше или равно 10 (классика/профессионал) или 1 (без сервера). По умолчанию 120 (классический/профессионал) и 10 (без сервера). Добавлено в Databricks CLI версии 0.260.0 |
channel |
Map | Сведения о канале. См. канал. Добавлено в Databricks CLI версии 0.260.0 |
cluster_size |
String | Размер кластеров, выделенных для этого хранилища. Увеличение размера кластера Spark позволяет выполнять в нем более крупные запросы. Если вы хотите увеличить число одновременных запросов, настройте max_num_clusters. Поддерживаемые значения см. в cluster_size. Добавлено в Databricks CLI версии 0.260.0 |
creator_name |
String | Имя пользователя, создавшего хранилище. Добавлено в Databricks CLI версии 0.260.0 |
enable_photon |
Boolean | Следует ли использовать оптимизированные для хранилища кластеры Photon. По умолчанию false. Добавлено в Databricks CLI версии 0.260.0 |
enable_serverless_compute |
Boolean | Следует ли использовать бессерверные вычислительные ресурсы хранилища. Добавлено в Databricks CLI версии 0.260.0 |
instance_profile_arn |
String | Deprecated. Профиль экземпляра, используемый для передачи роли IAM в кластер. Добавлено в Databricks CLI версии 0.260.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
max_num_clusters |
Integer | Максимальное количество кластеров, создаваемых автомасштабированием для обработки параллельных запросов. Значения должны быть меньше или равно 30 и больше или равно min_num_clusters. По умолчанию используется min_clusters, если не задано.Добавлено в Databricks CLI версии 0.260.0 |
min_num_clusters |
Integer | Минимальное количество доступных кластеров, которые будут поддерживаться для этого хранилища SQL. Увеличение этого параметра гарантирует, что будет всегда работать большее количество кластеров, и это может сократить время запуска новых запросов. Это аналогично зарезервированным ядрам и отзываемым ядрам в диспетчере ресурсов. Значения должны быть больше 0 и меньше или равно min(max_num_clusters, 30). По умолчанию равен 1. Добавлено в Databricks CLI версии 0.260.0 |
name |
String | Логическое имя кластера. Имя должно быть уникальным в пределах организации и менее 100 символов. Добавлено в Databricks CLI версии 0.260.0 |
permissions |
Sequence | Разрешения для применения к хранилищу. Просмотр разрешений. Добавлено в Databricks CLI версии 0.260.0 |
spot_instance_policy |
String | Следует ли использовать точечные экземпляры. Допустимые значения: POLICY_UNSPECIFIED, COST_OPTIMIZEDRELIABILITY_OPTIMIZED. Значение по умолчанию — COST_OPTIMIZED.Добавлено в Databricks CLI версии 0.260.0 |
tags |
Map | Набор пользовательских тегов для хранилища. См. раздел sql_warehouse.tags. Добавлено в Databricks CLI версии 0.260.0 |
warehouse_type |
String | Тип хранилища. Допустимые значения — PRO и CLASSIC. Если вы хотите использовать бессерверные вычисления, задайте для этого поля значение PRO, а также установите значение для поля enable_serverless_compute на true.Добавлено в Databricks CLI версии 0.260.0 |
sql_warehouse.channel
Type: Map
Конфигурация канала для хранилища SQL.
| Key | Type | Description |
|---|---|---|
name |
String | Имя канала. Допустимые значения: CHANNEL_NAME_CURRENT, CHANNEL_NAME_PREVIEWCHANNEL_NAME_CUSTOM. |
dbsql_version |
String | Версия DBSQL для пользовательских каналов. |
sql_warehouse.теги
Type: Map
Настраиваемые теги для хранилища SQL.
| Key | Type | Description |
|---|---|---|
custom_tags |
Sequence | Набор пар "ключ-значение", определяющих теги для всех ресурсов (например, экземпляров AWS и томов EBS), связанных с этим хранилищем SQL. Количество тегов должно быть меньше 45. |
Example
В следующем примере определяется хранилище SQL:
resources:
sql_warehouses:
my_sql_warehouse:
name: my_sql_warehouse
cluster_size: X-Large
enable_serverless_compute: true
max_num_clusters: 3
min_num_clusters: 1
auto_stop_mins: 60
warehouse_type: PRO
tags:
custom_tags:
- key: 'bizunit'
value: 'commercial'
- key: 'area'
value: 'marketing'
синхронизированная_таблица_базы_данных
Type: Map
Ресурс синхронизированной таблицы базы данных позволяет определять таблицы баз данных Lakebase в пакете.
Сведения о синхронизированных таблицах баз данных см. в разделе "Подготовленная база озера".
Добавлено в Databricks CLI версии 0.266.0
synced_database_tables:
<synced_database_table-name>:
<synced_database_table-field-name>: <synced_database_table-field-value>
| Key | Type | Description |
|---|---|---|
database_instance_name |
String | Имя целевого экземпляра базы данных. Это необходимо при создании синхронизированных таблиц баз данных в стандартных каталогах. Это необязательно при создании синхронизированных таблиц баз данных в зарегистрированных каталогах; Если указано в этом случае, имя экземпляра базы данных должно совпадать с именем зарегистрированного каталога, иначе запрос отклоняется. Добавлено в Databricks CLI версии 0.266.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
logical_database_name |
String | Имя целевого объекта базы данных Postgres (логическая база данных) для этой таблицы. При создании синхронизированной таблицы в зарегистрированном каталоге Postgres целевой базы данных Postgres предполагается как имя зарегистрированного каталога. Если в этом случае указано это поле, имя базы данных Postgres должно совпадать с именем зарегистрированного каталога, иначе запрос отклоняется. При создании синхронизированной таблицы в стандартном каталоге требуется это поле, и его указание позволяет выбрать произвольную базу данных Postgres. Обратите внимание, что это имеет последствия для create_database_objects_if_missing поля в spec.Добавлено в Databricks CLI версии 0.266.0 |
name |
String | Обязательное. Полное имя таблицы в форме catalog.schema.table.Добавлено в Databricks CLI версии 0.266.0 |
spec |
Map | Спецификация таблицы базы данных. См. спецификацию синхронизированной таблицы базы данных. Добавлено в Databricks CLI версии 0.266.0 |
synced_database_table.spec
Type: Map
Спецификация таблицы базы данных.
Добавлено в Databricks CLI версии 0.266.0
| Key | Type | Description |
|---|---|---|
create_database_objects_if_missing |
Boolean | Следует ли создавать логическую базу данных и ресурсы схемы синхронизированной таблицы, если они еще не существуют. |
existing_pipeline_id |
String | Идентификатор существующего конвейера. Если это задано, синхронизированная таблица будет упакована в существующий конвейер, на который ссылается ссылка. Это позволяет избежать создания нового конвейера и позволяет совместно использовать существующие вычислительные ресурсы. В этом случае синхронизированная таблица scheduling_policy должна соответствовать политике планирования существующего конвейера. Не более одного из existing_pipeline_id и new_pipeline_spec должно быть определено. |
new_pipeline_spec |
Map | Спецификация нового конвейера. См. new_pipeline_spec. Не более одного из existing_pipeline_id и new_pipeline_spec должно быть определено. |
primary_key_columns |
Sequence | Список имен столбцов, формающих первичный ключ. |
scheduling_policy |
String | Политика планирования для синхронизации. Допустимые значения: SNAPSHOT, CONTINUOUSTRIGGERED. |
source_table_full_name |
String | Полное имя исходной таблицы в формате catalog.schema.table. |
timeseries_key |
String | Ключ для временных рядов для удаления дубликатов строк с одинаковым первичным ключом. |
synced_database_table.spec.new_pipeline_spec
Type: Map
Спецификация нового конвейера, используемого синхронизированной таблицей базы данных.
| Key | Type | Description |
|---|---|---|
budget_policy_id |
String | Идентификатор политики бюджета, заданной в только что созданном конвейере. |
storage_catalog |
String | Каталог для конвейера для хранения промежуточных файлов, таких как контрольные точки и журналы событий. Это должен быть стандартный каталог, в котором у пользователя есть разрешения на создание таблиц Delta. |
storage_schema |
String | Схема конвейера для хранения промежуточных файлов, таких как контрольные точки и журналы событий. Это должно быть в стандартном каталоге, где у пользователя есть разрешения на создание таблиц Delta. |
Examples
В следующем примере определяется синхронизированная таблица базы данных в соответствующем каталоге баз данных:
resources:
database_instances:
my_instance:
name: my-instance
capacity: CU_1
database_catalogs:
my_catalog:
database_instance_name: my-instance
database_name: 'my_database'
name: my_catalog
create_database_if_not_exists: true
synced_database_tables:
my_synced_table:
name: ${resources.database_catalogs.my_catalog.name}.${resources.database_catalogs.my_catalog.database_name}.my_destination_table
database_instance_name: ${resources.database_catalogs.my_catalog.database_instance_name}
logical_database_name: ${resources.database_catalogs.my_catalog.database_name}
spec:
source_table_full_name: 'my_source_table'
scheduling_policy: SNAPSHOT
primary_key_columns:
- my_pk_column
new_pipeline_spec:
storage_catalog: 'my_delta_catalog'
storage_schema: 'my_delta_schema'
В следующем примере определяется синхронизированная таблица базы данных в стандартном каталоге:
resources:
synced_database_tables:
my_synced_table:
name: 'my_standard_catalog.public.synced_table'
# database_instance_name is required for synced tables created in standard catalogs.
database_instance_name: 'my-database-instance'
# logical_database_name is required for synced tables created in standard catalogs:
logical_database_name: ${resources.database_catalogs.my_catalog.database_name}
spec:
source_table_full_name: 'source_catalog.schema.table'
scheduling_policy: SNAPSHOT
primary_key_columns:
- my_pk_column
create_database_objects_if_missing: true
new_pipeline_spec:
storage_catalog: 'my_delta_catalog'
storage_schema: 'my_delta_schema'
В этом примере создается синхронизированная таблица базы данных и настраивается расписание конвейера. Предполагается, что у вас уже есть:
- Именованный экземпляр базы данных
my-database-instance - Стандартный каталог с именем
my_standard_catalog - Схема в стандартном каталоге с именем
default - Исходная разностная таблица
source_delta.schema.customerс первичным ключомc_custkey
resources:
synced_database_tables:
my_synced_table:
name: 'my_standard_catalog.default.my_synced_table'
database_instance_name: 'my-database-instance'
logical_database_name: 'test_db'
spec:
source_table_full_name: 'source_delta.schema.customer'
scheduling_policy: SNAPSHOT
primary_key_columns:
- c_custkey
create_database_objects_if_missing: true
new_pipeline_spec:
storage_catalog: 'source_delta'
storage_schema: 'schema'
jobs:
sync_pipeline_schedule_job:
name: sync_pipeline_schedule_job
description: 'Job to schedule synced database table pipeline.'
tasks:
- task_key: synced-table-pipeline
pipeline_task:
pipeline_id: ${resources.synced_database_tables.my_synced_table.data_synchronization_status.pipeline_id}
schedule:
quartz_cron_expression: '0 0 0 * * ?'
vector_search_endpoint
Type: Map
Ресурс vector_search_endpoint позволяет определять конечные точки поиска ИИ в пакете. Сведения о поиске ИИ см. в разделе Databricks AI Search.
Note
Использование декларативных пакетов автоматизации для определения конечных точек поиска векторов поддерживается только в том случае, если вы используете подсистему прямого развертывания.
Добавлено в Databricks CLI версии 0.298.0
vector_search_endpoints:
<vector_search_endpoint-name>:
<vector_search_endpoint-field-name>: <vector_search_endpoint-field-value>
| Key | Type | Description |
|---|---|---|
budget_policy_id |
String | Идентификатор политики бюджета, используемой для этой конечной точки. Добавлено в Databricks CLI версии 0.298.0 |
endpoint_type |
String | Тип конечной точки. Допустимые значения — STORAGE_OPTIMIZED и STANDARD.Добавлено в Databricks CLI версии 0.298.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.298.0 |
name |
String | Имя конечной точки поиска ИИ. Добавлено в Databricks CLI версии 0.298.0 |
permissions |
Sequence | Разрешения для применения к конечной точке поиска ИИ. Допустимые уровни — CAN_CREATE, CAN_MANAGEи CAN_USE. Просмотр разрешений.Добавлено в Databricks CLI версии 0.298.0 |
target_qps |
Integer | Целевые запросы в секунду для конечной точки поиска ИИ. Взаимоисключающ с num_replicas. Фактическое количество реплик рассчитывается во время создания индекса или синхронизации на основе этого значения. Это цель для лучших усилий; система не гарантирует достижение этого QPS.Добавлено в версии Databricks CLI 0.299.2 |
Example
В следующем примере определяется конечная точка поиска ИИ:
# databricks.yml
bundle:
name: vector-search-example
engine: direct # Vector Search requires the direct deployment engine
resources:
vector_search_endpoints:
my_vector_search_endpoint:
name: my_vector_search_endpoint
endpoint_type: STANDARD
vector_search_index
Type: Map
Ресурс vector_search_index позволяет определять индексы векторного поиска в пакете. Сведения о поиске векторов см. в разделе Databricks AI Search.
Добавлено в Databricks CLI версии 1.1.0
vector_search_indexes:
<vector_search_index-name>:
<vector_search_index-field-name>: <vector_search_index-field-value>
| Key | Type | Description |
|---|---|---|
delta_sync_index_spec |
Map | Спецификация индекса разностной синхронизации. Обязательный параметр, если index_type имеет значение DELTA_SYNC. См . раздел vector_search_index.delta_sync_index_spec.Добавлено в Databricks CLI версии 1.1.0 |
direct_access_index_spec |
Map | Спецификация индекса прямого векторного доступа. Обязательный параметр, если index_type имеет значение DIRECT_ACCESS. См . раздел vector_search_index.direct_access_index_spec.Добавлено в Databricks CLI версии 1.1.0 |
endpoint_name |
String | Обязательное. Имя конечной точки, используемой для обслуживания индекса. Добавлено в Databricks CLI версии 1.1.0 |
grants |
Sequence | Гранты, связанные с индексом векторного поиска. См.грант. Добавлено в Databricks CLI версии 1.1.0 |
index_subtype |
String | (бета-версия) Подтип индекса. Допустимые значения — HYBRID и FULL_TEXT. Функция VECTOR не поддерживается.Добавлено в Databricks CLI версии 1.1.0 |
index_type |
String | Обязательное. Тип индекса. Допустимые значения:
|
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 1.1.0 |
name |
String | Обязательное. Имя индекса. Добавлено в Databricks CLI версии 1.1.0 |
primary_key |
String | Обязательное. Первичный ключ индекса. Добавлено в Databricks CLI версии 1.1.0 |
vector_search_index.delta_sync_index_spec
Type: Map
Спецификация индекса разностной синхронизации.
Добавлено в Databricks CLI версии 1.1.0
| Key | Type | Description |
|---|---|---|
columns_to_index |
Sequence | Необязательно. Псевдоним для columns_to_sync. Выберите столбцы, которые необходимо включить в векторный индекс. Если это поле пусто, все столбцы из исходной таблицы включаются. Столбец первичного ключа и вставка исходного столбца или встраивающего векторного столбца всегда включаются. Указать только один из columns_to_sync них или columns_to_index может быть указан. |
columns_to_sync |
Sequence | Необязательно. Выберите столбцы для синхронизации с векторным индексом. Если это поле пусто, все столбцы из исходной таблицы синхронизируются с индексом. Столбец первичного ключа и столбец источника встраивания или столбец встраиваемого вектора всегда синхронизированы. |
embedding_source_columns |
Sequence | Столбцы, содержащие источник внедрения. |
embedding_vector_columns |
Sequence | Столбцы, содержащие векторы внедрения. |
embedding_writeback_table |
String | Необязательно. Имя таблицы Delta для синхронизации содержимого векторного индекса и вычисляемых внедрения. |
pipeline_type |
String | Режим выполнения конвейера. Допустимые значения:
|
source_table |
String | Имя исходной таблицы. |
vector_search_index.direct_access_index_spec
Type: Map
Спецификация индекса прямого векторного доступа.
Добавлено в Databricks CLI версии 1.1.0
| Key | Type | Description |
|---|---|---|
embedding_source_columns |
Sequence | Столбцы, содержащие источник внедрения. Его необходимо указать в формате array[double]. |
embedding_vector_columns |
Sequence | Столбцы, содержащие векторы внедрения. Его необходимо указать в формате array[double]. |
schema_json |
String | Схема индекса в формате JSON. Поддерживаемые типы: integer, long, floatdoublebooleanstring, . datetimestamp Поддерживаемые типы для векторных столбцов: array<float>, array<double>. |
Example
В следующем примере определяется индекс векторного поиска Delta Sync:
resources:
vector_search_endpoints:
my_endpoint:
name: my-endpoint
endpoint_type: STANDARD
vector_search_indexes:
my_index:
name: main.default.my_index
endpoint_name: ${resources.vector_search_endpoints.my_endpoint.name}
primary_key: id
index_type: DELTA_SYNC
delta_sync_index_spec:
source_table: main.default.source
pipeline_type: TRIGGERED
grants:
- principal: data-engineers
privileges: [SELECT]
том (каталог Unity)
Type: Map
Тома поддерживаются в Python для декларативных пакетов автоматизации. См. databricks.bundles.volumes.
Тип ресурса тома позволяет определять и создавать тома каталога Unity как часть пакета. При развертывании пакета с определенным томом обратите внимание на следующее:
- Нельзя ссылаться на том в
artifact_pathпакета, пока он не будет существовать в рабочей области. Поэтому, если вы хотите использовать декларативные пакеты автоматизации для создания тома, сначала необходимо определить том в пакете, развернуть его для создания тома, а затем ссылаться на него вartifact_pathпоследующих развертываниях. - Тома в наборе не получают префикс
dev_${workspace.current_user.short_name}, если для целевого объекта развертывания настроенmode: development. Однако этот префикс можно настроить вручную. См. пользовательские предустановки.
Добавлено в Databricks CLI версии 0.236.0
volumes:
<volume-name>:
<volume-field-name>: <volume-field-value>
| Key | Type | Description |
|---|---|---|
catalog_name |
String | Имя каталога схем и томов. Добавлено в Databricks CLI версии 0.236.0 |
comment |
String | Комментарий, прикрепленный к тому. Добавлено в Databricks CLI версии 0.236.0 |
grants |
Sequence | Гранты, связанные с томом. См.грант. Добавлено в Databricks CLI версии 0.236.0 |
lifecycle |
Map | Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл. Добавлено в Databricks CLI версии 0.268.0 |
name |
String | Имя тома. Добавлено в Databricks CLI версии 0.236.0 |
schema_name |
String | Имя схемы, в которой находится том. Добавлено в Databricks CLI версии 0.236.0 |
storage_location |
String | Расположение хранилища в облаке. Добавлено в Databricks CLI версии 0.236.0 |
volume_type |
String | Тип тома, либо EXTERNAL, или MANAGED. Внешний том находится в указанном внешнем расположении. Управляемый том находится в расположении по умолчанию, указанном родительской схемой, родительским каталогом или хранилищем метаданных. См. раздел "Управляемые и внешние тома". |
Example
В следующем примере создается том каталога Unity с ключом my_volume_id:
resources:
volumes:
my_volume_id:
catalog_name: main
name: my_volume
schema_name: my_schema
Пример пакета, выполняющего задание, записываемое в файл в томе каталога Unity, см. в разделе bundle-examples GitHub репозиторий.
Общие объекты
грант
Type: Map
Определяет субъект и привилегии для предоставления этому субъекту. Для получения дополнительной информации о правах доступа см. раздел Показать, предоставить и отозвать привилегии.
| Key | Type | Description |
|---|---|---|
principal |
String | Имя субъекта, которому будут предоставлены привилегии. Это может быть пользователь, группа или субъект-служба. |
privileges |
Sequence | Привилегии, которые нужно предоставить указанному объекту. Допустимые значения зависят от типа ресурса (например, SELECT, MODIFY, CREATEUSAGE, , READ_FILES, WRITE_FILES. EXECUTEALL_PRIVILEGES |
Example
В следующем примере определяется схема каталога Unity с грантами:
resources:
schemas:
my_schema:
name: test-schema
grants:
- principal: users
privileges:
- SELECT
- principal: my_team
privileges:
- MANAGE
catalog_name: main
жизненный цикл
Type: Map
Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении.
Добавлено в Databricks CLI версии 0.268.0
| Key | Type | Description |
|---|---|---|
prevent_destroy |
Boolean | Параметр жизненного цикла, чтобы предотвратить уничтожение ресурса. Добавлено в Databricks CLI версии 0.268.0 |
started |
Boolean | Параметр жизненного цикла для развертывания ресурса в режиме запуска. Поддерживается только для приложений, кластеров и sql_warehouses в режиме прямого развертывания. Добавлено в Databricks CLI версии 0.297.0 (приложения) Добавлено в Интерфейс командной строки Databricks версии 1.1.0 (кластеры) Добавлено в Databricks CLI версии 1.2.0 (sql_warehouses) |