Декларативные ресурсы пакетов автоматизации

Декларативные пакеты автоматизации (ранее известные как наборы ресурсов Databricks) позволяют указать сведения о Azure Databricks ресурсах, используемых пакетом в сопоставлении resources в конфигурации пакета. См. справочник по ресурсам.

Эта страница содержит ссылку на конфигурацию для всех поддерживаемых типов ресурсов для пакетов и содержит подробные сведения и пример для каждого поддерживаемого типа. Дополнительные примеры см. в примерах конфигурации пакета .

Схема JSON для пакетов, используемых для проверки конфигурации YAML, находится в репозитории cli GitHub Databricks CLI.

Tip

Чтобы создать YAML для любого существующего ресурса, используйте команду databricks bundle generate. См. создание пакета databricks.

поддерживаемые ресурсы

В следующей таблице перечислены поддерживаемые типы ресурсов для пакетов (YAML и Python, где это применимо). Некоторые ресурсы можно создать, определив их в пакете и развернув пакет, и некоторые ресурсы можно создать только путем ссылки на существующий ресурс для включения в пакет.

Конфигурация ресурсов определяет объект Databricks, соответствующий объекту REST API Databricks . Поля создающего запроса объекта REST API, выраженные в формате YAML, являются поддерживаемыми ключами ресурса. Ссылки на документацию по соответствующему объекту каждого ресурса приведены в таблице ниже.

Tip

Команда databricks bundle validate возвращает предупреждения, если неизвестные свойства ресурсов находятся в файлах конфигурации пакета.

Resource поддержка Python Соответствующий объект REST API
alert Объект Alert
app объект приложения
catalog (каталог Unity) Объект каталога
cluster объект кластера
dashboard объект панели мониторинга
database_catalog Объект каталога базы данных
database_instance Объект экземпляра базы данных
experiment Экспериментальный объект
external_location (каталог Unity) Объект внешнего расположения
genie_spaces Агенты Genie
instance_pool Объект пула экземпляров
job Работы объект работы
job_run Объект запущенного задания
Модель (устаревшая версия) Модель (устаревшая версия) объекта
model_serving_endpoint объект конечной точки обслуживания модели
pipeline Pipelines объект конвейера
postgres_branch Объект ветви Postgres
postgres_catalog Объект каталога Postgres
postgres_database Объект базы данных Postgres
postgres_endpoint Объект вычислительной конечной точки Postgres
postgres_project Объект проекта Postgres
postgres_role Объект роли Postgres
postgres_synced_table Объект синхронизированной таблицы Postgres
quality_monitor объект контроля качества
registered_model (каталог Unity) зарегистрированный объект модели
схема (каталог Unity) Schemas объект схемы
секрет (Unity Catalog) Секретный объект
secret_scope Объект области секрета
sql_warehouse Объект хранилища SQL
синхронизированная_таблица_базы_данных Объект таблицы синхронизированной базы данных
vector_search_endpoint Объект конечной точки поиска ИИ
vector_search_index Объект индекса векторного поиска
объём данных (Unity Catalog) Объемы объект объёма

предупреждение

Type: Map

Ресурс генерации оповещений определяет оповещение SQL (версия 2).

Добавлено в Databricks CLI версии 0.279.0

alerts:
  <alert-name>:
    <alert-field-name>: <alert-field-value>
Key Type Description
custom_description String Необязательно. Настраиваемое описание оповещения. Поддерживает шаблон усов.
Добавлено в Databricks CLI версии 0.279.0
custom_summary String Необязательно. Настраиваемая сводка для оповещения. Поддерживает шаблон усов.
Добавлено в Databricks CLI версии 0.279.0
display_name String Обязательное. Отображаемое имя оповещения, например Example alert.
Добавлено в Databricks CLI версии 0.279.0
evaluation Map Обязательное. Конфигурация оценки для оповещения. См. оповещение.evaluation.
Добавлено в Databricks CLI версии 0.279.0
file_path String Локальный путь к файлу ресурса оповещения.
Добавлено в Интерфейс командной строки Databricks версии 0.282.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.279.0
parent_path String Необязательно. Путь к рабочей области папки, содержащей оповещение. Можно задать только при создании и не подлежит обновлению. Пример: /Users/someone@example.com.
Добавлено в Databricks CLI версии 0.279.0
permissions Sequence Разрешения на оповещения. Просмотр разрешений.
Добавлено в Databricks CLI версии 0.279.0
query_text String Обязательное. Например, SELECT 1текст выполняемого запроса.
Добавлено в Databricks CLI версии 0.279.0
run_as Map Необязательно. Указывает идентификатор, который будет использоваться для выполнения оповещения. Это поле позволяет настроить оповещения для запуска в качестве конкретного пользователя или субъекта-службы. См. run_as.
  • Для идентификации пользователя: установите user_name на адрес электронной почты активного пользователя рабочей области. Пользователи могут установить это только для собственного адреса электронной почты.
  • Для субъекта-службы: задайте service_principal_name идентификатор приложения. Требуется роль «servicePrincipal/user». Если это не указано, оповещение будет выполняться от имени пользователя запроса.

Добавлено в Databricks CLI версии 0.279.0
schedule Map Обязательное. Конфигурация расписания для оповещения. См. alert.schedule.
Добавлено в Databricks CLI версии 0.279.0
warehouse_id String Обязательное. Идентификатор хранилища SQL, подключенного к оповещению, например a7066a8ef796be84.
Добавлено в Databricks CLI версии 0.279.0

оповещение.оценка

Type: Map

Конфигурация оценки для оповещения.

Key Type Description
comparison_operator String Оператор, используемый для сравнения в оценке оповещений.
empty_result_state String Состояние оповещения в случае пустого результата. Избегайте настройки этого поля UNKNOWN , так как UNKNOWN состояние планируется нерекомендуемо.
notification Map Пользователь или другое место назначения, которого нужно уведомить, когда срабатывает оповещение. См. alert.evaluation.notification.
source Map Исходный столбец из результата, используемый для оценки оповещения. См. файл alert.evaluation.source.
threshold Map Пороговое значение, используемое для оценки оповещений. Это может быть столбец или значение. См. предупреждение.evaluation.threshold.

предупреждение.оценка.уведомление

Type: Map

Пользователь или другое место назначения, которого нужно уведомить, когда срабатывает оповещение.

Key Type Description
notify_on_ok Boolean Необязательно. Следует ли уведомлять подписчиков оповещений, когда оповещение возвращается в нормальное состояние.
retrigger_seconds Integer Необязательно. Количество секунд, в течение которых оповещение ожидается после активации, прежде чем разрешено отправлять другое уведомление. Если установлено значение 0 или опущено, оповещение не будет отправлять дальнейшие уведомления после первого срабатывания. Задание этого значения 1 позволяет оповещению отправлять уведомление при каждой оценке, если условие выполнено, эффективно обеспечивая его постоянное повторное срабатывание для целей уведомлений.
subscriptions Sequence Необязательно. Неупорядоченный список подписок на уведомления. См. статью alert.evaluation.notification.subscriptions.
уведомления о подписках на оценку предупреждений

Type: Sequence

Неупорядоченный список подписок на уведомления.

Каждый элемент в списке — это AlertSubscription:

Key Type Description
destination_id String Идентификатор назначения уведомления.
user_email String Адрес электронной почты пользователя, который нужно уведомить.

alert.evaluation.source

Type: Map

Исходный столбец из результата для оценки оповещения.

Key Type Description
aggregation String Метод агрегирования, применяемый к исходному столбцу. Допустимые значения: SUM, , COUNTCOUNT_DISTINCTAVGMEDIANMINMAXSTDDEV
display String Отображаемое имя исходного столбца.
name String Имя исходного столбца из результата запроса.

порог.оценки.оповещения

Type: Map

Пороговое значение, используемое для оценки оповещений, может быть столбцом или значением.

Key Type Description
column Map Ссылка на столбец для использования в качестве порогового значения. См. файл alert.evaluation.source.
value Map Литеральное значение, используемое в качестве порога. См. параметр alert.evaluation.threshold.value.
предупреждение.оценка.порог.значение

Type: Map

Литеральное значение, используемое в качестве порога. Укажите один из следующих типов значений.

Key Type Description
bool_value Boolean Необязательно. Логическое значение порога, например true.
double_value Double Необязательно. Числовое значение порога, например 1.25.
string_value String Необязательно. Строковое значение порога, например test.

оповещение.расписание

Type: Map

Конфигурация расписания для оповещения.

Key Type Description
pause_status String Необязательно. Является ли это расписание приостановленным или нет. Допустимые значения: UNPAUSED, PAUSED. По умолчанию: UNPAUSED.
quartz_cron_schedule String Обязательное. Выражение cron, использующее синтаксис Quartz, который задает расписание для этого потока. Формат кристалла описывается в формате планировщика.
timezone_id String Обязательное. Идентификатор часового пояса Java. Расписание будет разрешено с помощью этого часового пояса. Это будет объединено с quartz_cron_schedule для определения расписания. Подробные сведения см. в разделе SET TIME ZONE.

Examples

В следующем примере конфигурации определяется оповещение с простой оценкой:

resources:
  alerts:
    my_alert:
      display_name: my_alert
      evaluation:
        comparison_operator: EQUAL
        source:
          name: '1'
        threshold:
          value:
            double_value: 2
      query_text: select 2
      schedule:
        quartz_cron_schedule: '44 19 */1 * * ?'
        timezone_id: Europe/Amsterdam
      warehouse_id: 799f096837fzzzz4

В следующем примере конфигурации определяется оповещение с разрешениями, которые оцениваются с помощью агрегирования и отправляют уведомления:

resources:
  alerts:
    my_alert:
      permissions:
        - level: CAN_MANAGE
          user_name: someone@example.com
      custom_summary: 'My alert'
      display_name: 'My alert'
      evaluation:
        comparison_operator: 'EQUAL'
        notification:
          notify_on_ok: false
          retrigger_seconds: 1
        source:
          aggregation: 'MAX'
          display: '1'
          name: '1'
        threshold:
          value:
            double_value: 2
      query_text: 'select 2'
      schedule:
        pause_status: 'UNPAUSED'
        quartz_cron_schedule: '44 19 */1 * * ?'
        timezone_id: 'Europe/Amsterdam'
      warehouse_id: 799f096837fzzzz4

приложение

Type: Map

Ресурс приложения определяет приложение Databricks . Сведения о приложениях Databricks см. в разделе "Приложения Databricks".

Чтобы добавить приложение, укажите параметры для определения приложения, включая необходимые source_code_path.

Tip

Вы можете инициализировать пакет с приложением Streamlit Databricks с помощью следующей команды:

databricks bundle init https://github.com/databricks/bundle-examples --template-dir contrib/templates/streamlit-app

Добавлено в Интерфейс командной строки Databricks версии 0.239.0

apps:
  <app-name>:
    <app-field-name>: <app-field-value>
Key Type Description
budget_policy_id String Идентификатор политики бюджета для приложения.
Добавлено в Databricks CLI версии 0.243.0
compute_size String Размер вычислительных ресурсов для приложения. Допустимые значения: MEDIUMили LARGEXLARGE зависят от конфигурации рабочей области.
Добавлено в Databricks CLI версии 0.273.0
config Map Команды конфигурации приложений и переменные среды. См. app.config.
Добавлено в Databricks CLI версии 0.283.0
description String Описание приложения.
Добавлено в Интерфейс командной строки Databricks версии 0.239.0
git_repository Map Конфигурация репозитория Git для развертываний приложений. При указании развертывания могут ссылаться на код из этого репозитория, предоставляя только ссылку на git (ветвь, тег или фиксацию). См. app.git_repository.
Добавлено в Databricks CLI версии 0.283.0
git_source Map Конфигурация источника Git для развертываний приложений. Указывает, какая ссылка на Git (ветвь, тег или фиксация) используется при развертывании приложения. Используется в сочетании с git_repository развертыванием кода непосредственно из Git. В пределах source_code_pathgit_source определяется относительный путь к коду приложения в репозитории. См. app.git_source.
Добавлено в Интерфейс командной строки Databricks версии 0.290.0
lifecycle Map Поведение ресурса при развертывании или уничтожении ресурса. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
name String Имя приложения. Имя должно содержать только буквенно-цифровые символы нижнего регистра и дефисы. Он должен быть уникальным в рабочей области.
Добавлено в Интерфейс командной строки Databricks версии 0.239.0
permissions Sequence Разрешения приложения. Просмотр разрешений.
Добавлено в Интерфейс командной строки Databricks версии 0.239.0
resources Sequence Вычислительные ресурсы приложения. См. раздел app.resources.
Добавлено в Интерфейс командной строки Databricks версии 0.239.0
source_code_path String Локальный ./app путь исходного кода приложения Databricks.
Добавлено в Интерфейс командной строки Databricks версии 0.239.0
telemetry_export_destinations Sequence Назначения для экспорта данных телеметрии для приложения. См. app.telemetry_export_destinations.
Добавлено в Databricks CLI версии 0.294.0
usage_policy_id String Идентификатор политики бессерверного использования, используемой для этого приложения.
Добавлено в Databricks CLI версии 0.283.0
user_api_scopes Sequence Диапазоны пользовательского API.
Добавлено в Интерфейс командной строки Databricks версии 0.246.0

app.config

Команды конфигурации приложений и переменные среды. См . раздел "Настройка выполнения приложения Databricks с помощью app.yaml".

Key Type Description
command Sequence Команды для запуска приложения, например ["streamlit", "run", "app.py"]
env Sequence Список name и value пары, которые указывают переменные среды приложения для задания в среде выполнения приложения. Это переопределит переменные среды, указанные в файле app.yaml. Сведения о переменных среды среды приложений по умолчанию см. в среде Databricks Apps.
Переменные среды не задаются до запуска приложения.

app.git_repository

Type: Map

Конфигурация репозитория Git, указывающая расположение репозитория.

Key Type Description
provider String Обязательное. Поставщик Git. Без учета регистра. Поддерживаемые значения: gitHub, gitHubEnterprise, bitbucketCloud, bitbucketServer, azureDevOpsServices, gitLab, gitLabEnterpriseEdition, . awsCodeCommit
Добавлено в Databricks CLI версии 0.283.0
url String Обязательное. URL-адрес репозитория Git.
Добавлено в Databricks CLI версии 0.283.0

app.git_source

Type: Map

Конфигурация источника Git для развертываний приложений.

Key Type Description
branch String Извлеченная ветвь Git.
commit String Git фиксирует SHA, чтобы быть извлечены.
source_code_path String Относительный путь к исходному коду приложения в репозитории Git. Если он не указан, используется корневой каталог репозитория.
tag String Извлекаемый тег Git.

ресурсы приложения

Type: Sequence

Список вычислительных ресурсов для приложения.

Каждый элемент в списке — это AppResource:

Key Type Description
app Map Имя и разрешения приложения
description String Описание ресурса приложения.
database Map Параметры, определяющие базу данных подготовки Lakebase для использования. См. app.resources.database.
experiment Map Параметры, определяющие используемый эксперимент MLflow. См. app.resources.experiment.
genie_space Map Параметры, определяющие используемый агент Genie. См. app.resources.genie_space.
job Map Настройки, определяющие ресурс, используемый для задания. См. app.resources.job.
name String Имя ресурса приложения.
postgres Map Параметры, определяющие базу данных автомасштабирования Lakebase для использования. См. раздел app.resources.postgres.
secret Map Параметры, определяющие используемый Azure Databricks секретный ресурс. См. app.resources.secret.
serving_endpoint Map Параметры, определяющие используемый ресурс конечной точки службы модели. См. app.resources.serving_endpoint.
sql_warehouse Map Параметры, определяющие используемый ресурс хранилища SQL. См. app.resources.sql_warehouse.
uc_securable Map Параметры, определяющие защищаемый каталог Unity. См. app.resources.uc_securable.

приложение.ресурсы.база данных

Type: Map

Параметры, определяющие базу данных Lakebase для использования.

Key Type Description
database_name String Имя базы данных.
instance_name String Имя экземпляра базы данных.
permission String Уровень разрешений для базы данных. Допустимые значения: CAN_CONNECT_AND_CREATE.

app.resources.experiment

Type: Map

Параметры, определяющие используемый эксперимент MLflow.

Key Type Description
experiment_id String Идентификатор эксперимента MLflow.
permission String Уровень разрешений для эксперимента. Допустимые значения: CAN_READ, CAN_EDITCAN_MANAGE.

app.resources.genie_space

Type: Map

Параметры, определяющие используемый агент Genie.

Key Type Description
name String Имя агента Genie.
permission String Уровень разрешений для пространства. Допустимые значения: CAN_VIEW, CAN_EDIT, CAN_MANAGECAN_RUN.
space_id String Идентификатор агента Genie, например 550e8400-e29b-41d4-a716-999955440000.

app.resources.job

Type: Map

Настройки, определяющие ресурс, используемый для задания.

Key Type Description
id String Идентификатор задания.
permission String Уровень разрешений для задания. Допустимые значения: CAN_VIEW, CAN_MANAGE_RUN, CAN_MANAGEIS_OWNER.

app.resources.postgres

Type: Map

Параметры, определяющие базу данных автомасштабирования Lakebase для использования.

Key Type Description
branch String Имя ветви, например projects/proj-abc123/branches/branch-xyz789.
database String Например, projects/proj-abc123/branches/branch-xyz789/databases/db-456имя экземпляра базы данных.
permission String Уровень разрешений для базы данных. Допустимые значения: CAN_CONNECT_AND_CREATE.

приложение.ресурсы.секрет

Type: Map

Параметры, определяющие используемый Azure Databricks секретный ресурс.

Key Type Description
key String Ключ секрета для предоставления разрешения.
permission String Уровень разрешений для секрета. Допустимые значения: READ, WRITEMANAGE.
scope String Имя области секрета.

app.resources.точка_обслуживания

Type: Map

Параметры, определяющие используемый ресурс конечной точки службы модели.

Key Type Description
name String Имя конечной точки обслуживания.
permission String Уровень разрешений для конечной точки обслуживания. Допустимые значения: CAN_QUERY, CAN_MANAGECAN_VIEW.

app.resources.sql_склад

Type: Map

Параметры, определяющие хранилище SQL для использования.

Key Type Description
id String Идентификатор хранилища SQL.
permission String Уровень разрешений для хранилища SQL. Допустимые значения: CAN_USE, CAN_MANAGEIS_OWNER.

app.resources.uc_securable

Type: Map

Параметры, определяющие защищаемый каталог Unity. Приложения поддерживают тома, таблицы, функции и подключения в качестве защищаемых ресурсов.

Key Type Description
permission String Уровень разрешений для защищаемого каталога Unity. Допустимые значения зависят от securable_type:
  • VOLUME: READ_VOLUME, WRITE_VOLUME
  • TABLE: SELECT, MODIFY
  • FUNCTION: EXECUTE
  • CONNECTION: USE_CONNECTION
securable_full_name String Полное имя защищаемого каталога Unity в формате catalog.schema.name. Для подключения используйте имя подключения.
securable_type String Тип защищаемого каталога Unity. Допустимые значения: VOLUME, TABLE, FUNCTIONи CONNECTION.

Note

Для томов, таблиц и функций субъект-служба приложения также нуждается USE CATALOG в USE SCHEMA привилегиях родительского каталога и схемы. Azure Databricks автоматически предоставляет эти привилегии при добавлении защищаемого объекта в качестве ресурса приложения.

app.telemetry_export_destinations

Type: Sequence

Список назначений экспорта телеметрии для приложения.

Добавлено в Databricks CLI версии 0.294.0

Каждый элемент в списке — это AppTelemetryExportDestination:

Key Type Description
unity_catalog Map Назначения каталога Unity для экспорта телеметрии OTEL.
Добавлено в Databricks CLI версии 0.294.0

Examples

Руководство по созданию пакета, определяющего приложение, см. в разделе "Управление приложениями Databricks с помощью декларативных пакетов автоматизации".

В следующем примере определяется базовое приложение:

resources:
  apps:
    hello_world_app:
      name: 'hello-world-app'
      source_code_path: . # This assumes the app source code is at the root of the project.
      description: 'A Databricks app'

В следующем примере создается приложение с именем my_app , которое управляет заданием, созданным пакетом. Полный пример см. в разделе bundle-examples GitHub репозиторий.

resources:
  jobs:
    # Define a job in the bundle
    hello_world:
      name: hello_world
      tasks:
        - task_key: task
          spark_python_task:
            python_file: ../src/main.py
          environment_key: default

      environments:
        - environment_key: default
          spec:
            environment_version: '2'

  # Define an app that manages the job in the bundle
  apps:
    job_manager:
      name: 'job_manager_app'
      description: 'An app which manages a job created by this bundle'

      # The location of the source code for the app
      source_code_path: ../src/app

      # The resources in the bundle which this app has access to. This binds the resource in the app with the bundle resource.
      resources:
        - name: 'app-job'
          job:
            id: ${resources.jobs.hello_world.id}
            permission: 'CAN_MANAGE_RUN'

app.yaml Соответствующий определяет конфигурацию для запуска приложения:

command:
  - flask
  - --app
  - app
  - run
  - --debug
env:
  - name: JOB_ID
    valueFrom: 'app-job'

В следующем примере создается приложение, которое имеет доступ к эксперименту MLflow, созданному пакетом:

resources:
  experiments:
    # Define an MLflow experiment in the bundle
    my_experiment:
      name: /Users/${workspace.current_user.userName}/my-app-experiment

  apps:
    my_ml_app:
      name: 'my-ml-app'
      description: 'An app with access to an MLflow experiment'
      source_code_path: ./app

      # Grant the app access to the MLflow experiment
      resources:
        - name: 'app-experiment'
          experiment:
            experiment_id: ${resources.experiments.my_experiment.id}
            permission: 'CAN_MANAGE'

Кроме того, в следующем примере определяется приложение с пользовательской конфигурацией, определенной в конфигурации пакета:

resources:
  apps:
    my_app:
      name: my_app
      description: my_app_description
      source_code_path: ./app
      config:
        command: ['flask', '--app', 'app', 'run']
        env:
          - name: MY_ENV_VAR
            value: test_value
          - name: ANOTHER_VAR
            value: another_value

В следующем примере определяется приложение с ресурсом автомасштабирования Lakebase:

resources:
  apps:
    my_app:
      name: my-app
      source_code_path: .
      resources:
        - name: lakebase-db
          postgres:
            branch: projects/my-app/branches/production
            database: projects/my-app/branches/production/databases/db-xxxx-yyyyyyyy
            permission: CAN_CONNECT_AND_CREATE

catalogs

Type: Map

Ресурс каталога позволяет определять каталоги (каталог Unity) в пакете.

Note

Использование декларативных пакетов автоматизации для определения каталогов поддерживается только в том случае, если вы используете подсистему прямого развертывания.

Добавлено в Databricks CLI версии 0.287.0

catalogs:
  <catalog-name>:
    <catalog-field-name>: <catalog-field-value>
Key Type Description
comment String Текстовое описание каталога, предоставленное пользователем.
Добавлено в Databricks CLI версии 0.287.0
connection_name String Имя подключения к внешнему источнику данных.
Добавлено в Databricks CLI версии 0.287.0
custom_max_retention_hours Integer Индивидуальный максимальный срок хранения — часы — для каталога.
Добавлено в версии Databricks CLI 1.5.0
grants Sequence Гранты, связанные с каталогом. См.грант.
Добавлено в Databricks CLI версии 0.287.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.287.0
managed_encryption_settings Map Управление шифрованием CMK для данных управляемого каталога. См. catalog.managed_encryption_settings.
Добавлено в Databricks CLI версии 0.298.0
name String Обязательное. Имя каталога.
Добавлено в Databricks CLI версии 0.287.0
options Object Карта свойств key-value, присоединенных к защищаемому объекту.
Добавлено в Databricks CLI версии 0.287.0
properties Object Карта свойств key-value, присоединенных к защищаемому объекту.
Добавлено в Databricks CLI версии 0.287.0
provider_name String Имя поставщика OpenSharing. Каталог OpenSharing — это каталог, основанный на общей папке OpenSharing на удаленном сервере общего доступа. См. раздел "Что такое OpenSharing?".
Добавлено в Databricks CLI версии 0.287.0
share_name String Имя общей папки в поставщике общего ресурса.
Добавлено в Databricks CLI версии 0.287.0
storage_root String URL-адрес корневого хранилища для управляемых таблиц в каталоге.
Добавлено в Databricks CLI версии 0.287.0

Example

# databricks.yml
bundle:
  name: catalogs-example
  engine: direct # catalogs require the direct deployment engine

resources:
  catalogs:
    my_catalog:
      name: my_catalog
      comment: 'Catalog created by Declarative Automation Bundles'
      properties:
        purpose: 'Testing'
      grants:
        - principal: someone@example.com
          privileges:
            - USE_CATALOG
            - CREATE_SCHEMA

  schemas:
    my_schema:
      name: my_schema
      catalog_name: ${resources.catalogs.my_catalog.name}
      comment: 'Schema in custom catalog'

catalog.managed_encryption_settings

Type: Map

Параметры шифрования для данных управляемого каталога. Используется для настройки управляемого клиентом ключа (CMK).

Добавлено в Databricks CLI версии 0.298.0

Key Type Description
azure_encryption_settings Map Необязательные параметры Azure — требуется только в том случае, если используется Azure CMK.
Добавлено в Databricks CLI версии 0.298.0
azure_key_vault_key_id String URL-адрес AKV в Azure, значение NULL в противном случае.
Добавлено в Databricks CLI версии 0.298.0
customer_managed_key_id String UUID CMK в AWS и GCP, в противном случае — значение NULL.
Добавлено в Databricks CLI версии 0.298.0

кластер

Type: Map

Ресурс кластера определяет кластер.

clusters:
  <cluster-name>:
    <cluster-field-name>: <cluster-field-value>
Key Type Description
apply_policy_default_values Boolean Если задано значение true, фиксированные и значения по умолчанию из политики будут использоваться для полей, которые опущены. Если задано значение false, будут применены только фиксированные значения из политики.
autoscale Map Параметры, необходимые для автоматического масштабирования кластеров вверх и вниз на основе нагрузки. См. автомасштабирование.
autotermination_minutes Integer Автоматически завершает кластер после его бездействия в течение указанного времени в минутах. Если параметры этого кластера не установлены, он не будет автоматически завершен. Если задано, пороговое значение должно составлять от 10 до 10000 минут. Пользователи также могут задать для этого значения значение 0, чтобы явно отключить автоматическое завершение.
aws_attributes Map Атрибуты, связанные с кластерами, работающими в Amazon Web Services. Если при создании кластера не указано, будет использоваться набор значений по умолчанию. См. aws_attributes.
azure_attributes Map Атрибуты, связанные с кластерами, работающими на Microsoft Azure. Если при создании кластера не указано, будет использоваться набор значений по умолчанию. См. azure_attributes.
cluster_log_conf Map Конфигурация доставки журналов Spark в долгосрочное место хранения. См. cluster_log_conf.
cluster_name String Имя кластера, запрошенное пользователем. Это не обязательно должно быть уникальным. Если он не указан при создании, имя кластера будет пустой строкой.
custom_tags Map Дополнительные теги для ресурсов кластера. Databricks пометит все ресурсы кластера (например, экземпляры AWS и тома EBS) этими тегами, а также дополнительными default_tags.
data_security_mode String Модель управления данными, используемая при доступе к данным из кластера. Допустимые значения включают DATA_SECURITY_MODE_AUTO, DATA_SECURITY_MODE_STANDARD, DATA_SECURITY_MODE_DEDICATEDи NONE. USER_ISOLATION и SINGLE_USER являются устаревшими псевдонимами для DATA_SECURITY_MODE_STANDARD и DATA_SECURITY_MODE_DEDICATEDсоответственно. Режимы LEGACY_* устарели, начиная с Databricks Runtime 15.0.
dependency_mode String (Бета) Управляет конфигурацией зависимостей для кластера. Допустимые значения: DEPENDENCY_MODE_ENVIRONMENTS, DEPENDENCY_MODE_CLUSTER_LIBRARIES и DEPENDENCY_MODE_AUTO.
Добавлено в версии Databricks CLI 1.10.0
docker_image Map Пользовательский образ Docker. См. docker_image.
driver_instance_pool_id String Необязательный идентификатор пула экземпляров, к которому принадлежит драйвер кластера. Кластер пула использует пул экземпляров с идентификатором (экземпляр*pool_id), если пул драйверов не назначен.
driver_node_type_flexibility Map Конфигурация гибкого типа узла для узла драйвера. См. cluster.driver_node_type_flexibility.
Добавлено в Databricks CLI версии 0.285.0
driver_node_type_id String Тип узла драйвера Spark. Это поле необязательно. Если не задано, для типа узла драйвера задано значение node_type_id. Это поле, а также node_type_idне должно быть задано, если virtual_cluster_size задано. Если оба driver_node_type_id, node_type_idи указаны, virtual_cluster_size и driver_node_type_idnode_type_id имеют приоритет.
enable_elastic_disk Boolean Автоматическое масштабирование локального хранилища: когда включено, этот кластер динамически получает дополнительное дисковое пространство, если пользователи Spark испытывают недостаток места на диске. Для правильной работы этой функции требуются определенные разрешения AWS. Дополнительные сведения см. в руководстве пользователя.
enable_local_disk_encryption Boolean Следует ли включить LUKS на локальных дисках виртуальных машин кластера.
gcp_attributes Map Атрибуты, связанные с кластерами, работающими на Google Cloud Platform. Если при создании кластера не указано, будет использоваться набор значений по умолчанию. См. gcp_attributes.
init_scripts Sequence Конфигурация для хранения скриптов инициализации. Можно указать любое количество мест назначения. Скрипты выполняются последовательно в указанном порядке. См. init_scripts.
instance_pool_id String Необязательный идентификатор пула экземпляров, к которому принадлежит кластер.
is_single_node Boolean Это поле можно использовать только в том случае kind = CLASSIC_PREVIEW. Если задано значение true, Databricks автоматически установит связанный custom_tagsс одним узлом и spark_confnum_workers.
Добавлено в Databricks CLI версии 0.237.0
kind String Тип вычислений, описанных в этой спецификации вычислений.
Добавлено в Databricks CLI версии 0.237.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
node_type_id String Используя отдельное значение, это поле кодирует доступные ресурсы для каждого узла Spark в этом кластере. Например, узлы Spark могут быть подготовлены и оптимизированы для операций в памяти или для ресурсоемких рабочих нагрузок. Список доступных типов узлов можно получить с помощью API типов узлов списка.
num_workers Integer Необходимое число рабочих узлов текущего кластера. В кластере есть один драйвер Spark и num_workers исполнитель, всего num_workers + 1 узлов Spark.
permissions Sequence Разрешения кластера. Просмотр разрешений.
policy_id String Идентификатор политики кластера, используемой для создания кластера, если это применимо.
remote_disk_throughput Integer Пропускная способность удаленного диска в байтах в секунду.
Добавлено в Databricks CLI версии 0.257.0
runtime_engine String Определяет движок выполнения кластера, либо STANDARD, либо PHOTON.
single_user_name String Одно имя пользователя, если данные*security_mode SINGLE_USER.
spark_conf Map Объект с набором необязательных, определяемых пользователем пар "ключ-значение" в конфигурации Spark. Пользователи также могут передавать строку дополнительных параметров JVM драйверу и обработчикам через spark.driver.extraJavaOptions и spark.executor.extraJavaOptions соответственно.
spark_env_vars Map Объект, содержащий набор необязательных пар "ключ-значение", определяемых пользователем переменных среды.
spark_version String Версия Кластера Spark, например 3.3.x-scala2.11. Список доступных версий Spark можно получить с помощью API доступных версий Spark.
ssh_public_keys Sequence Содержимое открытого ключа SSH, которое будет добавлено на каждый узел Spark в этом кластере. Соответствующие закрытые ключи можно использовать для входа с именем ubuntu пользователя через порт 2200. Можно указать до 10 ключей.
total_initial_remote_disk_size Integer Общий начальный размер удаленного диска в байтах.
Добавлено в Databricks CLI версии 0.257.0
use_ml_runtime Boolean Это поле можно использовать только в том случае kind = CLASSIC_PREVIEW. effective_spark_version определяется spark_version (выпуск Databricks Runtime), этим полем use_ml_runtime, а также тем, является ли node_type_id узлом GPU или нет.
Добавлено в Databricks CLI версии 0.237.0
worker_node_type_flexibility Map Конфигурация гибкого типа узла для рабочих узлов. См. cluster.worker_node_type_flexibility.
Добавлено в Databricks CLI версии 0.285.0
workload_type Map Атрибуты кластера, отображающие типы рабочих нагрузок кластеров. См. workload_type.

cluster.autoscale (автоматическое масштабирование кластера)

Type: Map

Параметры для автоматического масштабирования кластеров вверх и вниз на основе нагрузки.

Key Type Description
min_workers Integer Минимальное число рабочих ролей, в которых кластер может уменьшиться при недостаточном использовании. Это также начальное число рабочих ролей, которые кластер будет иметь после создания.
max_workers Integer Максимальное число рабочих ролей, к которым кластер может увеличиваться при перегрузке. max_workers должно быть строго больше min_workers.

cluster.aws_attributes

Type: Map

Атрибуты, связанные с кластерами, работающими в Amazon Web Services.

Key Type Description
zone_id String Идентификатор зоны доступности или центра обработки данных, в котором находится кластер. Эта строка будет иметь такой вид us-west-2a.
availability String Тип доступности, используемый для всех последующих узлов после first_on_demand. Допустимые значения: SPOT, ON_DEMANDSPOT_WITH_FALLBACK. Если first_on_demand равен нулю, этот тип доступности используется для всего кластера.
spot_bid_price_percent Integer Максимальная цена для точечных экземпляров AWS в процентах от цены соответствующего типа экземпляра по запросу.
instance_profile_arn String Узлы для этого кластера будут размещаться только в экземплярах AWS с этим профилем экземпляра.
first_on_demand Integer first_on_demand Первые узлы кластера будут размещены по запросу. Это значение должно быть больше 0, чтобы убедиться, что узел драйвера кластера помещается в экземпляр по запросу.
ebs_volume_type String Тип томов EBS, которые будут запущены с помощью этого кластера. Допустимые значения — GENERAL_PURPOSE_SSD или THROUGHPUT_OPTIMIZED_HDD.
ebs_volume_count Integer Количество томов, запущенных для каждого экземпляра.
ebs_volume_size Integer Размер каждого тома EBS, запущенного для каждого экземпляра, (в GiB).
ebs_volume_iops Integer Количество IOPS на объём EBS gp3.
ebs_volume_throughput Integer Пропускная способность на том EBS gp3 в МиБ в секунду.

cluster.azure_attributes

Type: Map

Атрибуты, связанные с кластерами, работающими на Microsoft Azure.

Key Type Description
first_on_demand Integer first_on_demand Первые узлы кластера будут размещены по запросу.
availability String Тип доступности, используемый для всех последующих узлов после first_on_demand. Допустимые значения: SPOT_AZURE, ON_DEMAND_AZURESPOT_WITH_FALLBACK_AZURE. Если first_on_demand равен нулю, этот тип доступности используется для всего кластера.
spot_bid_max_price Number Максимальная цена для Azure точечных экземпляров. Используется -1 для указания минимальной цены.
capacity_reservation_group String Идентификатор ресурсов группы резервирования ёмкости Azure для запуска виртуальных машин в формате /subscriptions/{subscriptionId}/resourceGroups/{resourceGroupName}/providers/Microsoft.Compute/capacityReservationGroups/{capacityReservationGroupName}. При указании виртуальные машины запускаются с использованием предоставленного резерва ёмкости.
Резервирование ёмкости можно задать только тогда, когда рабочее пространство использует внедрённый VNet (VNet, определённый клиентом, не управляемый Databricks). databricks-login-prod Enterprise Application должно иметь следующие четыре разрешения: Microsoft.Compute/capacityReservationGroups/read, Microsoft.Compute/capacityReservationGroups/deploy/action, Microsoft.Compute/capacityReservationGroups/capacityReservations/read, и Microsoft.Compute/capacityReservationGroups/capacityReservations/deploy/action.
Добавлено в версии Databricks CLI 1.5.0
log_analytics_info Map Конфигурация агента Azure Log Analytics. См. log_analytics_info.

cluster.azure_attributes.log_analytics_info

Type: Map

Конфигурация агента Azure Log Analytics.

Key Type Description
log_analytics_workspace_id String Идентификатор рабочей области Azure Log Analytics.
log_analytics_primary_key String Первичный ключ для рабочей области Azure Log Analytics.

cluster.gcp_attributes

Type: Map

Атрибуты, связанные с кластерами, работающими на Google Cloud Platform.

Key Type Description
use_preemptible_executors Boolean Следует ли использовать предварительно подготовленных исполнителей. Предварительно подготовленные исполняемые экземпляры GCE — это экземпляры GCE, которые могут быть восстановлены GCE в любое время.
google_service_account String Учетная запись службы Google, используемая экземплярами виртуальных машин кластера Databricks.
local_ssd_count Integer Количество локальных SSD для подключения к каждому узлу в кластере. Значение по умолчанию — 0.
zone_id String Идентификатор зоны доступности или центра обработки данных, в котором находится кластер.
availability String Определяет, запланированы ли исполнители Spark на преэмпируемых виртуальных машинах, виртуальных машинах по требованию или преэмптивируемых виртуальных машинах с запасным вариантом использования виртуальных машин по требованию, если первая недоступна. Допустимые значения: PREEMPTIBLE_GCP, ON_DEMAND_GCPPREEMPTIBLE_WITH_FALLBACK_GCP.
boot_disk_size Integer Размер загрузочного диска в ГБ. Значения обычно варьируются от 100 до 1000.

cluster.cluster_log_conf

Конфигурация доставки журналов Spark в долгосрочное место хранения.

Key Type Description
dbfs Map Расположение DBFS для доставки логов кластера. См. dbfs.
s3 Map Место хранения S3 для доставки логов кластера. См. s3.
volumes Map Расположение томов для передачи журналов кластера. См. объёмы данных.

cluster.cluster_log_conf.dbfs

Type: Map

Расположение DBFS для доставки логов кластера.

Key Type Description
destination String Путь DBFS для доставки журналов кластера (например, dbfs:/cluster-logs).

cluster.cluster_log_conf.s3

Type: Map

Место хранения S3 для доставки логов кластера.

Key Type Description
destination String URI S3 для доставки журналов кластера (например, s3://my-bucket/cluster-logs).
region String Регион AWS контейнера S3.
endpoint String URL-адрес конечной точки S3 (необязательно).
enable_encryption Boolean Следует ли включить шифрование для журналов кластера.
encryption_type String Тип шифрования. Допустимые значения включают SSE_S3, SSE_KMS.
kms_key String Ключ KMS ARN для шифрования (при использовании SSE_KMS).
canned_acl String Готовая ACL, применяемая к журналам кластера.

cluster.cluster_log_conf.томов

Type: Map

Расположение томов для передачи журналов кластера.

Key Type Description
destination String Путь тома для передачи журналов кластера (например, /Volumes/catalog/schema/volume/cluster_log).

cluster.docker_image

Type: Map

Настраиваемая конфигурация образа Docker.

Key Type Description
url String URL-адрес образа Docker.
basic_auth Map Базовая проверка подлинности для репозитория Docker. См. basic_auth.

cluster.docker_image.basic_auth

Type: Map

Базовая проверка подлинности для репозитория Docker.

Key Type Description
username String Имя пользователя для проверки подлинности реестра Docker.
password String Пароль для проверки подлинности реестра Docker.

cluster.init_scripts

Type: Map

Конфигурация для хранения скриптов инициализации. Необходимо указать по крайней мере один тип расположения.

Key Type Description
dbfs Map Расположение скрипта инициализации в DBFS. См. dbfs.
workspace Map Расположение рабочей области скрипта init. См. рабочую область .
s3 Map Расположение скрипта инициализации S3. См. s3.
abfss Map Расположение скрипта инициализации ABFSS. См. abfss.
gcs Map Расположение скрипта инициализации в GCS. См. gcs.
volumes Map Расположение томов каталога Unity для скрипта инициализации. См. объёмы данных.

cluster.init_scripts.dbfs

Type: Map

Расположение скрипта инициализации в DBFS.

Key Type Description
destination String Путь DBFS инициализационного скрипта.

cluster.init_scripts.workspace

Type: Map

Расположение рабочей области скрипта init.

Key Type Description
destination String Путь к рабочей области скрипта инициализации.

cluster.init_scripts.s3

Type: Map

Расположение скрипта инициализации S3.

Key Type Description
destination String URI-адрес S3 для init script.
region String Регион AWS контейнера S3.
endpoint String URL-адрес конечной точки S3 (необязательно).

cluster.init_scripts.abfss

Type: Map

Расположение скрипта инициализации ABFSS.

Key Type Description
destination String Путь скрипта инициализации ABFSS.

cluster.init_scripts.gcs

Type: Map

Расположение скрипта инициализации в GCS.

Key Type Description
destination String Путь GCS к скрипту инициализации.

cluster.init_scripts.томов

Type: Map

Расположение томов скрипта инициализации.

Key Type Description
destination String Путь к томам каталога Unity скрипта инициализации.

cluster.driver_node_type_flexibility

Type: Map

Конфигурация гибкого типа узла для узла драйвера.

Добавлено в Databricks CLI версии 0.285.0

Key Type Description
alternate_node_type_ids Sequence Список идентификаторов типов узлов, используемых в качестве резервных копий, когда тип основного узла недоступен.
Добавлено в Databricks CLI версии 0.285.0

cluster.worker_node_type_flexibility

Type: Map

Конфигурация гибкого типа узла для рабочих узлов.

Добавлено в Databricks CLI версии 0.285.0

Key Type Description
alternate_node_type_ids Sequence Список идентификаторов типов узлов, используемых в качестве резервных копий, когда тип основного узла недоступен.
Добавлено в Databricks CLI версии 0.285.0

кластер.тип_нагрузки

Type: Map

Атрибуты кластера, показывающие типы рабочих нагрузок кластера.

Key Type Description
clients Map Определяет тип клиентов, которые могут использовать кластер. Просмотр клиентов.

cluster.workload_type.клиенты

Type: Map

Тип клиентов для этой вычислительной рабочей нагрузки.

Key Type Description
jobs Boolean Может ли кластер выполнять задания.
notebooks Boolean Может ли кластер запускать ноутбуки.

Examples

В следующем примере создается выделенный (один пользователь) кластер для текущего пользователя с Databricks Runtime 15.4 LTS и политикой кластера:

resources:
  clusters:
    my_cluster:
      num_workers: 0
      node_type_id: 'i3.xlarge'
      driver_node_type_id: 'i3.xlarge'
      spark_version: '15.4.x-scala2.12'
      spark_conf:
        'spark.executor.memory': '2g'
      autotermination_minutes: 60
      enable_elastic_disk: true
      single_user_name: ${workspace.current_user.userName}
      policy_id: '000128DB309672CA'
      enable_local_disk_encryption: false
      data_security_mode: SINGLE_USER
      runtime_engine: STANDARD

В этом примере создается простой кластер my_cluster, который затем используется для запуска блокнота в my_job.

bundle:
  name: clusters

resources:
  clusters:
    my_cluster:
      num_workers: 2
      node_type_id: 'i3.xlarge'
      autoscale:
        min_workers: 2
        max_workers: 7
      spark_version: '13.3.x-scala2.12'
      spark_conf:
        'spark.executor.memory': '2g'

  jobs:
    my_job:
      tasks:
        - task_key: test_task
          notebook_task:
            notebook_path: './src/my_notebook.py'
          existing_cluster_id: ${resources.clusters.my_cluster.id}

панель мониторинга

Type: Map

Ресурс панели мониторинга позволяет управлять панелями мониторинга AI/BI в пакете. Сведения о панелях мониторинга AI/BI см. в панелях мониторинга.

Если вы развернули пакет, содержащий панель мониторинга из локальной среды, а затем используйте пользовательский интерфейс для изменения этой панели мониторинга, изменения, внесенные с помощью пользовательского интерфейса, не применяются к JSON-файлу панели мониторинга в локальном пакете, если вы явно не обновите его с помощью bundle generate. Вы можете использовать параметр --watch для непрерывного опроса и получения изменений на панели мониторинга. См. создание пакета databricks.

Кроме того, если вы пытаетесь развернуть пакет из локальной среды, содержащей JSON-файл панели мониторинга, отличный от одного из них в удаленной рабочей области, возникнет ошибка. Чтобы выполнить развертывание и перезаписать панель мониторинга в удаленной рабочей области с локальной версией, используйте параметр --force. См. сведения о развертывании пакета databricks.

Добавлено в Databricks CLI версии 0.232.0

Note

При использовании декларативного пакета автоматизации с поддержкой Git панели мониторинга не создавайте повторяющиеся панели мониторинга путем добавления сопоставления синхронизации , чтобы исключить синхронизацию панелей мониторинга в виде файлов:

sync:
  exclude:
    - src/*.lvdash.json
dashboards:
  <dashboard-name>:
    <dashboard-field-name>: <dashboard-field-value>
Key Type Description
dataset_catalog String Значение каталога по умолчанию, используемое всеми наборами данных на панели мониторинга, если оно не указано в запросе. Пример конфигурации, задающей это поле, см. в каталоге панелей мониторинга и параметризации схем.
Добавлено в Databricks CLI версии 0.283.0
dataset_schema String Значение схемы по умолчанию, используемое всеми наборами данных на панели мониторинга, если оно не указано в запросе. Пример конфигурации, задающей это поле, см. в каталоге панелей мониторинга и параметризации схем.
Добавлено в Databricks CLI версии 0.283.0
display_name String Отображаемое имя панели мониторинга.
Добавлено в Databricks CLI версии 0.232.0
embed_credentials Boolean Используются ли учетные данные удостоверения развертывания пакета для выполнения запросов для всех пользователей панелей мониторинга? Если задано значение false, используются учетные данные средства просмотра. Значение по умолчанию — false.
Добавлено в Databricks CLI версии 0.232.0
etag String Etag для панели мониторинга. При обновлении можно при необходимости обеспечить, чтобы панель мониторинга не была изменена с момента последнего чтения.
Добавлено в Интерфейс командной строки Databricks версии 0.234.0
file_path String Локальный путь к ресурсу панели мониторинга, включая имя файла. Экспортированные панели мониторинга всегда имеют расширение .lvdash.jsonфайла.
Добавлено в Databricks CLI версии 0.232.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
parent_path String Путь к рабочей области папки, содержащей панель мониторинга. Включает косую черту и без косой черты.
Добавлено в Databricks CLI версии 0.232.0
path String Путь к рабочей области ресурса панели мониторинга, включая имя ресурса.
Добавлено в Интерфейс командной строки Databricks версии 0.234.0
permissions Sequence Разрешения панели мониторинга. Просмотр разрешений.
Добавлено в Databricks CLI версии 0.232.0
serialized_dashboard Any Содержимое панели мониторинга в сериализованной строковой форме.
Добавлено в Databricks CLI версии 0.232.0
warehouse_id String Идентификатор хранилища, используемый для запуска панели мониторинга.
Добавлено в Databricks CLI версии 0.232.0

Example

Пример ниже демонстрирует и развертывает образец панели мониторинга NYC Taxi Trip Analysis в рабочей области Databricks.

resources:
  dashboards:
    nyc_taxi_trip_analysis:
      display_name: 'NYC Taxi Trip Analysis'
      file_path: ../src/nyc_taxi_trip_analysis.lvdash.json
      warehouse_id: ${var.warehouse_id}

каталог базы данных

Type: Map

Ресурс каталога базы данных позволяет определить каталоги баз данных , соответствующие экземплярам базы данных в пакете. Каталог базы данных — это база данных Lakebase, зарегистрированная в качестве каталога каталога Unity.

Сведения о каталогах баз данных см. в разделе "Создание каталога".

Добавлено в Databricks CLI версии 0.265.0

database_catalogs:
  <database_catalog-name>:
    <database_catalog-field-name>: <database_catalog-field-value>
Key Type Description
create_database_if_not_exists Boolean Следует ли создать базу данных, если она не существует.
Добавлено в Databricks CLI версии 0.265.0
database_instance_name String Имя экземпляра, в который будет встроена база данных.
Добавлено в Databricks CLI версии 0.265.0
database_name String Название базы данных (в экземпляре), связанной с каталогом.
Добавлено в Databricks CLI версии 0.265.0
lifecycle Map Содержит параметры жизненного цикла ресурса, включая поведение ресурса при его развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.265.0
name String Имя каталога в каталоге Unity.
Добавлено в Databricks CLI версии 0.265.0

Example

В следующем примере определяется экземпляр базы данных с соответствующим каталогом базы данных:

resources:
  database_instances:
    my_instance:
      name: my-instance
      capacity: CU_1
  database_catalogs:
    my_catalog:
      database_instance_name: ${resources.database_instances.my_instance.name}
      name: example_catalog
      database_name: my_database
      create_database_if_not_exists: true

database_instance

Type: Map

Ресурс экземпляра базы данных позволяет определять экземпляры базы данных в пакете. Экземпляр базы данных Lakebase управляет хранилищем и вычислительными ресурсами и предоставляет конечные точки, к которым подключаются пользователи.

Note

Новые экземпляры базы данных, созданные ресурсом database_instances , теперь создаются как проекты автомасштабирования Lakebase. Дополнительные сведения см. в разделе "Автомасштабирование по умолчанию ". Для новой работы Lakebase рекомендуется использовать postgres_projects ресурс.

Это важно

При развертывании пакета с экземпляром базы данных экземпляр немедленно запускается и подлежит ценообразованию. См. цены на Lakebase.

Сведения об экземплярах базы данных см. в разделе "Подготовлено" в Lakebase.

Добавлено в Databricks CLI версии 0.265.0

database_instances:
  <database_instance-name>:
    <database_instance-field-name>: <database_instance-field-value>
Key Type Description
capacity String SKU экземпляра. Допустимые значения: CU_1, CU_2, CU_4, CU_8.
Добавлено в Databricks CLI версии 0.265.0
custom_tags Sequence Список пар "ключ-значение", указывающих пользовательские теги, связанные с экземпляром.
Добавлено в Databricks CLI версии 0.273.0
enable_pg_native_login Boolean Включен ли в экземпляре имя входа в собственный пароль PG. По умолчанию — true.
Добавлено в Databricks CLI версии 0.267.0
enable_readable_secondaries Boolean Следует ли включить передачу трафика, доступного только для чтения. По умолчанию — false.
Добавлено в Databricks CLI версии 0.265.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
name String Имя экземпляра. Это уникальный идентификатор для экземпляра.
Добавлено в Databricks CLI версии 0.265.0
node_count Integer Количество узлов в экземпляре, состоящее из 1 первичного и 0 или более секундных файлов. По умолчанию используется 1 основной и 0 секундных файлов.
Добавлено в Databricks CLI версии 0.265.0
parent_instance_ref Map Ссылка на родительский объект. Это доступно только в том случае, если экземпляр является дочерним экземпляром. См. родительский экземпляр.
Добавлено в Databricks CLI версии 0.265.0
permissions Sequence Разрешения экземпляра базы данных. Просмотр разрешений.
Добавлено в Databricks CLI версии 0.265.0
retention_window_in_days Integer Окно хранения для экземпляра. Это период времени в днях, в течение которых хранятся исторические данные. Значение по умолчанию — 7 дней. Допустимые значения — от 2 до 35 дней.
Добавлено в Databricks CLI версии 0.265.0
stopped Boolean Останавливается ли экземпляр.
Добавлено в Databricks CLI версии 0.265.0
usage_policy_id String Требуемая политика бессерверного использования, связанная с экземпляром.
Добавлено в Databricks CLI версии 0.273.0

database_instance.parent_instance_ref

Type: Map

Ссылка на родительский объект. Это доступно только в том случае, если экземпляр является дочерним экземпляром.

Key Type Description
branch_time String Время ветвления экземпляра базы данных ref. Для родительского экземпляра ссылок это точка во времени родительского экземпляра, из которого был создан экземпляр. Для дочернего экземпляра это момент во времени на родительском экземпляре, из которого был создан дочерний экземпляр.
lsn String Указанный пользователем WAL LSN экземпляра эталонной базы данных.
name String Имя экземпляра ref базы данных.

Example

В следующем примере определяется экземпляр базы данных с соответствующим каталогом базы данных:

resources:
  database_instances:
    my_instance:
      name: my-instance
      capacity: CU_1
  database_catalogs:
    my_catalog:
      database_instance_name: ${resources.database_instances.my_instance.name}
      name: example_catalog
      database_name: my_database
      create_database_if_not_exists: true

Пример пакета, демонстрирующего определение экземпляра базы данных и соответствующего каталога баз данных, см. в разделе bundle-examples GitHub репозиторий.

эксперимент

Type: Map

Ресурс эксперимента позволяет определить эксперименты MLflow в составе пакета. Сведения об экспериментах MLflow см. в разделе Упорядочить тренировочные запуски с помощью экспериментов MLflow.

experiments:
  <experiment-name>:
    <experiment-field-name>: <experiment-field-value>
Key Type Description
artifact_location String Расположение, в котором хранятся артефакты для эксперимента. Расположение должно содержать схему URI, например dbfs: или s3:. Для хранения артефактов в томе каталога Unity (рекомендуется, требуется MLflow 2.15.0 или более поздней версии), используйте путь к форме dbfs:/Volumes/<catalog>/<schema>/<volume>/<path>. См. статью "Создание эксперимента" из рабочей области.
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
name String Понятное имя, определяющее эксперимент. Имя эксперимента должно быть абсолютным путем в рабочей области Databricks, например /Workspace/Users/someone@example.com/my_experiment.
permissions Sequence Разрешения эксперимента. Просмотр разрешений.
tags Sequence Дополнительные пары "ключ-значение" метаданных. См. теги. Чтобы задать описание эксперимента, используйте mlflow.note.content тег. Чтобы подключить бессерверную политику бюджета, используйте mlflow.workload_creation_policy_id тег. См. раздел "Использование атрибутов с бессерверными политиками".

Example

В следующем примере определяется эксперимент, который могут просматривать все пользователи:

resources:
  experiments:
    experiment:
      name: /Workspace/Users/someone@example.com/my_experiment
      permissions:
        - level: CAN_READ
          group_name: users
      tags:
        - key: mlflow.note.content
          value: MLflow experiment used to track runs

external_location (каталог Unity)

Type: Map

Ресурс внешнего расположения позволяет определить внешние расположения (каталог Unity) в пакете.

Note

Использование декларативных пакетов автоматизации для определения внешних расположений поддерживается только в том случае, если вы используете подсистему прямого развертывания.

Добавлено в Databricks CLI версии 0.289.0

external_locations:
  <external-location-name>:
    <external-location-field-name>: <external-location-field-value>
Key Type Description
comment String Текстовое описание внешнего расположения, предоставленного пользователем.
Добавлено в Databricks CLI версии 0.289.0
credential_name String Обязательное. Имя учетных данных хранилища, используемых в этом расположении.
Добавлено в Databricks CLI версии 0.289.0
enable_file_events Boolean Следует ли включить события файлов в этом внешнем расположении. По умолчанию — true. Фактическое примененное значение может отличаться из-за значений по умолчанию на стороне сервера. Проверьте effective_enable_file_events эффективное состояние.
Добавлено в Databricks CLI версии 0.289.0
encryption_details Map Параметры шифрования, применяемые к клиентам, подключающимся к облачному хранилищу. См. раздел external_location.encryption_details.
Добавлено в Databricks CLI версии 0.289.0
fallback Boolean Указывает, включен ли резервный режим для этого внешнего расположения. Если включен резервный режим, доступ к расположению возвращается к учетным данным кластера, если учетные данные каталога Unity недостаточно.
Добавлено в Databricks CLI версии 0.289.0
file_event_queue Map Параметры очереди событий файла для этого внешнего расположения. Если enable_file_events это не falseтак, этот ключ должен быть определен и иметь именно одно из документированных свойств. См. раздел external_location.file_event_queue.
Добавлено в Databricks CLI версии 0.289.0
grants Sequence Гранты, связанные с внешним расположением. См.грант.
Добавлено в Databricks CLI версии 0.289.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.289.0
name String Обязательное. Имя внешнего расположения.
Добавлено в Databricks CLI версии 0.289.0
read_only Boolean Указывает, является ли внешнее расположение доступным только для чтения.
Добавлено в Databricks CLI версии 0.289.0
skip_validation Boolean Пропускает проверку учетных данных хранилища, связанных с внешним расположением.
Добавлено в Databricks CLI версии 0.289.0
url String Обязательное. URL путь внешнего местоположения.
Добавлено в Databricks CLI версии 0.289.0

external_location.encryption_details

Type: Map

Параметры шифрования, применяемые к клиентам, подключающимся к облачному хранилищу.

Key Type Description
sse_encryption_details Map Свойства шифрования на стороне сервера для клиентов, взаимодействующих с Amazon S3.

external_location.file_event_queue

Type: Map

Параметры очереди событий файла для этого внешнего расположения.

Key Type Description
managed_aqs Map Управляемые Хранилище очередей Azure параметры.
managed_pubsub Map Управляемые параметры Google Cloud Pub/Sub.
managed_sqs Map Управляемые параметры Amazon SQS.
provided_aqs Map Предоставленные пользователем параметры Хранилище очередей Azure.
provided_pubsub Map Пользовательские параметры Google Cloud Pub/Sub.
provided_sqs Map Параметры Amazon SQS, предоставленные пользователем.

Example

# databricks.yml
bundle:
  name: external-locations-example
  engine: direct # External locations require the direct deployment engine

resources:
  external_locations:
    my_external_location:
      name: my_external_location
      url: 's3://my-bucket/my-path'
      credential_name: my_storage_credential
      comment: 'External location created by Databricks Asset Bundles'
      grants:
        - principal: someone@example.com
          privileges:
            - CREATE_EXTERNAL_TABLE
            - READ_FILES

genie_space

Type: Map

Ресурс агента Genie позволяет определять агенты Genie в пакете. Дополнительные сведения об агентах Genie см. в разделе "Агенты Genie".

Note

Использование декларативных пакетов автоматизации для определения агентов Genie поддерживается только в том случае, если вы используете подсистему прямого развертывания.

Добавлено в Databricks CLI версии 1.3.0

genie_spaces:
  <genie_space-name>:
    <genie_space-field-name>: <genie_space-field-value>
Key Type Description
description String Описание агента Genie.
Добавлено в Databricks CLI версии 1.3.0
file_path String Путь к локальному файлу (например, sales_analytics.geniespace.json), который будет использоваться вместо serialized_space записи.
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 1.3.0
parent_path String Путь к родительской папке, в которой будет зарегистрирован агент Genie.
Добавлено в Databricks CLI версии 1.3.0
permissions Sequence Разрешения агента Genie. Просмотр разрешений.
Добавлено в Databricks CLI версии 1.3.0
serialized_space String Обязательное. Содержимое агента Genie в сериализованной строковой форме. Это поле предоставляет структуру строки JSON, представляющей макет и компоненты пространства. Если file_path задано, оно принимает предопределенность serialized_space.
Добавлено в Databricks CLI версии 1.3.0
title String Необязательный заголовок переопределяется для агента Genie.
Добавлено в Databricks CLI версии 1.3.0
warehouse_id String Обязательное. Идентификатор хранилища SQL для связывания с новым пространством.
Добавлено в Databricks CLI версии 1.3.0

Examples

В следующем примере определяется ресурс агента Genie:

# databricks.yml
bundle:
  name: nyc-taxi-genie
  engine: direct # genie_spaces require the direct deployment engine

resources:
  genie_spaces:
    nyc_taxi_genie:
      title: 'NYC Taxi Trip Analysis'
      description: 'Ask questions about NYC taxi trip data in natural language'
      warehouse_id: <warehouse-id>
      file_path: ./nyc_taxi_genie.geniespace.json
      permissions:
        - level: CAN_RUN
          group_name: users

nyc_taxi_genie.geniespace.json Соответствующий файл содержит сериализованное определение пространства, включая источники данных, инструкции и примеры вопросов. Вместо этого его можно указать в serialized_space YAML.

// nyc_taxi_genie.geniespace.json
{
  "version": 2,
  "config": {
    "sample_questions": [
      {
        "id": "11111111111111111111111111111111",
        "question": ["What is the average fare per trip?"]
      }
    ]
  },
  "data_sources": {
    "tables": [
      {
        "identifier": "samples.nyctaxi.trips",
        "column_configs": [
          { "column_name": "fare_amount" },
          { "column_name": "pickup_zip" },
          { "column_name": "tpep_pickup_datetime" },
          { "column_name": "trip_distance" }
        ]
      }
    ]
  },
  "instructions": {
    "text_instructions": [
      {
        "id": "22222222222222222222222222222222",
        "content": ["Fare amounts are in USD. When asked about revenue, use SUM(fare_amount)."]
      }
    ]
  }
}

instance_pool

Type: Map

Ресурс instance_pool позволяет задавать пулы экземпляров в бандле. Пул инстансов сохраняет набор неактивных, готовых к использованию облачных экземпляров, чтобы кластеры, связанные с пулом, начинались и масштабировались быстрее. Для информации о пулах экземпляров см. раздел «Соединить пулы».

Note

Использование Declarative Automation Bundles для определения пулов инстансов поддерживается только при использовании движка прямого развертывания.

Добавлено в Databricks CLI версии 1.9.0

instance_pools:
  <instance_pool-name>:
    <instance_pool-field-name>: <instance_pool-field-value>
Key Type Description
aws_attributes Map Атрибуты, связанные с пулами экземпляров, работающими на Amazon Web Services. Если при создании пула не указано, используется набор значений по умолчанию. См. instance_pool.aws_attributes.
Добавлено в Databricks CLI версии 1.9.0
azure_attributes Map Атрибуты, связанные с пулами экземпляров, работающими на Azure. Если при создании пула не указано, используется набор значений по умолчанию. См. instance_pool.azure_attributes.
Добавлено в Databricks CLI версии 1.9.0
custom_tags Map Дополнительные теги для ресурсов пула. Databricks объединяет все ресурсы (например, экземпляры AWS и тома EBS) этими тегами в дополнение default_tagsк . Databricks поддерживает максимум 45 пользовательских тегов.
Добавлено в Databricks CLI версии 1.9.0
disk_spec Map Спецификация дисков для подключения ко всем контейнерам Spark. См. instance_pool.disk_spec.
Добавлено в Databricks CLI версии 1.9.0
enable_elastic_disk Boolean Автоматическое масштабирование локального хранилища: при включении экземпляры в этом пуле динамически получают дополнительное место на диске, когда их Spark-работники заканчиваются на диске. В AWS для корректной работы этой функции требуется определённые разрешения AWS.
Добавлено в Databricks CLI версии 1.9.0
gcp_attributes Map Атрибуты, связанные с пулами экземпляров, работающими на Google Cloud Platform. Если при создании пула не указано, используется набор значений по умолчанию. См. instance_pool.gcp_attributes.
Добавлено в Databricks CLI версии 1.9.0
idle_instance_autotermination_minutes Integer Автоматически завершает дополнительные экземпляры в кэше пула после их неактивности в течение этого времени за несколько минут, если требование min_idle_instances уже выполнено. Если экземпляры не настроены, дополнительные экземпляры пула автоматически завершаются после тайм-аута по умолчанию. Если указано, порог должен быть между 0 и 10000 минутами. Установите это значение так 0 , чтобы мгновенно удалять простоящие экземпляры из кэша, если минимальный размер кэша всё ещё удерживается.
Добавлено в Databricks CLI версии 1.9.0
instance_pool_name String Обязательное. Имя пула. Название пула должно быть уникальным, а его длина — от 1 до 100 символов.
Добавлено в Databricks CLI версии 1.9.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 1.9.0
max_capacity Integer Максимальное количество невыплаченных экземпляров для сохранения в пуле, включая как экземпляры, используемые кластерами, так и простаивающими. Кластеры, требующие дополнительной настройки экземпляров, не работают во время запросов на апсайз.
Добавлено в Databricks CLI версии 1.9.0
min_idle_instances Integer Минимальное количество простающих экземпляров для хранения в пуле экземпляров.
Добавлено в Databricks CLI версии 1.9.0
node_type_flexibility Map Гибкая конфигурация типов узлов для пула. См. instance_pool.node_type_flexibility.
Добавлено в Databricks CLI версии 1.9.0
node_type_id String Обязательное. Это поле кодирует через одно значение ресурсы, доступные каждому узлу Spark в кластерах, использующих этот пул. Например, узлы Spark могут быть подготовлены и оптимизированы для операций в памяти или для ресурсоемких рабочих нагрузок. Список доступных типов узлов можно получить с помощью API типов узлов списка.
Добавлено в Databricks CLI версии 1.9.0
permissions Sequence Права на пул экземпляров. Допустимые уровни — CAN_MANAGE и CAN_ATTACH_TO. Просмотр разрешений.
Добавлено в Databricks CLI версии 1.9.0
preloaded_docker_images Sequence Пользовательские образы Docker для предварительной загрузки на экземплярах пула. См. instance_pool.preloaded_docker_images.
Добавлено в Databricks CLI версии 1.9.0
preloaded_spark_versions Sequence Список, содержащий максимум одну предзагруженную версию Spark для пула. Кластеры с базой пула начинались с предустановленной версии Spark быстрее. Список доступных версий Spark можно получить с помощью API доступных версий Spark.
Добавлено в Databricks CLI версии 1.9.0
remote_disk_throughput Integer Настраиваемая пропускная способность в МБ в секунду для удалённого диска. В настоящее время поддерживается только для типов GCP HYPERDISK_BALANCED .
Добавлено в Databricks CLI версии 1.9.0
total_initial_remote_disk_size Integer Общий начальный размер тома — в ГБ — удалённых дисков. В настоящее время поддерживается только для типов GCP HYPERDISK_BALANCED .
Добавлено в Databricks CLI версии 1.9.0

instance_pool.aws_атрибуты

Type: Map

Атрибуты, связанные с пулами экземпляров, работающими на Amazon Web Services. Если при создании пула не указано, используется набор значений по умолчанию.

Добавлено в Databricks CLI версии 1.9.0

Key Type Description
availability String Тип доступности, используемый для спотовых узлов. Допустимые значения — SPOT и ON_DEMAND.
Добавлено в Databricks CLI версии 1.9.0
instance_profile_arn String (Бета) Все экземпляры AWS, входящие в пул экземпляров, имеют этот профиль. Если это отсутствует, экземпляры изначально запускаются с профилем экземпляра рабочего пространства по умолчанию. Если это определено, кластеры, использующие пул, наследуют профиль экземпляра и не должны указывать свой собственный профиль при создании или обновлении кластера. Если пул не указывает профиль экземпляра, кластеры, использующие этот пул, могут указывать любой профиль экземпляра. Профиль экземпляра должен быть ранее добавлен в среду Databricks администратором учетной записи. Эта функция может быть доступна только для определённых клиентов.
Добавлено в Databricks CLI версии 1.9.0
spot_bid_price_percent Integer Вычисляет цену ставки для спотовых инстансов AWS в процентах от цены по запросу соответствующего типа экземпляра. Например, если это поле установлено как 50 и пулу нужен новый r3.xlarge спотовый экземпляр, то цена ставки составляет половину цены инстанса по запросу r3.xlarge . Если не задано, по умолчанию используется значение 100. Это поле не должно быть больше 10000.
Добавлено в Databricks CLI версии 1.9.0
zone_id String Идентификатор зоны доступности/дата-центра, в котором находится пул, например us-west-2a. Предоставленная зона доступности должна находиться в том же регионе, что и развертывание Databricks. Это необязательное поле, и если оно не указано, используется стандартная зона. Список доступных зон, а также значение по умолчанию можно найти с помощью API зон списка.
Добавлено в Databricks CLI версии 1.9.0

instance_pool.azure_attributes

Type: Map

Атрибуты, связанные с пулами экземпляров, работающими на Azure. Если при создании пула не указано, используется набор значений по умолчанию.

Добавлено в Databricks CLI версии 1.9.0

Key Type Description
availability String Тип доступности, используемый для спотовых узлов. Допустимые значения — SPOT_AZURE и ON_DEMAND_AZURE.
Добавлено в Databricks CLI версии 1.9.0
capacity_reservation_group String Идентификатор ресурса группы резервирования емкости Azure для запуска виртуальных машин в этом пуле. При указании виртуальные машины запускаются с использованием предоставленного резерва ёмкости. Исключение этого поля очищает существующую настроенную группу резервирования пропускной способности в бассейне.
Резервирование ёмкости можно задать только тогда, когда рабочее пространство использует внедрённый VNet (VNet, определённый клиентом, не управляемый Databricks). Корпоративному databricks-login-prod приложению должны быть предоставлены следующие четыре разрешения:
  • Microsoft.Compute/capacityReservationGroups/read
  • Microsoft.Compute/capacityReservationGroups/deploy/action
  • Microsoft.Compute/capacityReservationGroups/capacityReservations/read
  • Microsoft.Compute/capacityReservationGroups/capacityReservations/deploy/action

Используйте формат /subscriptions/{subscriptionId}/resourceGroups/{resourceGroupName}/providers/Microsoft.Compute/capacityReservationGroups/{capacityReservationGroupName}.
Добавлено в Databricks CLI версии 1.9.0
spot_bid_max_price Number Максимальная цена для спотовых экземпляров Azure — в долларах США (USD). Например, значение 2 устанавливает максимальную цену $2.00 USD в час. Установите максимальную цену -1 , чтобы виртуальная машина не была выселена из-за цены. Цена для виртуальной машины — это текущая цена для спота или цена стандартной виртуальной машины, в зависимости от того, что меньше, при условии, что есть доступная ёмкость и квота.
Добавлено в Databricks CLI версии 1.9.0

instance_pool.disk_spec

Type: Map

Спецификация дисков для подключения ко всем контейнерам Spark.

Добавлено в Databricks CLI версии 1.9.0

Key Type Description
disk_count Integer Количество запущенных дисков для каждого экземпляра. Эта функция включена только для поддерживаемых типов узлов, и вы можете выбрать до предела дисков, поддерживаемых типом узла. Для типов узлов без диска ОС должен быть указан как минимум один диск, иначе создание кластера неудачно.
Если диски подключены, Databricks настраивает Spark так, чтобы использовать диски только для нулевого хранилища, поскольку гетерогенные скретч-устройства могут привести к неэффективному использованию диска. Если диски не подключены, Databricks настраивает Spark на использование дисков хранилища экземпляров. Если указаны диски, то конфигурация spark.local.dir Spark переопределяется.
Диски монтируются в /ebs0, /ebs1, и так далее для AWS, и в /remote_volume0, /remote_volume1, и так далее для Azure.
Добавлено в Databricks CLI версии 1.9.0
disk_iops Integer Количество IOPS для обеспечения для каждого подключённого диска.
Добавлено в Databricks CLI версии 1.9.0
disk_size Integer Размер каждого диска, в ГиБ, запускался для каждого экземпляра. Значения должны попадать в поддерживаемый диапазон для определённого типа экземпляра. Для AWS универсальный SSD — 100–4096 ГиБ, а HDD с оптимизированной пропускной способностью — 500–4096 ГиБ. Для Azure премиум-LRS (SSD) — 1–1023 ГиБ, а стандартный LRS (HDD) — 1–1023 ГиБ.
Добавлено в Databricks CLI версии 1.9.0
disk_throughput Integer Пропускная способность диска для каждого подключённого диска — в МБ в секунду.
Добавлено в Databricks CLI версии 1.9.0
disk_type Map Тип дисков для запуска с экземплярами пула. Установить либо azure_disk_volume_type (допустимые значения — PREMIUM_LRS и STANDARD_LRS) или ebs_volume_type (допустимые значения — GENERAL_PURPOSE_SSD и THROUGHPUT_OPTIMIZED_HDD).
Добавлено в Databricks CLI версии 1.9.0

instance_pool.gcp_атрибуты

Type: Map

Атрибуты, связанные с пулами экземпляров, работающими на Google Cloud Platform. Если при создании пула не указано, используется набор значений по умолчанию.

Добавлено в Databricks CLI версии 1.9.0

Key Type Description
gcp_availability String Определяет, содержит ли пул экземпляров прерываемые виртуальные машины, виртуальные машины по запросу или преемппируемые виртуальные машины с резервным вариантом использования виртуальных машин по требованию, если первая недоступна. Допустимые значения: PREEMPTIBLE_GCP, ON_DEMAND_GCP и PREEMPTIBLE_WITH_FALLBACK_GCP.
Добавлено в Databricks CLI версии 1.9.0
local_ssd_count Integer Если это предусмотрено, каждый узел в пуле экземпляров имеет это количество локальных SSD. Каждый локальный SSD имеет размер 375 ГБ. Для поддерживаемого количества локальных SSD для каждого типа экземпляра см. документацию GCP.
Добавлено в Databricks CLI версии 1.9.0
zone_id String Идентификатор зоны доступности/дата-центра, в котором находится пул, например us-west1-a. Предоставленная зона доступности должна находиться в том же регионе, что и рабочее пространство Databricks. Это необязательное поле, и если оно не указано, используется стандартная зона. Установите это поле на HA высокодоступность, что распределяет узлы по зонам доступности для региона развертывания Databricks или в одну из доступных зон для типа и региона машины. Если пусто, Databricks выбирает зону доступности.
Добавлено в Databricks CLI версии 1.9.0

instance_pool.node_type_flexibility

Type: Map

Гибкая конфигурация типов узлов для пула.

Добавлено в Databricks CLI версии 1.9.0

Key Type Description
alternate_node_type_ids Sequence Список идентификаторов типов узлов, используемых в качестве резервных копий, когда тип основного узла недоступен.
Добавлено в Databricks CLI версии 1.9.0

instance_pool.preloaded_docker_images

Type: Sequence

Пользовательские образы Docker для предварительной загрузки на экземплярах пула.

Добавлено в Databricks CLI версии 1.9.0

Key Type Description
basic_auth Map Базовая аутентификация для репозитория Docker. Установить username и password.
Добавлено в Databricks CLI версии 1.9.0
url String URL изображения Docker.
Добавлено в Databricks CLI версии 1.9.0

Example

Следующий пример определяет пул экземпляров и кластер, использующий его:

resources:
  instance_pools:
    my_pool:
      instance_pool_name: my-pool
      node_type_id: i3.xlarge
      min_idle_instances: 2
      max_capacity: 10
      idle_instance_autotermination_minutes: 15
      preloaded_spark_versions:
        - '15.4.x-scala2.12'

  clusters:
    my_cluster:
      cluster_name: my-cluster
      instance_pool_id: ${resources.instance_pools.my_pool.id}
      spark_version: '15.4.x-scala2.12'
      num_workers: 2

работа

Type: Map

Задания поддерживаются в Python для декларативных пакетов автоматизации. См. databricks.bundles.jobs.

Ресурс задания позволяет вам определить работы и их соответствующие задачи в вашем пакете.

Сведения о заданиях см. в разделе "Задания Lakeflow". Учебник, использующий шаблон декларативных пакетов автоматизации для создания задания, см. в статье "Разработка задания с помощью декларативных пакетов автоматизации".

jobs:
  <job-name>:
    <job-field-name>: <job-field-value>
Key Type Description
budget_policy_id String Идентификатор указанной пользователем политики бюджета, используемой для этого задания. Если не указано, при создании или изменении задания может применяться политика бюджета по умолчанию. Смотрите effective_budget_policy_id для ознакомления с политикой бюджета, используемой данной рабочей нагрузкой.
Добавлено в Databricks CLI версии 0.231.0
continuous Map Необязательное непрерывное свойство для этого задания. Непрерывное свойство гарантирует, что всегда выполняется одно выполнение. Можно использовать только один из schedule и continuous. См. непрерывный просмотр.
deployment Map Сведения о развертывании заданий, управляемых внешними источниками. См. развертывание.
description String Необязательное описание задания. Максимальная длина — 27700 символов в кодировке UTF-8.
email_notifications Map Необязательный набор адресов электронной почты, который уведомляется при запуске или завершении задания, а также при его удалении. См. email_notifications.
environments Sequence Список спецификаций среды выполнения задач, на которые можно ссылаться бессерверными задачами этого задания. Среда должна присутствовать для бессерверных задач. Для бессерверных задач записной книжки среда доступна на панели среды записной книжки. Для других бессерверных задач необходимо указать среду задач с помощью environment_key в параметрах задач. См. среды.
format String Deprecated. Формат задания.
git_source Map Необязательная спецификация для удаленного репозитория Git, содержащего исходный код, используемый задачами. См. job.git_source.
Важно: Поле git_source и поле задачи source, установленное в GIT, не рекомендуется использовать для пакетов, так как локальные относительные пути могут не указывать на одно и то же содержимое в репозитории Git, а пакеты ожидают, что развернутое задание имеет такое же содержимое, как и локальная копия, из которой оно было развернуто.
Вместо этого клонируйте репозиторий локально и настройте проект сборки в этом репозитории, чтобы источник задач был частью рабочей области.
health Map Необязательный набор правил здоровья, которые можно определить для этой работы. См. здоровье.
job_clusters Sequence Список спецификаций кластера заданий, которые могут совместно использоваться и повторно использоваться в задачах этой работы. См. job_clusters.
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
max_concurrent_runs Integer Максимально допустимое количество (необязательно) параллельных процессов выполнения задания. Задайте это значение, если требуется одновременное выполнение нескольких процессов выполнения одного и того же задания.
name String Опциональное имя для задания. Максимальная длина — 4096 байт в кодировке UTF-8.
notification_settings Map Необязательные параметры уведомлений, используемые при отправке уведомлений в каждую из email_notifications и webhook_notifications для этой задачи. См. notification_settings.
parameters Sequence Определения параметров уровня задания. См. сведения о job.parameters.
performance_target String Определяет, насколько производительным или экономичным должно быть выполнение в среде без серверов.
Добавлено в Databricks CLI версии 0.241.0
permissions Sequence Разрешения работы. Просмотр разрешений.
queue Map Параметры очереди задания. См . очередь.
run_as Map Пользователь или принципал сервиса, под которым выполняется задание. Это поле указывает явную конфигурацию задачи run_as . Если задание не указано, задание выполняется от имени пользователя, создавшего задание. Необходимо указать либо user_name, либо service_principal_name. В противном случае возникает ошибка. См. run_as.
schedule Map Расписание (необязательно) с периодическим выполнением этого задания. Поведение по умолчанию заключается в том, что задание выполняется только при активации, щелкнув "Запустить сейчас" в пользовательском интерфейсе заданий или отправив запрос API в runNow. См. расписание.
tags Map Карта тегов, связанных с заданием. Они перенаправляются в кластер в виде тегов кластера для кластеров заданий и имеют те же ограничения, что и теги кластера. В задание можно добавить не более 25 тегов.
tasks Sequence Список спецификаций задач, выполняемых этим заданием. См. раздел "Добавление задач в задания" в декларативных пакетах автоматизации.
Добавлено в Databricks CLI версии 0.237.0
timeout_seconds Integer Необязательное время ожидания, применяемое к каждому запуску этой задачи. Значение 0 означает, что время ожидания не истекло.
trigger Map Конфигурация для активации запуска при выполнении определенных условий. См. триггер.
usage_policy_id String Идентификатор бессерверной политики использования, используемой для этого задания.
Добавлено в Databricks CLI версии 0.273.0
webhook_notifications Map Коллекция идентификаторов системных уведомлений для оповещения о начале или завершении выполнения каждого запуска этого задания. См. webhook_notifications.

задача.непрерывный

Type: Map

Конфигурация для непрерывного выполнения задания.

Key Type Description
pause_status String Независимо от того, приостановлено непрерывное задание или нет. Допустимые значения: PAUSED, UNPAUSED.
task_retry_mode String Укажите, как непрерывное задание применяет повторные попытки уровня задач. Допустимые значения — NEVER и ON_FAILURE. По умолчанию — NEVER.

задача.развертывание

Type: Map

Сведения о развертывании заданий, управляемых внешними источниками.

Key Type Description
kind String Тип развертывания. Например: BUNDLE.
metadata_file_path String Путь к файлу метаданных для развертывания.

задача.уведомления_по_электронной_почте

Type: Map

Параметры уведомлений по электронной почте для выполнения задания.

Key Type Description
on_start Sequence Список адресов электронной почты, которые нужно уведомить при запуске.
on_success Sequence Список адресов электронной почты для уведомления в случае успешного выполнения.
on_failure Sequence Список адресов электронной почты для уведомления о сбое выполнения.
on_duration_warning_threshold_exceeded Sequence Список адресов электронной почты для уведомления о превышении длительности выполнения порогового значения предупреждения.
no_alert_for_skipped_runs Boolean Следует ли игнорировать отправку оповещений для пропущенных запусков.
on_streaming_backlog_exceeded Sequence Список адресов электронной почты для уведомления о превышении пороговых значений невыполненной потоковой передачи для любого потока. Пороговые значения невыполненной работы потоковой передачи можно задать в health поле с помощью следующих метрик: STREAMING_BACKLOG_BYTES, , STREAMING_BACKLOG_RECORDSSTREAMING_BACKLOG_SECONDSили STREAMING_BACKLOG_FILES. Оповещение основано на 10-минутном среднем этих метрик. Если проблема сохраняется, уведомления будут обидены каждые 30 минут.

Not needed as the translation remains the same: job.environments

Type: Sequence

Список спецификаций среды выполнения задач, на которые можно ссылаться бессерверными задачами задания.

Каждый элемент в списке JobEnvironment— это :

Key Type Description
environment_key String Ключ среды. Он должен быть уникальным в задании.
spec Map Сущность, представляющая бессерверную среду. См. job.environments.spec.

job.environments.spec

Type: Map

Сущность, представляющая бессерверную среду.

Key Type Description
client String Deprecated. Версия клиента.
dependencies Sequence Список зависимостей pip, поддерживаемых версией pip в этой среде.
environment_version String Обязательное. Версия среды, используемая средой. Каждая версия поставляется с определенной версией Python и набором пакетов Python. Версия — это строка, состоящая из целого числа.

job.git_source

Type: Map

Конфигурация репозитория Git для исходного кода задания.

Key Type Description
git_branch String Имя ветви, которую необходимо извлечь и использовать в этом задании. Это поле нельзя указать в сочетании с git_tag или git_commit.
git_commit String Фиксация для проверки и использования этим заданием. Это поле нельзя указать в сочетании с git_branch или git_tag.
git_provider String Уникальный идентификатор службы, используемой для размещения репозитория Git. Значение регистронезависимо. Допустимые значения: gitHub, bitbucketCloud, gitLabazureDevOpsServices, gitHubEnterprise, bitbucketServer. gitLabEnterpriseEdition
git_snapshot Map Состояние удаленного репозитория в режиме только для чтения на момент запуска задания. Это поле используется только в процессах выполнения заданий. См. git_snapshot.
git_tag String Имя тега, который будет извлечен и использован этим заданием. Это поле нельзя указать в сочетании с git_branch или git_commit.
git_url String URL-адрес репозитория, клонированного этим заданием.
sparse_checkout Map Разреженная конфигурация извлечения для репозитория Git. См. раздел job.git_source.sparse_checkout.
Добавлено в Интерфейс командной строки Databricks версии 0.290.0

job.git_source.sparse_checkout

Type: Map

Разреженная конфигурация извлечения для репозитория Git.

Добавлено в Интерфейс командной строки Databricks версии 0.290.0

Key Type Description
patterns Sequence Список шаблонов для разреженного извлечения.
Добавлено в Интерфейс командной строки Databricks версии 0.290.0

job.git_source.git_snapshot

Type: Map

Моментальный снимок сведений о коммите, доступный только для чтения.

Key Type Description
used_commit String Фиксация, используемая для выполнения выполнения. Если git_branch был указан, это указывает на HEAD ветви во время выполнения; если git_tag был указан, это указывает на коммит, на который ссылается тег.

Работа.здоровье

Type: Map

Конфигурация мониторинга работоспособности для задания.

Key Type Description
rules Sequence Список правил состояния заданий. Каждое правило содержит metric и (оператор) и opvalue. См. job.health.rules.

job.health.rules

Type: Sequence

Список правил состояния заданий.

Каждый элемент в списке JobHealthRule— это :

Key Type Description
metric String Указывает метрику работоспособности, которая оценивается для определенного правила контроля работоспособности.
  • RUN_DURATION_SECONDS: ожидаемое общее время выполнения в секундах.
  • STREAMING_BACKLOG_BYTES: оценка максимального количества байтов данных, ожидающих использования во всех потоках. Эта метрика доступна в общедоступной предварительной версии.
  • STREAMING_BACKLOG_RECORDS: оценка максимальной задержки смещения во всех потоках. Эта метрика доступна в общедоступной предварительной версии.
  • STREAMING_BACKLOG_SECONDS: оценка максимальной задержки потребителя во всех потоках. Эта метрика доступна в общедоступной предварительной версии.
  • STREAMING_BACKLOG_FILES: оценка максимального количества необработанных файлов во всех потоках. Эта метрика доступна в общедоступной предварительной версии.
op String Указывает оператор, используемый для сравнения значения метрик работоспособности с указанным пороговым значением.
value Integer Указывает пороговое значение, которое метрика работоспособности должна соответствовать правилу работоспособности.

задача.job_clusters

Type: Sequence

Список спецификаций кластера заданий, которые могут совместно использоваться и повторно использоваться в задачах этой работы. Библиотеки нельзя объявлять в общем кластере заданий. Необходимо объявить зависимые библиотеки в параметрах задач.

Каждый элемент в списке JobCluster— это :

Key Type Description
job_cluster_key String Уникальное имя кластера заданий. Это поле является обязательным и должно быть уникальным в задании. JobTaskSettings Может ссылаться на это поле, чтобы определить, какой кластер будет запущен для выполнения задачи.
new_cluster Map Если new_cluster, описание кластера, созданного для каждой задачи. См. кластер.

работа.параметры_уведомлений

Type: Map

Настройки уведомлений, применяемые ко всем уведомлениям по работе.

Key Type Description
no_alert_for_skipped_runs Boolean Следует ли игнорировать отправку оповещений для пропущенных запусков.
no_alert_for_canceled_runs Boolean Следует ли пропускать отправку оповещений для отмененных запусков.

job.parameters

Type: Sequence

Список определений параметров задания.

Каждый элемент в списке JobParameter— это :

Key Type Description
default String Обязательное. Значение параметра по умолчанию, например "users".
name String Обязательное. Имя определенного параметра, например "table". Допустимые значения содержат только буквенно-цифровые символы, _а -также ..

очередь.задач

Type: Map

Параметры очереди для задания.

Key Type Description
enabled Boolean Следует ли включить очередь для задания.

график_задач

Type: Map

Конфигурация для планирования периодического выполнения задачи.

Key Type Description
quartz_cron_expression String Выражение Cron с использованием синтаксиса Quartz, которое определяет, когда выполняется задание. Например, 0 0 9 * * ? каждый день выполняет задачу в 9:00 утра по UTC.
timezone_id String Часовой пояс расписания. Например, America/Los_Angeles или UTC.
pause_status String Независимо от того, приостановлено ли расписание. Допустимые значения: PAUSED, UNPAUSED.

задание.триггер

Type: Map

Настройка триггера для выполнения задания на основе событий.

Key Type Description
file_arrival Map Триггер на основе прибытия файла. См. file_arrival.
table Map Триггер на основе таблицы. См. таблицу.
table_update Map Триггер, основанный на обновлениях таблицы. См. table_update.
periodic Map Периодический триггер. Периодический
pause_status String Независимо от того, поставлен ли спусковой крючок на паузу или нет. Допустимые значения: PAUSED, UNPAUSED.

задача.триггер.приход_файла

Type: Map

Настройка триггера на основе прибытия файла.

Key Type Description
url String Путь к директории для отслеживания новых файлов.
min_time_between_triggers_seconds Integer Минимальное время в секундах между событиями триггера.
wait_after_last_change_seconds Integer Время ожидания в секундах после последнего изменения файла перед активацией.

задача.триггер.таблица

Type: Map

Настройка триггера на основе таблицы.

Key Type Description
table_names Sequence Список имен таблиц для отслеживания.
condition String Условие SQL, которое должно быть выполнено для активации задания.

задача.триггер.обновление_таблицы

Type: Map

Настройка триггера на основе обновлений таблиц.

Key Type Description
table_names Sequence Список имен таблиц для отслеживания обновлений.
condition String Условие SQL, которое должно быть выполнено для активации задания.
wait_after_last_change_seconds Integer Время ожидания в секундах после последнего обновления таблицы перед активацией.

задача.триггер.повторный

Type: Map

Конфигурация периодического триггера.

Key Type Description
interval Integer Значение интервала для периодического триггера.
unit String Единица времени интервала. Допустимые значения: HOURS, , DAYSWEEKS.

задача.webhook_notifications

Type: Map

Параметры уведомлений для вебхуков при запуске заданий.

Key Type Description
on_start Sequence Список идентификаторов уведомлений веб-перехватчика, которые нужно уведомить при запуске.
on_success Sequence Список идентификаторов уведомлений веб-перехватчика для уведомления о успешном завершении выполнения.
on_failure Sequence Список идентификаторов уведомлений вебхуков для уведомления о сбое выполнения.
on_duration_warning_threshold_exceeded Sequence Список идентификаторов уведомлений веб-перехватчика для уведомления о превышении порогового значения времени выполнения.
on_streaming_backlog_exceeded Sequence Список идентификаторов системных уведомлений для вызова при превышении пороговых значений невыполненной потоковой передачи для любого потока. Пороговые значения невыполненной работы потоковой передачи можно задать в health поле с помощью следующих метрик: STREAMING_BACKLOG_BYTES, , STREAMING_BACKLOG_RECORDSSTREAMING_BACKLOG_SECONDSили STREAMING_BACKLOG_FILES. Оповещение основано на 10-минутном среднем этих метрик. Если проблема сохраняется, уведомления будут обидены каждые 30 минут. Можно указать не более 3 назначений.

Examples

В следующем примере описывается задание с ключом ресурса hello-job с одной задачей в блокноте.

resources:
  jobs:
    hello-job:
      name: hello-job
      tasks:
        - task_key: hello-task
          notebook_task:
            notebook_path: ./hello.py

В следующем примере определяется задание с записной книжкой SQL:

resources:
  jobs:
    job_with_sql_notebook:
      name: 'Job to demonstrate using a SQL notebook with a SQL warehouse'
      tasks:
        - task_key: notebook
          notebook_task:
            notebook_path: ./select.sql
            warehouse_id: 799f096837fzzzz4

Дополнительные примеры конфигурации заданий см. в разделе "Конфигурация задания".

Сведения об определении задач задания и переопределении параметров задания см. в следующем разделе:

job_run

Type: Map

Ресурс job_run запускает выполнение существующей задачи в рамках развертывания пакетов. В отличие от работы, которая определяет работу, запуск заданий ссылается на существующую работу по ID.

Note

Использование Declarative Automation Bundles для определения запусков заданий поддерживается только при использовании движка прямого развертывания.

Добавлено в Интерфейс командной строки Databricks версии 1.7.0

job_runs:
  <job_run-name>:
    <job_run-field-name>: <job_run-field-value>
Key Type Description
job_id Integer Обязательное. Идентификатор выполняемого задания.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
job_parameters Map Параметры на уровне задания, используемые при запуске, например param: overriding_val.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
only Sequence Список ключей задач, выполняемых внутри задания. Если это поле не предусмотрено, все задачи в работе выполняются.
Префикс клавиши + задачи также для выполнения её восходящих задач или суффикс + для выполнения нижних задач. Например, +my_task работает my_task и всё, что выше по течению my_task+ , и my_task всё, что ниже по течению, и +my_task+ работает и то, и другое. Ключ задачи без + этого запускает только эту задачу.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
performance_target String Режим производительности для бессерверного задания. Целевой показатель производительности определяет уровень вычислительной производительности или экономичность для запуска и переопределяет целевой показатель, определённый на уровне задачи. Допустимые значения — STANDARD, что обеспечивает экономичное выполнение безсерверных рабочих нагрузок, и PERFORMANCE_OPTIMIZED, которое отдаёт приоритет быстрому запуску и выполнению за счёт быстрого масштабирования и оптимизации производительности кластера.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
pipeline_params Map Настройки обновления для задачи конвейера во время запуска. См. job_run.pipeline_params.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
queue Map Настройки очереди во время забега. Установите enabled на true включение очереди для запуска.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0

job_run.pipeline_params

Type: Map

Настройки обновления для задачи конвейера во время запуска.

Добавлено в Интерфейс командной строки Databricks версии 1.7.0

Key Type Description
full_refresh Boolean Стоит ли запускать полное обновление декларативного конвейера Spark.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
full_refresh_selection Sequence (Бета) Список таблиц для обновления с полным обновлением.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
refresh_flow_selection Sequence (Бета) Имена потоков для выборочного обновления. Они объединяются с другими опциями refresh_selection селективного обновления, и full_refresh_selection, чтобы определить окончательный набор потоков для обновления.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
refresh_selection Sequence (Бета) Список таблиц для обновления без полного обновления.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
reset_checkpoint_selection Sequence (Бета) Список потоковых потоков, для которых можно сбросить контрольные точки без очистки данных.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0

Example

Следующий пример запускает запуск существующей задачи, переопределяя один параметр и ограничивая запуск одной задачей и её предыдущими задачами:

resources:
  job_runs:
    my_job_run:
      job_id: 123456789
      job_parameters:
        catalog: main
      only:
        - +my_task

модель (устаревшая версия)

Type: Map

Ресурс модели позволяет определять устаревшие модели в пакетах. Databricks рекомендует вместо этого использовать зарегистрированные модели в каталоге Unity.

конечная_точка_обслуживания_моделей

Type: Map

Ресурс model_serving_endpoint позволяет определить модели обслуживания конечных точек. См. раздел Управление конечными точками обслуживания моделей.

model_serving_endpoints:
  <model_serving_endpoint-name>:
    <model_serving_endpoint-field-name>: <model_serving_endpoint-field-value>
Key Type Description
ai_gateway Map Конфигурация шлюза ИИ для конечной точки обслуживания. ПРИМЕЧАНИЕ. В настоящее время поддерживаются только внешние модели и подготовленные конечные точки пропускной способности. См. ai_gateway.
Добавлено в Databricks CLI версии 0.230.0
budget_policy_id String Идентификатор политики бюджета, используемой для этой конечной точки.
Добавлено в Интерфейс командной строки Databricks версии 0.244.0
config Map Базовая конфигурация конечной точки обслуживания. См. конфигурацию.
description String Описание конечной точки обслуживания.
Добавлено в Databricks CLI версии 0.260.0
email_notifications Map Конфигурация уведомлений по электронной почте для конечной точки обслуживания. См. email_notifications.
Добавлено в Databricks CLI версии 0.264.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
name String Имя конечной точки обслуживания. Это поле является обязательным и должно быть уникальным в рабочей области Databricks. Имя конечной точки может состоять из буквенно-цифровых символов, дефисов и символов подчеркивания.
permissions Sequence Разрешения конечной точки обслуживания модели. Просмотр разрешений.
rate_limits Sequence Deprecated. Ограничения скорости, применяемые к конечной точке обслуживания. Используйте шлюз искусственного интеллекта для управления ограничениями скорости.
route_optimized Boolean Включите оптимизацию маршрута для конечной точки обслуживания.
tags Sequence Теги, которые прикрепляются к точке доступа обслуживания и автоматически распространяются в журналы выставления счетов.
telemetry_config Map Конфигурация сохраняющейся телеметрии конечных точек (логи, трассы и метрики) в таблицы Unity Catalog. См. telemetry_config.
Добавлено в Databricks CLI версии 1.6.0

model_serving_endpoint.telemetry_config

Type: Map

Конфигурация сохраняющейся телеметрии конечных точек (логи, трассы и метрики) в таблицы Unity Catalog.

Добавлено в Databricks CLI версии 1.6.0

Key Type Description
inference_table_config Map Конфигурация для логирования полезной нагрузки в таблице выводов, включая отбор проб.
Добавлено в Databricks CLI версии 1.6.0
table_names Map Таблицы Unity Catalog, в которые экспортируется телеметрия конечных точек (логи, трассы и метрики). Предоставьте это для создания нового телеметрического профиля для конечной точки из указанных таблиц.
Добавлено в версии Databricks CLI 1.10.0
telemetry_profile_id String ID существующего телеметрического профиля для применения к этой конечной точке. Введите это для повторного использования уже созданного телеметрического профиля, вместо указания table_names.
Добавлено в версии Databricks CLI 1.10.0

model_serving_endpoint.email_notifications

Type: Map

Конфигурация уведомлений по электронной почте для конечной точки обслуживания.

Key Type Description
on_update_failure Sequence Список адресов электронной почты, которые необходимо уведомить, когда конечная точка не сможет обновить конфигурацию или состояние.
on_update_success Sequence Список адресов электронной почты, которые необходимо уведомить, когда конечная точка успешно обновляет конфигурацию или состояние.

Конечная точка обслуживания модели.ai_gateway

Type: Map

Конфигурация шлюза ИИ для конечной точки обслуживания.

Key Type Description
fallback_config Map Конфигурация резервного трафика, которая автоматически резервирует другие обслуживаемые сущности, если запрос к обслуживаемой сущности завершается сбоем с определенными кодами ошибок, чтобы повысить доступность. См. fallback_config.
guardrails Map Конфигурация Guardrail. См. ограничения.
inference_table_config Map Настройка ведения журнала вывода в таблицы каталога Unity. См. inference_table_config.
rate_limits Sequence Конфигурации ограничения скорости.
usage_tracking_config Map Конфигурация для отслеживания использования. См. usage_tracking_config.

model_serving_endpoint.ai_gateway.fallback_config

Type: Map

Конфигурация резервного трафика, которая автоматически резервируется на другие обслуживаемые сущности, если запрос завершается сбоем с определенными кодами ошибок.

Key Type Description
enabled Boolean Включена ли резервная обратная связь для этой конечной точки.

модель_обслуживания_точки.ai_gateway.ограждения

Type: Map

Конфигурация ограничений шлюза ИИ.

Key Type Description
input Map Конфигурация ограничений входных данных с такими полями, как safety, pii.
output Map Конфигурация ограничителей вывода с такими полями, как safety, pii.
invalid_keywords Sequence Список ключевых слов для блокировки.

конфигурация_таблицы_инференции_шлюза_ИИ_для_конечной_точки_подачи_модели

Type: Map

Настройка ведения журнала вывода в таблицы каталога Unity.

Key Type Description
catalog_name String Имя каталога в каталоге Unity.
schema_name String Имя схемы в каталоге Unity.
table_name_prefix String Префикс для имен таблиц вывода.
enabled Boolean Включена ли ведение журнала таблиц вывода заключений.

model_serving_endpoint.ai_gateway.контроль_использования_конфигурация

Type: Map

Конфигурация шлюза ИИ для отслеживания использования.

Key Type Description
enabled Boolean Включена ли функция отслеживания использования.

конфигурация_точки_обслуживания_модели.config

Type: Map

Базовая конфигурация конечной точки обслуживания.

Key Type Description
served_entities Sequence Список обслуживаемых сущностей для конечной точки. Каждая обслуживаемая сущность содержит такие поля, как entity_name, entity_version, workload_size, scale_to_zero_enabledworkload_typeenvironment_vars.
served_models Sequence (Не рекомендуется: используйте served_entities вместо этого список обслуживаемых моделей для конечной точки.
traffic_config Map Конфигурация трафика, определяющая способ маршрутизации вызовов к конечной точке обслуживания. См. traffic_config.

конфигурация_конечной_точки_обслуживания_модели.config.traffic_config

Type: Map

Конфигурация трафика, определяющая способ маршрутизации вызовов к конечной точке обслуживания.

Key Type Description
routes Sequence Список маршрутов для распределения трафика. Каждый маршрут содержит served_model_name и traffic_percentage.

Example

В следующем примере определяется конечная точка обслуживания модели каталога Unity:

resources:
  model_serving_endpoints:
    uc_model_serving_endpoint:
      name: 'uc-model-endpoint'
      config:
        served_entities:
          - entity_name: 'myCatalog.mySchema.my-ads-model'
            entity_version: '10'
            workload_size: 'Small'
            scale_to_zero_enabled: 'true'
        traffic_config:
          routes:
            - served_model_name: 'my-ads-model-10'
              traffic_percentage: '100'
      tags:
        - key: 'team'
          value: 'data science'

конвейер

Type: Map

Конвейеры поддерживаются в Python для декларативных пакетов автоматизации. См. databricks.bundles.pipelines.

Ресурс конвейера позволяет создавать конвейеры. Сведения о конвейерах см. в разделе "Декларативные конвейеры Spark". Учебник, использующий шаблон декларативных пакетов автоматизации для создания конвейера, см. в разделе "Разработка конвейеров с помощью декларативных пакетов автоматизации".

pipelines:
  <pipeline-name>:
    <pipeline-field-name>: <pipeline-field-value>
Key Type Description
allow_duplicate_names Boolean Если установлено значение false, развертывание завершится ошибкой, если имя конфликтует с именем другого конвейера.
Добавлено в Databricks CLI версии 0.261.0
budget_policy_id String Бюджетная политика этого проекта.
Добавлено в Databricks CLI версии 0.230.0
cascade_on_destroy Boolean Удаляет ли уничтожение конвейера его наборы данных (материализованные виды, таблицы потока и просмотры). При отключении сервера по умолчанию действует. Установлен на false сохранение наборов данных при уничтожении. Поддерживается движком прямого развертывания.
Добавлено в Databricks CLI версии 1.12.0
catalog String Каталог в каталоге Unity для публикации данных из этого конвейера. Если target задано, таблицы в этом конвейере публикуются в схеме target внутри catalog (например, catalog.target.table). Если target не указано, данные не публикуются в каталоге Unity.
channel String Канал выпуска конвейеров Lakeflow, указывающий, какая версия конвейеров Lakeflow будет использоваться.
clusters Sequence Параметры кластера для этого развертывания конвейера. См. кластер.
configuration Map Конфигурация для запуска этого конвейера.
continuous Boolean Выполняется ли конвейер непрерывным или запускается. Это заменяет trigger.
deployment Map Тип развертывания этого конвейера. См. развертывание.
development Boolean Указывает, находится ли конвейер в режиме разработки. По умолчанию false.
dry_run Boolean Указывает, является ли конвейер сухим запуском.
edition String Выпуск конвейерного продукта.
environment Map Спецификация среды для этого конвейера, используемая для установки зависимостей на бессерверных вычислениях. См. среду. Этот ключ поддерживается только в Databricks CLI версии 0.258 и выше.
Добавлено в Databricks CLI версии 0.257.0
event_log Map Конфигурация журнала событий для этого конвейера. См. event_log.
Добавлено в Интерфейс командной строки Databricks версии 0.246.0
filters Map Фильтры, определяющие, какие пакеты конвейера необходимо включить в развернутый граф. См. фильтры.
gateway_definition Map Конфигурация конвейера шлюза. Эти параметры нельзя использовать с ingestion_definition параметрами.
id String Уникальный идентификатор для этого конвейера.
ingestion_definition Map Конфигурация для управляемого конвейера приема данных. Эти параметры нельзя использовать с параметрами libraries, schema, target или catalog. См. ingestion_definition.
libraries Sequence Список библиотек или кода, необходимых для этого развертывания. См. статью pipeline.libraries.
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
name String Дружественное имя для этого конвейера.
notifications Sequence Параметры уведомлений для этого конвейера. См. уведомления.
parameters Map Параметры по умолчанию используются для выполнения конвейера, где каждый ключ — это имя параметра, а значение — значение параметра. Максимальный общий размер — 10 тысяч символов в формате JSON.
permissions Sequence Разрешения конвейера. Просмотр разрешений.
photon Boolean Включён ли фотон для этого конвейера. Этот ключ игнорируется, если serverless задано значение true.
restart_window Map Определяет окно перезапуска для этого конвейера. Конвейеры можно перезапустить в этом окне без отставания.
root_path String Корневой путь для этого конвейера. Это используется в качестве корневого каталога при редактировании конвейера в пользовательском интерфейсе Databricks и добавляется в sys.path при выполнении Python источников во время выполнения конвейера.
Добавлено в Databricks CLI версии 0.253.0
run_as Map Идентификация, под которой работает конвейер. Если не указано иное, конвейер запускается от имени пользователя, который его создал. Можно указать только user_name или service_principal_name. Если указаны оба, возникает ошибка. См. run_as.
Добавлено в Databricks CLI версии 0.241.0
schema String Схема по умолчанию (база данных), из которой извлекаются таблицы или в которую они записываются.
Добавлено в Databricks CLI версии 0.230.0
serverless Boolean Включена ли бессерверная вычислительная мощность для этого конвейера?
storage String Корневой каталог DBFS для хранения контрольных точек и таблиц.
tags Map Карта тегов, связанных с конвейером. Они перенаправляются в кластер в виде тегов кластера и поэтому подвергаются таким же ограничениям. В конвейер можно добавить не более 25 тегов.
Добавлено в Databricks CLI версии 0.256.0
target String Целевая схема (база данных) для добавления таблиц в этот конвейер. Точно один из schema или target должен быть указан. Для публикации в каталоге Unity также укажите catalog. Это устаревшее поле больше не следует использовать для создания конвейера; вместо него следует использовать поле schema.
usage_policy_id String Идентификатор политики бессерверного использования, используемой для этого конвейера.
Добавлено в Databricks CLI версии 0.273.0

pipeline.deployment

Type: Map

Конфигурация типа развертывания для конвейера.

Key Type Description
kind String Тип развертывания. Например: BUNDLE.
metadata_file_path String Путь к файлу метаданных для развертывания.

конвейер.окружение

Type: Map

Спецификация среды для установки зависимостей на бессерверных вычислениях.

Key Type Description
dependencies Sequence Список зависимостей pip, поддерживаемых версией pip в этой среде. Каждая зависимость — это строка файла требований pip.
environment_version String (Бета) Версия среды бессерверной среды Python, используемая для выполнения клиентского кода Python, например4. Каждая версия среды включает определённую версию Python и тщательно отобранный набор предустановленных библиотек с определёнными версиями, обеспечивая стабильную и воспроизводимую среду выполнения. Databricks поддерживает трёхлетний жизненный цикл для каждой версии среды. Для доступных версий и включённых пакетов см. раздел «Версии окружения».
Добавлено в Databricks CLI версии 0.294.0

pipeline.журнал_событий

Type: Map

Конфигурация журнала событий для конвейера.

Key Type Description
catalog String Каталог каталога Unity, в котором публикуется журнал событий.
name String Имя журнала событий публикуется в каталоге Unity.
schema String Схема каталога Unity, в котором публикуется журнал событий.

конвейер.фильтры

Type: Map

Фильтры, определяющие, какие пакеты конвейера необходимо включить в развернутый граф.

Key Type Description
include Sequence Список имен пакетов для включения.
exclude Sequence Список имен пакетов, которые следует исключить.

pipeline.ingestion_definition

Type: Map

Конфигурация для управляемой загрузки данных. Эти параметры нельзя использовать с параметрами libraries, schema, target или catalog.

Key Type Description
connection_name String Имя подключения, которое следует использовать для поглощения. Чтобы создать подключения программным способом для соединителей, поддерживающих проверку подлинности только API, используйте databricks connections create в задаче предварительного развертывания скрипта или задания. См. раздел "Развертывание".
connector_type String Необязательно. Тип соединителя для источников. Допустимые значения — CDC и QUERY_BASED.
Добавлено в Databricks CLI версии 0.296.0
data_staging_options Map Необязательно. Расположение промежуточного хранилища данных. Это необходимо для миграции из управляемого конвейера приема CDC с конвейером шлюза в объединенный управляемый конвейер приема CDC. Если не указано, том для промежуточных данных создается в каталоге и схеме или целевом объекте, указанном в определении конвейера верхнего уровня.
Добавлено в Databricks CLI версии 0.296.0
full_refresh_window Map Необязательно. Окно, указывающее набор диапазонов времени для запросов моментальных снимков в CDC.
ingest_from_uc_foreign_catalog Boolean Неизменяемый. Если задано значение true, конвейер будет получать таблицы из внешних каталогов каталога Unity напрямую без необходимости указывать подключение каталога Unity или шлюз приема. Поля source_catalog в объектах IngestionConfig интерпретируются как внешние каталоги каталога Unity для приема.
Добавлено в Databricks CLI версии 0.279.0
ingestion_gateway_id String Идентификатор шлюза приема.
objects Sequence Обязательное. Параметры, указывающие таблицы для репликации и назначения для реплицированных таблиц. Каждый объект может быть SchemaSpec, TableSpec или ReportSpec.
source_type String Обязательный при использовании source_configurations. Указывает тип соединителя (например, POSTGRESQL, MYSQL).
source_configurations Sequence Параметры конфигурации источника на уровне каталога. При использовании этого поля также необходимо указать source_type. См. source_configurations.
table_configuration Map Конфигурация для таблиц поглощения. См. table_configuration.

SchemaSpec

Type: Map

Спецификация объекта схемы для приема всех таблиц из схемы.

Key Type Description
source_schema String Имя исходной схемы для обработки.
destination_catalog String Имя целевого каталога в Unity Catalog.
destination_schema String Имя схемы назначения в Unity Catalog.
table_configuration Map Конфигурация для применения ко всем таблицам в этой схеме. См. pipeline.ingestion_definition.table_configuration.

Спецификация таблицы

Type: Map

Спецификация объекта таблицы для загрузки конкретной таблицы.

Key Type Description
source_schema String Имя исходной схемы, содержащей таблицу.
source_table String Имя исходной таблицы для импорта.
destination_catalog String Имя целевого каталога в Unity Catalog.
destination_schema String Имя схемы назначения в Unity Catalog.
destination_table String Имя таблицы назначения в Unity Catalog.
table_configuration Map Конфигурация для этой конкретной таблицы. См. pipeline.ingestion_definition.table_configuration.

Спецификация отчета

Type: Map

Спецификация отчётного объекта для приема аналитических отчетов.

Key Type Description
source_url String URL-адрес исходного отчета.
source_report String Имя или идентификатор исходного отчета.
destination_catalog String Имя целевого каталога в Unity Catalog.
destination_schema String Имя схемы назначения в Unity Catalog.
destination_table String Имя целевой таблицы для данных отчета.
table_configuration Map Конфигурация для таблицы отчета. См. pipeline.ingestion_definition.table_configuration.

pipeline.ingestion_definition.source_configurations

Type: Sequence

Конфигурация источника. Каждый элемент в последовательности — это карта, содержащая конфигурацию уровня каталога.

Key Type Description
catalog Map Параметры конфигурации источника на уровне каталога. См. каталог.
pipeline.ingestion_definition.source_configurations.catalog

Type: Map

Параметры конфигурации источника на уровне каталога

Key Type Description
postgres Map Параметры конфигурации уровня каталога для postgres. Содержит один slot_config ключ, представляющий Map конфигурацию слота Postgres для логической репликации.
source_catalog String Имя исходного каталога.

pipeline.определение_погрузки.конфигурация_таблицы

Type: Map

Параметры конфигурации для таблиц ингестии.

Key Type Description
exclude_columns Sequence Список имен столбцов, которые следует исключить для приема. Если не указано, include_columns полностью контролирует, какие столбцы следует загружать. Когда указано, все остальные столбцы, включая будущие, будут автоматически включены для обработки. Это поле является взаимоисключающим с include_columns.
include_columns Sequence Список имен столбцов, которые необходимо включить для импорта. Если не указано, все столбцы, кроме тех в exclude_columns, будут включены. Будущие столбцы будут автоматически включены. При их указании все другие будущие столбцы будут автоматически исключены из обработки. Это поле является взаимоисключающим с exclude_columns.
primary_keys Sequence Список имен столбцов, используемых в качестве первичных ключей для таблицы.
sequence_by Sequence Имена столбцов, определяющие логический порядок событий в исходных данных. Декларативные конвейеры Spark используют эту последовательность для обработки событий изменений, поступающих вне порядка.

pipeline.libraries

Type: Sequence

Определяет список библиотек или кода, необходимых для этого конвейера.

Каждый элемент в списке — это определение:

Key Type Description
file Map Путь к файлу, который определяет конвейер и хранится в Databricks Repos. См. файл pipeline.libraries.file.
glob Map Унифицированное поле для включения исходного кода. Каждая запись может быть путь к записной книжке, путь к файлу или путь к папке, который заканчивается /**. Это поле нельзя использовать вместе с notebook или file. См. pipeline.libraries.glob.
notebook Map Путь к записной книжке, которая определяет конвейер и хранится в рабочей области Databricks. См. pipeline.libraries.notebook.
whl String Это поле устарело

pipeline.libraries.file

Type: Map

Путь к файлу, который определяет конвейер и хранится в Repos Databricks.

Key Type Description
path String Абсолютный путь исходного кода.

pipeline.libraries.glob

Type: Map

Унифицированное поле для включения исходного кода. Каждая запись может быть путь к записной книжке, путь к файлу или путь к папке, который заканчивается /**. Это поле нельзя использовать вместе с notebook или file.

Key Type Description
include String Исходный код, который следует включить в конвейеры

pipeline.libraries.notebook

Type: Map

Путь к записной книжке, которая определяет конвейер и хранится в рабочей области Databricks.

Key Type Description
path String Абсолютный путь исходного кода.

pipeline.notifications

Type: Sequence

Параметры уведомлений для этого конвейера. Каждый элемент в последовательности — это конфигурация уведомлений.

Key Type Description
alerts Sequence Список оповещений, которые активируют уведомления. Допустимые значения: on-update-success, on-update-failure, on-update-fatal-failureon-flow-failure.
email_recipients Sequence Список адресов электронной почты для уведомления о активации настроенного оповещения.

Example

В следующем примере определяется конвейер с ключом ресурса hello-pipeline:

resources:
  pipelines:
    hello-pipeline:
      name: hello-pipeline
      clusters:
        - label: default
          num_workers: 1
      development: true
      continuous: false
      channel: CURRENT
      edition: CORE
      photon: false
      libraries:
        - notebook:
            path: ./pipeline.py

Дополнительные примеры конфигурации конвейера см. в разделе "Конфигурация конвейера".

postgres_branch

Это важно

Эта функция доступна в бета-версии.

Type:Map

Ресурс ветви Postgres позволяет определять ветви Lakebase в пакете. Необходимо также определить соответствующие проекты Postgres и вычислительные конечные точки.

Добавлено в Databricks CLI версии 0.287.0

postgres_branches:
  <postgres_branch-name>:
    <postgres_branch-field-name>: <postgres_branches-field-value>
Key Type Description
branch_id String Идентификатор, используемый для ветви. Это становится окончательным компонентом имени ресурса ветви. Идентификатор является обязательным и должен иметь длину 1–63 символов, начинаться с строчной буквы и содержать только строчные буквы, цифры и дефисы. Например, development преобразуется в projects/my-app/branches/development.
Добавлено в Databricks CLI версии 0.287.0
expire_time String Абсолютная метка времени окончания срока действия. При установке ветвь истекает в это время.
Добавлено в Databricks CLI версии 0.287.0
is_protected Boolean Если задано значение true, защищает ветвь от удаления и сброса. Связанные конечные точки вычислений и проект не могут быть удалены во время защиты ветви.
Добавлено в Databricks CLI версии 0.287.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.287.0
no_expiry Boolean Явно отключить срок действия. Если задано значение true, срок действия ветви не истекает. Если задано значение false, запрос недопустим; вместо этого укажите ttl или expire_time.
Добавлено в Databricks CLI версии 0.287.0
parent String Проект, в котором будет создана эта ветвь. Формат: projects/{project_id}
Добавлено в Databricks CLI версии 0.287.0
purge_on_delete Boolean Вопрос о том, нужно ли удалять данные ветки при их удалении.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
replace_existing Boolean Следует ли заменить существующую ветвь с тем же идентификатором при развертывании.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
source_branch String Имя исходной ветви, из которой была создана эта ветвь (происхождение данных для восстановления на определенный момент времени). Если не указано, по умолчанию используется ветвь проекта. Формат: projects/{project_id}/branches/{branch_id}
Добавлено в Databricks CLI версии 0.287.0
source_branch_lsn String Номер последовательности журнала (LSN) в исходной ветви, из которой была создана эта ветвь.
Добавлено в Databricks CLI версии 0.287.0
source_branch_time String Точка во времени исходной ветви, из которой была создана эта ветвь.
Добавлено в Databricks CLI версии 0.287.0
ttl String Относительная продолжительность жизни. Если задано, срок действия ветви истекает по creation_time + ttl.
Добавлено в Databricks CLI версии 0.287.0

Example

См . пример postgres_projects.

postgres_catalog

Это важно

Эта функция доступна в бета-версии.

Type: Map

Ресурс каталога Postgres позволяет определять каталоги Postgres Lakebase в пакете. Каждый каталог привязывает каталог каталога Unity к базе данных Postgres в ветви автомасштабирования Lakebase.

Добавлено в Интерфейс командной строки Databricks версии 1.0.0

postgres_catalogs:
  <postgres_catalog-name>:
    <postgres_catalog-field-name>: <postgres_catalog-field-value>
Key Type Description
branch String Ветвь автомасштабирования Lakebase, которая поддерживает каталог.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
catalog_id String Обязательное. Идентификатор каталога каталога Unity для привязки к базе данных Postgres.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
create_database_if_missing Boolean Следует ли создать базу данных Postgres, если она еще не существует.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
postgres_database String Обязательное. Имя базы данных Postgres для привязки к каталогу.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0

Example

resources:
  postgres_projects:
    project:
      project_id: test-pg-project
      display_name: Test Postgres Project

  postgres_catalogs:
    catalog:
      catalog_id: test_catalog
      branch: ${resources.postgres_projects.project.name}/branches/production
      postgres_database: appdb
      create_database_if_missing: true

postgres_database

Это важно

Эта функция доступна в бета-версии.

Type: Map

Ресурс базы данных Postgres позволяет определять базы данных Lakebase Postgres в пакете. Каждая база данных создается в ветви автомасштабирования Lakebase.

Добавлено в Databricks CLI версии 1.4.0

postgres_databases:
  <postgres_database-name>:
    <postgres_database-field-name>: <postgres_database-field-value>
Key Type Description
database_id String Обязательное. Идентификатор, используемый для базы данных. Это становится окончательным компонентом имени ресурса базы данных.
Добавлено в Databricks CLI версии 1.4.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 1.4.0
parent String Обязательное. Ветвь, в которой создается эта база данных. Формат: projects/{project_id}/branches/{branch_id}.
Добавлено в Databricks CLI версии 1.4.0
postgres_database String Имя базы данных Postgres.
Добавлено в Databricks CLI версии 1.4.0
replace_existing Boolean Следует ли заменить существующую базу данных с тем же идентификатором при развертывании.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
role String Требуется при создании. Имя ресурса роли Postgres, которая владеет базой данных. Формат: projects/{project_id}/branches/{branch_id}/roles/{role_id}.
Добавлено в Databricks CLI версии 1.4.0

Examples

resources:
  postgres_projects:
    my_project:
      project_id: test-pg-proj
      display_name: 'Test Project for Database'
      pg_version: 16
      history_retention_duration: '604800s'

  postgres_branches:
    main:
      parent: ${resources.postgres_projects.my_project.id}
      branch_id: main
      no_expiry: true

  postgres_roles:
    owner:
      parent: ${resources.postgres_branches.main.id}
      role_id: app-owner
      postgres_role: app_owner

  postgres_databases:
    my_database:
      parent: ${resources.postgres_branches.main.id}
      database_id: my-database
      postgres_database: app_db
      # The live API requires `role`. Declare an explicit role so the bundle is
      # portable across users (the auto-created project-owner role's id is
      # derived from the creator's identity).
      role: ${resources.postgres_roles.owner.id}

postgres_endpoint

Это важно

Эта функция доступна в бета-версии.

Type: Map

Ресурс Postgres позволяет определить вычислительные конечные точки Lakebase в наборе. Необходимо также определить соответствующие проекты Lakebase и ветви Lakebase.

Добавлено в Databricks CLI версии 0.287.0

postgres_endpoints:
  <postgres_endpoint-name>:
    <postgres_endpoint-field-name>: <postgres_endpoint-field-value>
Key Type Description
autoscaling_limit_max_cu Number Максимальное количество единиц вычислений. Минимальное значение — 0,5.
Добавлено в Databricks CLI версии 0.287.0
autoscaling_limit_min_cu Number Минимальное количество единиц вычислений. Минимальное значение — 0,5.
Добавлено в Databricks CLI версии 0.287.0
disabled Boolean Следует ли ограничить подключения к конечной точке вычислений. Включение этого параметра запланирует приостановку операции вычислений. Отключенная конечная точка вычислений не может быть включена действием подключения или консоли.
Добавлено в Databricks CLI версии 0.287.0
endpoint_id String Идентификатор, используемый для конечной точки. Это становится окончательным компонентом имени ресурса конечной точки. Идентификатор является обязательным и должен иметь длину 1–63 символов, начинаться с строчной буквы и содержать только строчные буквы, цифры и дефисы. Например, primary преобразуется в projects/my-app/branches/development/endpoints/primary.
Добавлено в Databricks CLI версии 0.287.0
endpoint_type String Тип конечной точки. Ветвь может иметь только одну конечную точку READ_WRITE. Возможные значения: ENDPOINT_TYPE_READ_WRITE, ENDPOINT_TYPE_READ_ONLY.
Добавлено в Databricks CLI версии 0.287.0
group Map Конфигурация группы конечных точек. См. раздел postgres_endpoint.group.
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.287.0
no_suspension Boolean Если задано значение true, явным образом отключает автоматическую приостановку (никогда не приостанавливается). Значение true должно быть задано при указании.
Добавлено в Databricks CLI версии 0.287.0
parent String Ветвь, в которой будет создана эта конечная точка. Формат: projects/{project_id}/branches/{branch_id}
Добавлено в Databricks CLI версии 0.287.0
replace_existing Boolean Следует ли заменить существующую конечную точку вычислений с тем же идентификатором при развертывании.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
settings Map Коллекция параметров для вычислительной конечной точки.
Добавлено в Databricks CLI версии 0.287.0
suspend_timeout_duration String Длительность бездействия, после которой конечная точка вычислений автоматически приостановлена. Если задано значение от 60 до 604800 (1 минуты до 1 недели).
Добавлено в Databricks CLI версии 0.287.0

postgres_endpoint.group

Type: Map

Конфигурация группы конечных точек.

Key Type Description
enable_readable_secondaries Boolean Разрешить ли подключения только для чтения конечным точкам записи. Применимо только для конечных точек чтения и записи, где group.max > 1.
max Integer Обязательное. Максимальное количество вычислений в группе конечных точек. В настоящее время это должно быть равно min. 1 Установите значение для отдельных вычислительных конечных точек, чтобы отключить высокий уровень доступности (HA). Чтобы вручную приостановить все вычисления в группе конечных точек, установите значение disabledtrue в конечной точке.
min Integer Обязательное. Минимальное количество вычислений в группе конечных точек. В настоящее время это должно быть равно max. Это должно быть больше или равно 1.

Example

См . пример postgres_projects.

postgres_project

Это важно

Эта функция доступна в бета-версии.

Type: Map

Ресурс проекта Postgres позволяет определить проекты баз данных Postgres Autoscaling Postgres в пакете. Необходимо также определить соответствующие ветви Postgres и вычислительные конечные точки.

Добавлено в Databricks CLI версии 0.287.0

postgres_projects:
  <postgres_project-name>:
    <postgres_project-field-name>: <postgres_project-field-value>
Key Type Description
budget_policy_id String Идентификатор политики бюджета для этого проекта.
custom_tags Sequence Настраиваемые теги для этого проекта. См. раздел postgres_project.custom_tags.
default_branch String Ветвь по умолчанию для проекта в формате projects/{project_id}/branches/{branch_id}.
default_endpoint_settings Map Коллекция параметров для вычислительной конечной точки. См. раздел postgres_project.default_endpoint_settings.
Добавлено в Databricks CLI версии 0.287.0
display_name String Имя проекта, доступного для чтения пользователем. Длина должна составлять от 1 до 256 символов.
Добавлено в Databricks CLI версии 0.287.0
enable_pg_native_login Boolean Следует ли включить собственное имя входа Postgres для проекта.
Добавлено в Databricks CLI версии 0.294.0
history_retention_duration String Количество секунд для хранения общей истории для восстановления на определенный момент времени для всех ветвей в этом проекте. Значение должно быть от 0 до 2592000 (до 30 дней).
Добавлено в Databricks CLI версии 0.287.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.287.0
permissions Sequence Разрешения для проекта Postgres. Просмотр разрешений.
Добавлено в Databricks CLI версии 0.292.0
pg_version Integer Основной номер версии Postgres. Поддерживаемые версии: 16 и 17.
Добавлено в Databricks CLI версии 0.287.0
project_id String Идентификатор, используемый для Project. Это становится окончательным компонентом имени ресурса проекта. Идентификатор является обязательным и должен иметь длину 1–63 символов, начинаться с строчной буквы и содержать только строчные буквы, цифры и дефисы. Например, my-app преобразуется в projects/my-app.
Добавлено в Databricks CLI версии 0.287.0
purge_on_delete Boolean Следует ли очищать данные проекта при удалении.
Добавлено в Databricks CLI версии 1.2.0

Пример

resources:
  postgres_projects:
    my_db:
      project_id: test-prod-app
      display_name: 'Production Database'
      pg_version: 17

  postgres_branches:
    main:
      parent: ${resources.postgres_projects.my_db.id}
      branch_id: main
      is_protected: false
      no_expiry: true

  postgres_endpoints:
    primary:
      parent: ${resources.postgres_branches.main.id}
      endpoint_id: primary
      endpoint_type: ENDPOINT_TYPE_READ_WRITE
      autoscaling_limit_min_cu: 0.5
      autoscaling_limit_max_cu: 4

postgres_project.custom_tags

Type: Sequence

Список пользовательских тегов для проекта.

Key Type Description
key String Ключ пользовательского тега.
value String Значение настраиваемого тега.

postgres_project.default_endpoint_settings.

Type: Map

Key Type Description
autoscaling_limit_max_cu Number Максимальное количество единиц вычислений. Минимальное значение — 0,5.
autoscaling_limit_min_cu Number Минимальное количество единиц вычислений. Минимальное значение — 0,5.
no_suspension Boolean Если задано значение true, явным образом отключает автоматическую приостановку (никогда не приостанавливается). Значение true должно быть задано при указании. Взаимоисключающ с suspend_timeout_duration. При обновлении используйте spec.project_default_settings.suspension в update_mask.
pg_settings Map Необработанное представление параметров Postgres.
suspend_timeout_duration String Длительность бездействия, после которой конечная точка вычислений автоматически приостановлена. Если задано значение от 60 до 604800 (1 минуты до 1 недели). Взаимоисключающ с no_suspension. При обновлении используйте spec.project_default_settings.suspension в update_mask.

postgres_role

Это важно

Эта функция доступна в бета-версии.

Type: Map

Ресурс роли Postgres позволяет определять роли Lakebase Postgres в пакете. Каждая роль создается в ветви автомасштабирования Lakebase.

Добавлено в Databricks CLI версии 1.4.0

postgres_roles:
  <postgres_role-name>:
    <postgres_role-field-name>: <postgres_role-field-value>
Key Type Description
attributes Map Требуемые атрибуты роли Postgres, предоставляемые API для связывания с ролью. См. postgres_role.атрибуты.
Добавлено в Databricks CLI версии 1.4.0
auth_method String Как роль проходит проверку подлинности при подключении к Postgres. Если не указано, от него identity_typeизвлекается значимый метод проверки подлинности. Допустимые значения: NO_LOGIN, PG_PASSWORD_SCRAM_SHA_256LAKEBASE_OAUTH_V1.
Добавлено в Databricks CLI версии 1.4.0
identity_type String Тип управляемого удостоверения Databricks, который представляет эта роль. Оставьте пустым, чтобы создать обычную роль Postgres, не связанную с удостоверением Databricks. Допустимые значения: USER, SERVICE_PRINCIPALGROUP.
Добавлено в Databricks CLI версии 1.4.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 1.4.0
membership_roles Sequence Стандартные роли, которые эта роль является членом.
Добавлено в Databricks CLI версии 1.4.0
parent String Обязательное. Ветвь, в которой создается эта роль. Формат: projects/{project_id}/branches/{branch_id}.
Добавлено в Databricks CLI версии 1.4.0
postgres_role String Имя роли Postgres. Требуется при создании роли. Чтобы создать роль Postgres, поддерживаемую управляемым удостоверением Databricks, postgres_role необходимо выполнить одно из следующих действий:
  • Электронная identity_typeUSERпочта пользователя для .
  • Идентификатор приложения для identity_typeSERVICE_PRINCIPALобъекта .
  • Имя группы для identity_typeGROUPобъекта .

Добавлено в Databricks CLI версии 1.4.0
replace_existing Boolean Следует ли заменить существующую роль с тем же идентификатором при развертывании.
Добавлено в Интерфейс командной строки Databricks версии 1.7.0
role_id String Обязательное. Идентификатор указанной пользователем роли; становится окончательным компонентом имени ресурса роли. Должно быть 4–63 символов, строчных букв, чисел и дефисов (RFC 1123).
Добавлено в Databricks CLI версии 1.4.0

postgres_role.атрибуты

Type: Map

Требуемые атрибуты роли Postgres, предоставляемые API для связывания с ролью.

Добавлено в Databricks CLI версии 1.4.0

Key Type Description
bypassrls Boolean Указывает, проходит ли роль безопасность на уровне строк.
createdb Boolean Может ли роль создавать базы данных.
createrole Boolean Может ли роль создавать, изменять, удалять, комментировать и изменять метку безопасности других ролей.

Examples

resources:
  postgres_projects:
    my_project:
      project_id: my-pg-proj
      display_name: 'Test Project for Role'
      pg_version: 16
      history_retention_duration: '604800s'

  postgres_branches:
    main:
      parent: ${resources.postgres_projects.my_project.id}
      branch_id: main
      no_expiry: true

  postgres_roles:
    my_role:
      parent: ${resources.postgres_branches.main.id}
      role_id: my-role
      postgres_role: app_role
      attributes:
        createdb: true

postgres_synced_table

Это важно

Эта функция доступна в бета-версии.

Type: Map

Ресурс синхронизированной таблицы Postgres позволяет определить синхронизированные таблицы Lakebase Postgres в пакете. Каждая синхронизированная таблица непрерывно реплицирует исходную таблицу каталога Unity в таблицу Postgres в экземпляре автомасштабирования Lakebase.

Добавлено в Интерфейс командной строки Databricks версии 1.0.0

postgres_synced_tables:
  <postgres_synced_table-name>:
    <postgres_synced_table-field-name>: <postgres_synced_table-field-value>
Key Type Description
branch String Ветвь автомасштабирования Lakebase, в которой создается синхронизированная таблица.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
create_database_objects_if_missing Boolean Следует ли создавать логическую базу данных и ресурсы схемы синхронизированной таблицы, если они еще не существуют.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
existing_pipeline_id String Идентификатор существующего конвейера. Если это задано, синхронизированная таблица будет упакована в существующий конвейер, на который ссылается ссылка. Это позволяет избежать создания нового конвейера и позволяет совместно использовать существующие вычислительные ресурсы. В этом случае синхронизированная таблица scheduling_policy должна соответствовать политике планирования существующего конвейера. Не более одного из existing_pipeline_id и new_pipeline_spec должно быть определено.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
extra_columns Sequence Дополнительные столбцы PostgreSQL для добавления в синхронизированную таблицу, помимо тех, что реплицируются из исходной таблицы.
Добавлено в версии Databricks CLI 1.10.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
new_pipeline_spec Map Спецификация нового конвейера. См. раздел postgres_synced_table.new_pipeline_spec. Не более одного из existing_pipeline_id и new_pipeline_spec должно быть определено.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
postgres_database String Имя целевой базы данных Postgres для синхронизированной таблицы.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
primary_key_columns Sequence Список имен столбцов, формающих первичный ключ.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
scheduling_policy String Политика планирования базового конвейера синхронизированной таблицы. Допустимые значения: CONTINUOUS, TRIGGEREDSNAPSHOT.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
source_table_full_name String Полное имя исходной таблицы в формате catalog.schema.table.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
synced_table_id String Обязательное. Идентификатор, используемый для синхронизированной таблицы.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
timeseries_key String Ключ для временных рядов для удаления дубликатов строк с одинаковым первичным ключом.
Добавлено в Интерфейс командной строки Databricks версии 1.0.0
type_overrides Sequence Переопределяет стандартное отображение типов Delta-to-PostgreSQL для определённых столбцов. См. postgres_synced_table.type_overrides.
Добавлено в версии Databricks CLI 1.5.0

postgres_synced_table.new_pipeline_spec

Type: Map

Спецификация нового конвейера, используемого синхронизированной таблицей.

Добавлено в Интерфейс командной строки Databricks версии 1.0.0

Key Type Description
budget_policy_id String Политика бюджета, установленная в только что созданном конвейере.
storage_catalog String Каталог для конвейера для хранения промежуточных файлов, таких как контрольные точки и журналы событий. Это должен быть стандартный каталог, в котором у пользователя есть разрешения на создание таблиц Delta.
storage_schema String Схема конвейера для хранения промежуточных файлов, таких как контрольные точки и журналы событий. Это должно быть в стандартном каталоге, где у пользователя есть разрешения на создание таблиц Delta.

postgres_synced_table.type_overrides

Type: Sequence

Переопределяет стандартное отображение типов Delta-to-PostgreSQL для одного столбца.

Добавлено в версии Databricks CLI 1.5.0

Key Type Description
column_name String Обязательное. (Бета) Название исходного столбца, целевой тип PostgreSQL, должно быть переписано.
Добавлено в версии Databricks CLI 1.5.0
pg_type String Обязательное. (Бета) Специфический для PostgreSQL тип цели для столбца. Единственным допустимым значением является PG_SPECIFIC_TYPE_VECTOR.
Добавлено в версии Databricks CLI 1.5.0
size Integer (Бета) Параметр размера для целевого типа для типов, которые принимают один, например, векторная размерность или длина варчара. Требуется, когда выбранному pg_type требуется определённый размер.
Добавлено в версии Databricks CLI 1.5.0

Example

resources:
  schemas:
    pipeline_storage:
      name: test_pipeline_storage
      catalog_name: main
      comment: 'Pipeline storage for the synced-table test'

  postgres_projects:
    my_project:
      project_id: test-pg-proj
      display_name: 'Test Project for Synced Table'
      pg_version: 17

  postgres_catalogs:
    my_catalog:
      catalog_id: lakebase_test
      branch: ${resources.postgres_projects.my_project.id}/branches/production
      postgres_database: appdb
      create_database_if_missing: true

  postgres_synced_tables:
    my_table:
      synced_table_id: ${resources.postgres_catalogs.my_catalog.catalog_id}.public.trips_synced
      source_table_full_name: main.source_test.trips_source
      primary_key_columns: ['tpep_pickup_datetime']
      scheduling_policy: SNAPSHOT
      postgres_database: appdb
      branch: ${resources.postgres_projects.my_project.id}/branches/production
      create_database_objects_if_missing: true
      new_pipeline_spec:
        storage_catalog: ${resources.schemas.pipeline_storage.catalog_name}
        storage_schema: ${resources.schemas.pipeline_storage.name}

монитор качества (каталог Unity)

Type: Map

Ресурс quality_monitor позволяет определить монитор таблицы каталога Unity. Сведения о мониторах см. в разделе "Профилирование данных".

quality_monitors:
  <quality_monitor-name>:
    <quality_monitor-field-name>: <quality_monitor-field-value>
Key Type Description
assets_dir String Каталог для хранения ресурсов мониторинга (например, панелей мониторинга, таблиц метрик).
baseline_table_name String Имя базовой таблицы, из которой вычисляются метрики смещения. Столбцы в отслеживаемой таблице также должны присутствовать в базовой таблице.
custom_metrics Sequence Пользовательские метрики для вычислений в отслеживаемой таблице. Это могут быть статистические метрики, производные метрики (от уже вычисляемых статистических метрик) или метрики смещения (сравнение метрик в течение нескольких периодов времени). См. custom_metrics.
inference_log Map Конфигурация для журналов вывода выводов. См. inference_log.
latest_monitor_failure_msg String Последнее сообщение об ошибке монитора. Это поле только для чтения, которое заполняется при сбое монитора.
Добавлено в Databricks CLI версии 0.264.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
notifications Map Параметры уведомлений для монитора. См. уведомления.
output_schema_name String Схема, в которой создаются выходные таблицы метрик.
schedule Map Расписание автоматического обновления и перезагрузки метрических таблиц. См. расписание.
skip_builtin_dashboard Boolean Следует ли пропустить создание панели мониторинга по умолчанию, в котором суммируются метрики качества данных.
slicing_exprs Sequence Список выражений столбцов для среза данных с целевым анализом. Данные группируются по каждому выражению независимо, что приводит к отдельному срезу для каждого предиката и его дополнений. Для столбцов высокой кардинальности только первые 100 уникальных значений по частоте будут использоваться для создания срезов.
snapshot Map Конфигурация для мониторинга таблиц моментальных снимков. См. снэпшот.
table_name String Полное имя таблицы.
Добавлено в Databricks CLI версии 0.235.0
time_series Map Конфигурация для мониторинга таблиц временных рядов. См. time_series.
warehouse_id String Необязательный аргумент для указания хранилища для создания панели мониторинга. Если не указано, будет использоваться первый работающий склад.

quality_monitor.пользовательские_метрики

Type: Sequence

Список настраиваемых определений метрик.

Каждый элемент в списке CustomMetric— это :

Key Type Description
definition String Шаблон Jinja для выражения SQL, указывающего способ вычисления метрики. См. определение метрик.
input_columns Sequence Список названий столбцов входной таблицы, для которых необходимо вычислить метрику. Может использоваться :table для указания того, что метрика нуждается в информации из нескольких столбцов.
name String Имя метрики в выходных таблицах.
output_data_type String Тип выходных данных пользовательской метрики.
type String Может быть только одним из CUSTOM_METRIC_TYPE_AGGREGATE, CUSTOM_METRIC_TYPE_DERIVEDили CUSTOM_METRIC_TYPE_DRIFT. CUSTOM_METRIC_TYPE_AGGREGATE CUSTOM_METRIC_TYPE_DERIVED Метрики вычисляются в одной таблице, а CUSTOM_METRIC_TYPE_DRIFT метрики сравниваются между базовыми и входными таблицами или двумя последовательными периодами времени.
  • CUSTOM_METRIC_TYPE_AGGREGATE: может опираться только на существующие столбцы в вашей таблице
  • CUSTOM_METRIC_TYPE_DERIVED: зависит от ранее вычисленных сводных метрик
  • CUSTOM_METRIC_TYPE_DRIFT: зависит от ранее вычисленных агрегированных или производных метрик

quality_monitor.inference_log

Type: Map

Конфигурация для журналов вывода выводов.

Key Type Description
granularities Sequence Степень детализации времени для агрегирования журналов вывода (например, ["1 day"]).
model_id_col String Имя столбца, содержащего идентификатор модели.
prediction_col String Имя столбца, содержащего прогноз.
timestamp_col String Имя столбца, содержащего метку времени.
problem_type String Тип проблемы машинного обучения. Допустимые значения включают PROBLEM_TYPE_CLASSIFICATION, PROBLEM_TYPE_REGRESSION.
label_col String Имя столбца, содержащего метку (земная истина).
prediction_proba_col String Имя столбца, содержащего вероятности прогнозирования.

монитор_качества.уведомления

Type: Map

Параметры уведомлений для монитора.

Key Type Description
on_failure Map Параметры уведомлений при сбое монитора. См. on_failure.
on_new_classification_tag_detected Map Параметры уведомлений при обнаружении новых тегов классификации. См. on_new_classification_tag_detected.

Уведомления мониторинга качества при сбое

Type: Map

Параметры уведомлений при сбое монитора.

Key Type Description
email_addresses Sequence Список адресов электронной почты для уведомления о сбое монитора.

quality_monitor.notifications.обнаружен_новый_тег_классификации

Type: Map

Параметры уведомлений при обнаружении новых тегов классификации.

Key Type Description
email_addresses Sequence Список адресов электронной почты для уведомления о обнаружении новых тегов классификации.

quality_monitor.расписание

Type: Map

Планирование автоматического обновления таблиц метрик.

Key Type Description
quartz_cron_expression String Выражение Cron с использованием синтаксиса Quartz. Например, 0 0 8 * * ? ежедневно выполняется в 8:00 утра.
timezone_id String Часовой пояс расписания (например, UTC, America/Los_Angeles).
pause_status String Приостановлено ли расписание. Допустимые значения: PAUSED, UNPAUSED.

снимок_качества_мониторинга

Type: Map

Конфигурация для мониторинга таблиц моментальных снимков.

монитор_качества.временной_ряд

Конфигурация для мониторинга таблиц временных рядов.

Key Type Description
granularities Sequence Детализация временных интервалов для объединения данных временных рядов (например, ["30 minutes"]).
timestamp_col String Имя столбца, содержащего метку времени.

Examples

В следующих примерах определяются мониторы качества для типов профилей InferenceLog, TimeSeries и Snapshot.

# InferenceLog profile type
resources:
  quality_monitors:
    my_quality_monitor:
      table_name: dev.mlops_schema.predictions
      output_schema_name: ${bundle.target}.mlops_schema
      assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
      inference_log:
        granularities: [1 day]
        model_id_col: model_id
        prediction_col: prediction
        label_col: price
        problem_type: PROBLEM_TYPE_REGRESSION
        timestamp_col: timestamp
      schedule:
        quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
        timezone_id: UTC
# TimeSeries profile type
resources:
  quality_monitors:
    my_quality_monitor:
      table_name: dev.mlops_schema.predictions
      output_schema_name: ${bundle.target}.mlops_schema
      assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
      time_series:
        granularities: [30 minutes]
        timestamp_col: timestamp
      schedule:
        quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
        timezone_id: UTC
# Snapshot profile type
resources:
  quality_monitors:
    my_quality_monitor:
      table_name: dev.mlops_schema.predictions
      output_schema_name: ${bundle.target}.mlops_schema
      assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
      snapshot: {}
      schedule:
        quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
        timezone_id: UTC

В следующем примере настраивается монитор качества и соответствующее задание переобучения модели на основе мониторинга:

# Quality monitoring workflow
resources:
  quality_monitors:
    mlops_quality_monitor:
      table_name: ${bundle.target}.mlops_demo.predictions
      output_schema_name: ${bundle.target}.mlops_demo
      assets_dir: /Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
      inference_log:
        granularities: [1 hour]
        model_id_col: model_version
        prediction_col: prediction
        label_col: fare_amount
        problem_type: PROBLEM_TYPE_REGRESSION
        timestamp_col: inference_timestamp
      schedule:
        quartz_cron_expression: 57 0 14 * * ? # refresh monitoring metrics every day at 7 am PT
        timezone_id: UTC
  jobs:
    retraining_job:
      name: ${bundle.target}-mlops_demo-monitoring-retraining-job
      tasks:
        - task_key: monitored_metric_violation_check
          notebook_task:
            notebook_path: ../monitoring/notebooks/MonitoredMetricViolationCheck.py
            base_parameters:
              env: ${bundle.target}
              table_name_under_monitor: ${bundle.target}.mlops_demo.predictions
              metric_to_monitor: r2_score
              metric_violation_threshold: 0.7
              num_evaluation_windows: 24
              num_violation_windows: 5 # 5 out of the past 24 windows have metrics lower than threshold

        - task_key: is_metric_violated
          depends_on:
            - task_key: monitored_metric_violation_check
          condition_task:
            op: EQUAL_TO
            left: '{{tasks.monitored_metric_violation_check.values.is_metric_violated}}'
            right: 'true'

        - task_key: trigger_retraining
          depends_on:
            - task_key: is_metric_violated
              outcome: 'true'
          run_job_task:
            job_id: ${resources.jobs.model_training_job.id}

      schedule:
        quartz_cron_expression: '0 0 15 * * ?' # daily at 8 am PDT
        timezone_id: UTC

      # To get notifications, provide a list of emails to the on_failure argument.
      #
      #  email_notifications:
      #    on_failure:
      #      - someone@example.com

зарегистрированная модель (каталог Unity)

Type: Map

Ресурс зарегистрированной модели позволяет определять модели в каталоге Unity. Сведения о зарегистрированных моделях в каталоге Unity смотрите в статье Управление жизненным циклом модели в каталоге Unity.

registered_models:
  <registered_model-name>:
    <registered_model-field-name>: <registered_model-field-value>
Key Type Description
aliases Sequence Список псевдонимов, связанных с зарегистрированной моделью. См. registered_model.aliases.
Добавлено в Databricks CLI версии 0.273.0
catalog_name String Имя каталога, в котором находится схема и зарегистрированная модель.
comment String Комментарий, присоединенный к зарегистрированной модели.
created_at Integer Метка времени создания зарегистрированной модели в миллисекундах с эпохи Unix.
Добавлено в Databricks CLI версии 0.273.0
created_by String Идентификатор пользователя, создавшего зарегистрированную модель.
Добавлено в Databricks CLI версии 0.273.0
full_name String Трехуровневое (полностью квалифицированное) имя зарегистрированной модели.
Добавлено в Databricks CLI версии 0.273.0
grants Sequence Гранты, ассоциированные с зарегистрированной моделью. См.грант.
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
metastore_id String Уникальный идентификатор хранилища метаданных.
Добавлено в Databricks CLI версии 0.273.0
name String Имя зарегистрированной модели.
owner String Идентификатор пользователя, которому принадлежит зарегистрированная модель.
Добавлено в Databricks CLI версии 0.273.0
schema_name String Имя схемы, в которой находится зарегистрированная модель.
storage_location String Расположение хранилища в облаке, в котором хранятся файлы данных версии модели.
updated_at String Метка времени последнего обновления зарегистрированной модели в миллисекундах с эпохи Unix.
Добавлено в Databricks CLI версии 0.273.0
updated_by String Идентификатор пользователя, который в последний раз обновил зарегистрированную модель.
Добавлено в Databricks CLI версии 0.273.0

зарегистрированная_модель.алиасы ("registered_model.aliases")

Type: Sequence

Список псевдонимов, связанных с зарегистрированной моделью.

Каждый элемент в списке — это Alias:

Key Type Description
alias_name String Имя псевдонима, например "чемпион" или "latest_stable"
catalog_name String Имя каталога, содержащего версию модели
id String Уникальный идентификатор псевдонима
model_name String Имя зарегистрированной родительской модели версии модели относительно исходной схемы.
schema_name String Имя схемы, содержащей версию модели, относительно родительского каталога
version_num Integer Целочисленный номер версии модели, к которой указывает этот псевдоним.

Example

В следующем примере определяется зарегистрированная модель в каталоге Unity:

resources:
  registered_models:
    model:
      name: my_model
      catalog_name: ${bundle.target}
      schema_name: mlops_schema
      comment: Registered model in Unity Catalog for ${bundle.target} deployment target
      grants:
        - privileges:
            - EXECUTE
          principal: account users

схема (каталог Unity)

Type: Map

Схемы поддерживаются в Python для декларативных пакетов автоматизации. См. databricks.bundles.schemas.

Тип ресурса схемы позволяет определять схемы каталога Unity для таблиц и других ресурсов в рабочих процессах и конвейерах, созданных в составе пакета. Схема, отличная от других типов ресурсов, имеет следующие ограничения:

  • Владелец ресурса схемы всегда является пользователем развертывания и не может быть изменен. Если run_as указан в пакете, он будет игнорироваться операциями схемы.
  • Доступны только поля, поддерживаемые соответствующим объектом schemas create API для ресурса схемы. Например, enable_predictive_optimization не поддерживается, так как он доступен только в API обновления.
schemas:
  <schema-name>:
    <schema-field-name>: <schema-field-value>
Key Type Description
catalog_name String Имя родительского каталога.
comment String Описание текста свободной формы, предоставленное пользователем.
custom_max_retention_hours Integer Максимальный срок хранения — часы — для схемы.
Добавлено в версии Databricks CLI 1.5.0
grants Sequence Гранты, связанные с схемой. См.грант.
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
name String Имя схемы относительно родительского каталога.
properties Map Карта свойств key-value, присоединенных к схеме.
storage_root String URL-адрес корневого хранилища для управляемых таблиц в схеме.

Examples

В следующем примере определяется конвейер с ключом my_pipeline ресурса, который создает схему каталога Unity с ключом my_schema в качестве целевого объекта. В этом примере используются подстановки.

resources:
  pipelines:
    my_pipeline:
      name: test-pipeline
      libraries:
        - notebook:
            path: ../src/nb.ipynb
        - file:
            path: ../src/range.sql
      development: true
      catalog: ${resources.schemas.my_schema.catalog_name}
      target: ${resources.schemas.my_schema.id}

  schemas:
    my_schema:
      name: test-schema
      catalog_name: main
      comment: This schema was created by Declarative Automation Bundles.

Сопоставление грантов верхнего уровня не поддерживается декларативными пакетами автоматизации, поэтому если вы хотите задать гранты для схемы, определите гранты для схемы в сопоставлении schemas . Для получения дополнительной информации о правах доступа см. раздел Показать, предоставить и отозвать привилегии.

В следующем примере определяется схема каталога Unity с грантами:

resources:
  schemas:
    my_schema:
      name: test-schema
      grants:
        - principal: users
          privileges:
            - SELECT
        - principal: my_team
          privileges:
            - MANAGE
      catalog_name: main

секрет (Unity Catalog)

Type: Map

Секретный ресурс позволяет определить секрет, хранящийся в Unity Catalog. Секреты — это объекты трёхуровневого пространства имён (catalog.schema.secret), которые безопасно хранят чувствительные данные учетных данных, такие как пароли, токены и ключи.

Note

Использование декларативных автоматизированных пакетов для определения секретов поддерживается только при использовании движка прямого развертывания.

Добавлено в Databricks CLI версии 1.12.0

secrets:
  <secret-name>:
    <secret-field-name>: <secret-field-value>
Key Type Description
catalog_name String Обязательное. Название каталога, где хранятся схема и секрет.
Добавлено в Databricks CLI версии 1.12.0
comment String Пользовательское свободное текстовое описание секрета. Должно быть от 1 до 65536 символов.
Добавлено в Databricks CLI версии 1.12.0
expire_time String Срок действия секрета, предоставленный пользователем. Это поле указывает, когда секрет больше не следует использовать, и может отображаться как предупреждение в интерфейсе. Это чисто информационный характер и не вызывает автоматических действий и не влияет на жизненный цикл секрета.
Добавлено в Databricks CLI версии 1.12.0
grants Sequence Гранты для подачи заявки на этот секрет. См.грант.
Добавлено в Databricks CLI версии 1.12.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 1.12.0
name String Обязательное. Название секрета относительно её родительской схемы.
Добавлено в Databricks CLI версии 1.12.0
owner String Владелец секрета. По умолчанию используется принцип создания при созданиях. Можно обновить для передачи права собственности на секрет другому принципалу.
Добавлено в Databricks CLI версии 1.12.0
schema_name String Обязательное. Название схемы, где хранится секрет.
Добавлено в Databricks CLI версии 1.12.0
value String Обязательное. Секретная ценность для хранения. Это поле является только входным и не возвращается в ответах — используйте effective_value поле ( GetSecret через с include_value установленным в true) для чтения секретного значения. Максимальный размер — 60 КиБ (до шифрования). Допустимый контент включает пароли, жетоны, ключи и другие чувствительные данные учетных данных. Должно быть от 1 до 61440 символов.
Добавлено в Databricks CLI версии 1.12.0

Examples

Следующий пример определяет секрет Unity Catalog, значение которого предоставляется переменной bundle во время развертывания:

bundle:
  name: my-bundle

variables:
  my_secret_value:
    description: 'Secret value passed at deploy time'

resources:
  secrets:
    my_secret:
      catalog_name: main
      schema_name: default
      name: my_api_key
      value: ${var.my_secret_value}
      comment: 'API key for external service'

секретное_пространство

Type: Map

Ресурс secret_scope позволяет определять области секретов в пакете. Сведения о областях секретов см. в разделе "Управление секретами".

Добавлено в Databricks CLI версии 0.252.0

secret_scopes:
  <secret_scope-name>:
    <secret_scope-field-name>: <secret_scope-field-value>
Key Type Description
backend_type String Тип бэкенда, с использованием которого будет создана область. Если этот параметр не указан, по умолчанию будет использовано значение DATABRICKS.
Добавлено в Databricks CLI версии 0.252.0
keyvault_metadata Map Метаданные для секретной области, если backend_type — это AZURE_KEYVAULT. См. keyvault_metadata.
Добавлено в Databricks CLI версии 0.252.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
name String Имя области, запрашиваемое пользователем. Имена областей уникальны.
Добавлено в Databricks CLI версии 0.252.0
permissions Sequence Разрешения для применения к области секретного пространства. Разрешения управляются через ACL секретного масштаба, поэтому каждое group_name, user_name, или service_principal_name переводится в principal поле ACL. Допустимые уровни — READ, WRITEи MANAGE. Просмотр разрешений.
Добавлено в Databricks CLI версии 0.252.0

secret_scope.keyvault_metadata

Type: Map

Метаданные для областей секретов, поддерживаемых Azure Key Vault.

Key Type Description
resource_id String Идентификатор ресурса Azure Key Vault.
dns_name String DNS-имя Azure Key Vault.

Examples

В следующем примере определяется секретная область, которая использует бэкенд хранилища ключей.

resources:
  secret_scopes:
    secret_scope_azure:
      name: test-secrets-azure-backend
      backend_type: 'AZURE_KEYVAULT'
      keyvault_metadata:
        resource_id: my_azure_keyvault_id
        dns_name: my_azure_keyvault_dns_name

В следующем примере устанавливается пользовательский список управления доступом (ACL) с помощью областей секретов и разрешений.

resources:
  secret_scopes:
    my_secret_scope:
      name: my_secret_scope
      permissions:
        - user_name: admins
          level: WRITE
        - user_name: users
          level: READ

Пример пакета, демонстрирующий определение области секрета и задания с задачей, считывающей из него в пакете, см. в примерах bundle-examples GitHub репозитория.

SQL_хранилище

Type: Map

Ресурс хранилища SQL позволяет определить хранилище SQL в пакете. Дополнительные сведения о хранилищах SQL см. в разделе Хранилище Данных на Azure Databricks.

Добавлено в Databricks CLI версии 0.260.0

sql_warehouses:
  <sql-warehouse-name>:
    <sql-warehouse-field-name>: <sql-warehouse-field-value>
Key Type Description
auto_stop_mins Integer Время в минутах, в течение которых хранилище SQL должно быть бездействующим (например, без выполнения запросов), прежде чем оно будет остановлено автоматически. Допустимые значения — 0, что означает отсутствие автоостановки, или больше или равно 10 (классика/профессионал) или 1 (без сервера). По умолчанию 120 (классический/профессионал) и 10 (без сервера).
Добавлено в Databricks CLI версии 0.260.0
channel Map Сведения о канале. См. канал.
Добавлено в Databricks CLI версии 0.260.0
cluster_size String Размер кластеров, выделенных для этого хранилища. Увеличение размера кластера Spark позволяет выполнять в нем более крупные запросы. Если вы хотите увеличить число одновременных запросов, настройте max_num_clusters. Поддерживаемые значения см. в cluster_size.
Добавлено в Databricks CLI версии 0.260.0
creator_name String Имя пользователя, создавшего хранилище.
Добавлено в Databricks CLI версии 0.260.0
enable_photon Boolean Следует ли использовать оптимизированные для хранилища кластеры Photon. По умолчанию false.
Добавлено в Databricks CLI версии 0.260.0
enable_serverless_compute Boolean Следует ли использовать бессерверные вычислительные ресурсы хранилища.
Добавлено в Databricks CLI версии 0.260.0
instance_profile_arn String Deprecated. Профиль экземпляра, используемый для передачи роли IAM в кластер.
Добавлено в Databricks CLI версии 0.260.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
max_num_clusters Integer Максимальное количество кластеров, создаваемых автомасштабированием для обработки параллельных запросов. Значения должны быть меньше или равно 30 и больше или равно min_num_clusters. По умолчанию используется min_clusters, если не задано.
Добавлено в Databricks CLI версии 0.260.0
min_num_clusters Integer Минимальное количество доступных кластеров, которые будут поддерживаться для этого хранилища SQL. Увеличение этого параметра гарантирует, что будет всегда работать большее количество кластеров, и это может сократить время запуска новых запросов. Это аналогично зарезервированным ядрам и отзываемым ядрам в диспетчере ресурсов. Значения должны быть больше 0 и меньше или равно min(max_num_clusters, 30). По умолчанию равен 1.
Добавлено в Databricks CLI версии 0.260.0
name String Логическое имя кластера. Имя должно быть уникальным в пределах организации и менее 100 символов.
Добавлено в Databricks CLI версии 0.260.0
permissions Sequence Разрешения для применения к хранилищу. Просмотр разрешений.
Добавлено в Databricks CLI версии 0.260.0
spot_instance_policy String Следует ли использовать точечные экземпляры. Допустимые значения: POLICY_UNSPECIFIED, COST_OPTIMIZEDRELIABILITY_OPTIMIZED. Значение по умолчанию — COST_OPTIMIZED.
Добавлено в Databricks CLI версии 0.260.0
tags Map Набор пользовательских тегов для хранилища. См. раздел sql_warehouse.tags.
Добавлено в Databricks CLI версии 0.260.0
warehouse_type String Тип хранилища. Допустимые значения — PRO и CLASSIC. Если вы хотите использовать бессерверные вычисления, задайте для этого поля значение PRO, а также установите значение для поля enable_serverless_compute на true.
Добавлено в Databricks CLI версии 0.260.0

sql_warehouse.channel

Type: Map

Конфигурация канала для хранилища SQL.

Key Type Description
name String Имя канала. Допустимые значения: CHANNEL_NAME_CURRENT, CHANNEL_NAME_PREVIEWCHANNEL_NAME_CUSTOM.
dbsql_version String Версия DBSQL для пользовательских каналов.

sql_warehouse.теги

Type: Map

Настраиваемые теги для хранилища SQL.

Key Type Description
custom_tags Sequence Набор пар "ключ-значение", определяющих теги для всех ресурсов (например, экземпляров AWS и томов EBS), связанных с этим хранилищем SQL. Количество тегов должно быть меньше 45.

Example

В следующем примере определяется хранилище SQL:

resources:
  sql_warehouses:
    my_sql_warehouse:
      name: my_sql_warehouse
      cluster_size: X-Large
      enable_serverless_compute: true
      max_num_clusters: 3
      min_num_clusters: 1
      auto_stop_mins: 60
      warehouse_type: PRO
      tags:
        custom_tags:
          - key: 'bizunit'
            value: 'commercial'
          - key: 'area'
            value: 'marketing'

синхронизированная_таблица_базы_данных

Type: Map

Ресурс синхронизированной таблицы базы данных позволяет определять таблицы баз данных Lakebase в пакете.

Сведения о синхронизированных таблицах баз данных см. в разделе "Подготовленная база озера".

Добавлено в Databricks CLI версии 0.266.0

synced_database_tables:
  <synced_database_table-name>:
    <synced_database_table-field-name>: <synced_database_table-field-value>
Key Type Description
database_instance_name String Имя целевого экземпляра базы данных. Это необходимо при создании синхронизированных таблиц баз данных в стандартных каталогах. Это необязательно при создании синхронизированных таблиц баз данных в зарегистрированных каталогах; Если указано в этом случае, имя экземпляра базы данных должно совпадать с именем зарегистрированного каталога, иначе запрос отклоняется.
Добавлено в Databricks CLI версии 0.266.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
logical_database_name String Имя целевого объекта базы данных Postgres (логическая база данных) для этой таблицы.
При создании синхронизированной таблицы в зарегистрированном каталоге Postgres целевой базы данных Postgres предполагается как имя зарегистрированного каталога. Если в этом случае указано это поле, имя базы данных Postgres должно совпадать с именем зарегистрированного каталога, иначе запрос отклоняется.
При создании синхронизированной таблицы в стандартном каталоге требуется это поле, и его указание позволяет выбрать произвольную базу данных Postgres. Обратите внимание, что это имеет последствия для create_database_objects_if_missing поля в spec.
Добавлено в Databricks CLI версии 0.266.0
name String Обязательное. Полное имя таблицы в форме catalog.schema.table.
Добавлено в Databricks CLI версии 0.266.0
spec Map Спецификация таблицы базы данных. См. спецификацию синхронизированной таблицы базы данных.
Добавлено в Databricks CLI версии 0.266.0

synced_database_table.spec

Type: Map

Спецификация таблицы базы данных.

Добавлено в Databricks CLI версии 0.266.0

Key Type Description
create_database_objects_if_missing Boolean Следует ли создавать логическую базу данных и ресурсы схемы синхронизированной таблицы, если они еще не существуют.
existing_pipeline_id String Идентификатор существующего конвейера. Если это задано, синхронизированная таблица будет упакована в существующий конвейер, на который ссылается ссылка. Это позволяет избежать создания нового конвейера и позволяет совместно использовать существующие вычислительные ресурсы. В этом случае синхронизированная таблица scheduling_policy должна соответствовать политике планирования существующего конвейера. Не более одного из existing_pipeline_id и new_pipeline_spec должно быть определено.
new_pipeline_spec Map Спецификация нового конвейера. См. new_pipeline_spec. Не более одного из existing_pipeline_id и new_pipeline_spec должно быть определено.
primary_key_columns Sequence Список имен столбцов, формающих первичный ключ.
scheduling_policy String Политика планирования для синхронизации. Допустимые значения: SNAPSHOT, CONTINUOUSTRIGGERED.
source_table_full_name String Полное имя исходной таблицы в формате catalog.schema.table.
timeseries_key String Ключ для временных рядов для удаления дубликатов строк с одинаковым первичным ключом.

synced_database_table.spec.new_pipeline_spec

Type: Map

Спецификация нового конвейера, используемого синхронизированной таблицей базы данных.

Key Type Description
budget_policy_id String Идентификатор политики бюджета, заданной в только что созданном конвейере.
storage_catalog String Каталог для конвейера для хранения промежуточных файлов, таких как контрольные точки и журналы событий. Это должен быть стандартный каталог, в котором у пользователя есть разрешения на создание таблиц Delta.
storage_schema String Схема конвейера для хранения промежуточных файлов, таких как контрольные точки и журналы событий. Это должно быть в стандартном каталоге, где у пользователя есть разрешения на создание таблиц Delta.

Examples

В следующем примере определяется синхронизированная таблица базы данных в соответствующем каталоге баз данных:

resources:
  database_instances:
    my_instance:
      name: my-instance
      capacity: CU_1
  database_catalogs:
    my_catalog:
      database_instance_name: my-instance
      database_name: 'my_database'
      name: my_catalog
      create_database_if_not_exists: true
  synced_database_tables:
    my_synced_table:
      name: ${resources.database_catalogs.my_catalog.name}.${resources.database_catalogs.my_catalog.database_name}.my_destination_table
      database_instance_name: ${resources.database_catalogs.my_catalog.database_instance_name}
      logical_database_name: ${resources.database_catalogs.my_catalog.database_name}
      spec:
        source_table_full_name: 'my_source_table'
        scheduling_policy: SNAPSHOT
        primary_key_columns:
          - my_pk_column
        new_pipeline_spec:
          storage_catalog: 'my_delta_catalog'
          storage_schema: 'my_delta_schema'

В следующем примере определяется синхронизированная таблица базы данных в стандартном каталоге:

resources:
  synced_database_tables:
    my_synced_table:
      name: 'my_standard_catalog.public.synced_table'
      # database_instance_name is required for synced tables created in standard catalogs.
      database_instance_name: 'my-database-instance'
      # logical_database_name is required for synced tables created in standard catalogs:
      logical_database_name: ${resources.database_catalogs.my_catalog.database_name}
      spec:
        source_table_full_name: 'source_catalog.schema.table'
        scheduling_policy: SNAPSHOT
        primary_key_columns:
          - my_pk_column
        create_database_objects_if_missing: true
        new_pipeline_spec:
          storage_catalog: 'my_delta_catalog'
          storage_schema: 'my_delta_schema'

В этом примере создается синхронизированная таблица базы данных и настраивается расписание конвейера. Предполагается, что у вас уже есть:

  • Именованный экземпляр базы данных my-database-instance
  • Стандартный каталог с именем my_standard_catalog
  • Схема в стандартном каталоге с именем default
  • Исходная разностная таблица source_delta.schema.customer с первичным ключом c_custkey
resources:
  synced_database_tables:
    my_synced_table:
      name: 'my_standard_catalog.default.my_synced_table'
      database_instance_name: 'my-database-instance'
      logical_database_name: 'test_db'
      spec:
        source_table_full_name: 'source_delta.schema.customer'
        scheduling_policy: SNAPSHOT
        primary_key_columns:
          - c_custkey
        create_database_objects_if_missing: true
        new_pipeline_spec:
          storage_catalog: 'source_delta'
          storage_schema: 'schema'

  jobs:
    sync_pipeline_schedule_job:
      name: sync_pipeline_schedule_job
      description: 'Job to schedule synced database table pipeline.'
      tasks:
        - task_key: synced-table-pipeline
          pipeline_task:
            pipeline_id: ${resources.synced_database_tables.my_synced_table.data_synchronization_status.pipeline_id}
      schedule:
        quartz_cron_expression: '0 0 0 * * ?'

vector_search_endpoint

Type: Map

Ресурс vector_search_endpoint позволяет определять конечные точки поиска ИИ в пакете. Сведения о поиске ИИ см. в разделе Databricks AI Search.

Note

Использование декларативных пакетов автоматизации для определения конечных точек поиска векторов поддерживается только в том случае, если вы используете подсистему прямого развертывания.

Добавлено в Databricks CLI версии 0.298.0

vector_search_endpoints:
  <vector_search_endpoint-name>:
    <vector_search_endpoint-field-name>: <vector_search_endpoint-field-value>
Key Type Description
budget_policy_id String Идентификатор политики бюджета, используемой для этой конечной точки.
Добавлено в Databricks CLI версии 0.298.0
endpoint_type String Тип конечной точки. Допустимые значения — STORAGE_OPTIMIZED и STANDARD.
Добавлено в Databricks CLI версии 0.298.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.298.0
name String Имя конечной точки поиска ИИ.
Добавлено в Databricks CLI версии 0.298.0
permissions Sequence Разрешения для применения к конечной точке поиска ИИ. Допустимые уровни — CAN_CREATE, CAN_MANAGEи CAN_USE. Просмотр разрешений.
Добавлено в Databricks CLI версии 0.298.0
target_qps Integer Целевые запросы в секунду для конечной точки поиска ИИ. Взаимоисключающ с num_replicas. Фактическое количество реплик рассчитывается во время создания индекса или синхронизации на основе этого значения. Это цель для лучших усилий; система не гарантирует достижение этого QPS.
Добавлено в версии Databricks CLI 0.299.2

Example

В следующем примере определяется конечная точка поиска ИИ:

# databricks.yml
bundle:
  name: vector-search-example
  engine: direct # Vector Search requires the direct deployment engine

resources:
  vector_search_endpoints:
    my_vector_search_endpoint:
      name: my_vector_search_endpoint
      endpoint_type: STANDARD

vector_search_index

Type: Map

Ресурс vector_search_index позволяет определять индексы векторного поиска в пакете. Сведения о поиске векторов см. в разделе Databricks AI Search.

Добавлено в Databricks CLI версии 1.1.0

vector_search_indexes:
  <vector_search_index-name>:
    <vector_search_index-field-name>: <vector_search_index-field-value>
Key Type Description
delta_sync_index_spec Map Спецификация индекса разностной синхронизации. Обязательный параметр, если index_type имеет значение DELTA_SYNC. См . раздел vector_search_index.delta_sync_index_spec.
Добавлено в Databricks CLI версии 1.1.0
direct_access_index_spec Map Спецификация индекса прямого векторного доступа. Обязательный параметр, если index_type имеет значение DIRECT_ACCESS. См . раздел vector_search_index.direct_access_index_spec.
Добавлено в Databricks CLI версии 1.1.0
endpoint_name String Обязательное. Имя конечной точки, используемой для обслуживания индекса.
Добавлено в Databricks CLI версии 1.1.0
grants Sequence Гранты, связанные с индексом векторного поиска. См.грант.
Добавлено в Databricks CLI версии 1.1.0
index_subtype String (бета-версия) Подтип индекса. Допустимые значения — HYBRID и FULL_TEXT. Функция VECTOR не поддерживается.
Добавлено в Databricks CLI версии 1.1.0
index_type String Обязательное. Тип индекса. Допустимые значения:
  • DELTA_SYNC: индекс, который автоматически синхронизируется с исходной разностной таблицей, автоматически и добавочно обновляя индекс в виде изменений базовых данных.
  • DIRECT_ACCESS: индекс, поддерживающий прямое чтение и запись векторов и метаданных через API REST и SDK. С помощью этой модели пользователь управляет обновлениями индекса. Добавлено в Databricks CLI версии 1.1.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 1.1.0
name String Обязательное. Имя индекса.
Добавлено в Databricks CLI версии 1.1.0
primary_key String Обязательное. Первичный ключ индекса.
Добавлено в Databricks CLI версии 1.1.0

vector_search_index.delta_sync_index_spec

Type: Map

Спецификация индекса разностной синхронизации.

Добавлено в Databricks CLI версии 1.1.0

Key Type Description
columns_to_index Sequence Необязательно. Псевдоним для columns_to_sync. Выберите столбцы, которые необходимо включить в векторный индекс. Если это поле пусто, все столбцы из исходной таблицы включаются. Столбец первичного ключа и вставка исходного столбца или встраивающего векторного столбца всегда включаются. Указать только один из columns_to_sync них или columns_to_index может быть указан.
columns_to_sync Sequence Необязательно. Выберите столбцы для синхронизации с векторным индексом. Если это поле пусто, все столбцы из исходной таблицы синхронизируются с индексом. Столбец первичного ключа и столбец источника встраивания или столбец встраиваемого вектора всегда синхронизированы.
embedding_source_columns Sequence Столбцы, содержащие источник внедрения.
embedding_vector_columns Sequence Столбцы, содержащие векторы внедрения.
embedding_writeback_table String Необязательно. Имя таблицы Delta для синхронизации содержимого векторного индекса и вычисляемых внедрения.
pipeline_type String Режим выполнения конвейера. Допустимые значения:
  • TRIGGERED: система останавливает обработку после успешного обновления исходной таблицы в конвейере один раз, обеспечивая обновление таблицы на основе данных, доступных при запуске обновления.
  • CONTINUOUS: конвейер обрабатывает новые данные по мере поступления в исходную таблицу, чтобы сохранить векторный индекс свежим.
source_table String Имя исходной таблицы.

vector_search_index.direct_access_index_spec

Type: Map

Спецификация индекса прямого векторного доступа.

Добавлено в Databricks CLI версии 1.1.0

Key Type Description
embedding_source_columns Sequence Столбцы, содержащие источник внедрения. Его необходимо указать в формате array[double].
embedding_vector_columns Sequence Столбцы, содержащие векторы внедрения. Его необходимо указать в формате array[double].
schema_json String Схема индекса в формате JSON. Поддерживаемые типы: integer, long, floatdoublebooleanstring, . datetimestamp Поддерживаемые типы для векторных столбцов: array<float>, array<double>.

Example

В следующем примере определяется индекс векторного поиска Delta Sync:

resources:
  vector_search_endpoints:
    my_endpoint:
      name: my-endpoint
      endpoint_type: STANDARD
  vector_search_indexes:
    my_index:
      name: main.default.my_index
      endpoint_name: ${resources.vector_search_endpoints.my_endpoint.name}
      primary_key: id
      index_type: DELTA_SYNC
      delta_sync_index_spec:
        source_table: main.default.source
        pipeline_type: TRIGGERED
      grants:
        - principal: data-engineers
          privileges: [SELECT]

том (каталог Unity)

Type: Map

Тома поддерживаются в Python для декларативных пакетов автоматизации. См. databricks.bundles.volumes.

Тип ресурса тома позволяет определять и создавать тома каталога Unity как часть пакета. При развертывании пакета с определенным томом обратите внимание на следующее:

  • Нельзя ссылаться на том в artifact_path пакета, пока он не будет существовать в рабочей области. Поэтому, если вы хотите использовать декларативные пакеты автоматизации для создания тома, сначала необходимо определить том в пакете, развернуть его для создания тома, а затем ссылаться на него в artifact_path последующих развертываниях.
  • Тома в наборе не получают префикс dev_${workspace.current_user.short_name}, если для целевого объекта развертывания настроен mode: development. Однако этот префикс можно настроить вручную. См. пользовательские предустановки.

Добавлено в Databricks CLI версии 0.236.0

volumes:
  <volume-name>:
    <volume-field-name>: <volume-field-value>
Key Type Description
catalog_name String Имя каталога схем и томов.
Добавлено в Databricks CLI версии 0.236.0
comment String Комментарий, прикрепленный к тому.
Добавлено в Databricks CLI версии 0.236.0
grants Sequence Гранты, связанные с томом. См.грант.
Добавлено в Databricks CLI версии 0.236.0
lifecycle Map Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении. См. жизненный цикл.
Добавлено в Databricks CLI версии 0.268.0
name String Имя тома.
Добавлено в Databricks CLI версии 0.236.0
schema_name String Имя схемы, в которой находится том.
Добавлено в Databricks CLI версии 0.236.0
storage_location String Расположение хранилища в облаке.
Добавлено в Databricks CLI версии 0.236.0
volume_type String Тип тома, либо EXTERNAL, или MANAGED. Внешний том находится в указанном внешнем расположении. Управляемый том находится в расположении по умолчанию, указанном родительской схемой, родительским каталогом или хранилищем метаданных. См. раздел "Управляемые и внешние тома".

Example

В следующем примере создается том каталога Unity с ключом my_volume_id:

resources:
  volumes:
    my_volume_id:
      catalog_name: main
      name: my_volume
      schema_name: my_schema

Пример пакета, выполняющего задание, записываемое в файл в томе каталога Unity, см. в разделе bundle-examples GitHub репозиторий.

Общие объекты

грант

Type: Map

Определяет субъект и привилегии для предоставления этому субъекту. Для получения дополнительной информации о правах доступа см. раздел Показать, предоставить и отозвать привилегии.

Key Type Description
principal String Имя субъекта, которому будут предоставлены привилегии. Это может быть пользователь, группа или субъект-служба.
privileges Sequence Привилегии, которые нужно предоставить указанному объекту. Допустимые значения зависят от типа ресурса (например, SELECT, MODIFY, CREATEUSAGE, , READ_FILES, WRITE_FILES. EXECUTEALL_PRIVILEGES

Example

В следующем примере определяется схема каталога Unity с грантами:

resources:
  schemas:
    my_schema:
      name: test-schema
      grants:
        - principal: users
          privileges:
            - SELECT
        - principal: my_team
          privileges:
            - MANAGE
      catalog_name: main

жизненный цикл

Type: Map

Содержит параметры жизненного цикла ресурса. Он управляет поведением ресурса при развертывании или уничтожении.

Добавлено в Databricks CLI версии 0.268.0

Key Type Description
prevent_destroy Boolean Параметр жизненного цикла, чтобы предотвратить уничтожение ресурса.
Добавлено в Databricks CLI версии 0.268.0
started Boolean Параметр жизненного цикла для развертывания ресурса в режиме запуска. Поддерживается только для приложений, кластеров и sql_warehouses в режиме прямого развертывания.
Добавлено в Databricks CLI версии 0.297.0 (приложения)
Добавлено в Интерфейс командной строки Databricks версии 1.1.0 (кластеры)
Добавлено в Databricks CLI версии 1.2.0 (sql_warehouses)