Deklarativa Automation-paketresurser

Med deklarativa Automation-paket (kallades tidigare Databricks-tillgångspaket) kan du ange information om de Azure Databricks resurser som används av paketet i mappningen resources i paketkonfigurationen. Se resursreferens.

Den här sidan innehåller konfigurationsreferens för alla resurstyper som stöds för paket och innehåller information och ett exempel för varje typ som stöds. Ytterligare exempel finns i Exempel på paketkonfiguration.

JSON-schemat för paket som används för att verifiera YAML-konfigurationen finns i Databricks CLI GitHub-lagringsplatsen.

Tip

Om du vill generera YAML för alla befintliga resurser använder du kommandot databricks bundle generate. Se generera databricks-paket.

resurser som stöds

I följande tabell visas resurstyper som stöds för paket (YAML och Python, om tillämpligt). Vissa resurser kan skapas genom att definiera dem i ett paket och distribuera paketet, och vissa resurser kan bara skapas genom att referera till en befintlig tillgång som ska ingå i paketet.

Resurskonfiguration definierar ett Databricks-objekt som motsvarar ett Databricks REST API-objekt . REST API-objektets fält som stöds för att skapa begäranden, uttryckt som YAML, är de nycklar som resursen stöder. Länkar till dokumentationen för varje resurs motsvarande objekt finns i tabellen nedan.

Tip

Kommandot databricks bundle validate returnerar varningar om okända resursegenskaper finns i paketkonfigurationsfiler.

Resource Python stöd Motsvarande REST API-objekt
alert Aviseringsobjekt
app Appobjekt
katalog (Unity Catalog) Katalogobjekt
cluster Klusterobjekt
dashboard instrumentpanelsobjekt
database_catalog Databaskatalogobjekt
database_instance Databasinstansobjekt
experiment Experimentobjekt
external_location (Unity-katalogen) Objekt för extern plats
genie_spaces Genie-agenter
instance_pool Instanspoolobjekt
job jobb jobbobjekt
job_run Jobb-körobjekt
modell (äldre) Modellobjekt (äldre)
model_serving_endpoint Modell som betjänar slutpunktsobjekt
pipeline Pipelines Pipeline-objekt
postgres_branch Postgres-grenobjekt
postgres_catalog Postgres-katalogobjekt
postgres_database Postgres-databasobjekt
postgres_endpoint Postgres-slutpunktsobjekt för beräkning
postgres_project Postgres-projektobjekt
postgres_role Postgres-rollobjekt
postgres_synced_table Postgres-synkroniserat tabellobjekt
quality_monitor Kvalitetsövervakarobjekt
registrerad_modell (Unity Catalog) Registrerat modellobjekt
schema (Unity-katalogen) Scheman Schemaobjekt
hemlig (Unity-katalogen) Hemligt föremål
secret_scope Hemligt omfångsobjekt
sql_warehouse SQL-lagerobjekt
synkroniserad_databas_tabell Synkroniserat databastabellobjekt
vector_search_endpoint SLUTpunktsobjekt för AI-sökning
vector_search_index Indexobjekt för vektorsökning
volym (Unity Catalog) Volumes Volymobjekt

varning

Type: Map

Aviseringsresursen definierar en SQL-avisering (v2).

Har lagts till i Databricks CLI version 0.279.0

alerts:
  <alert-name>:
    <alert-field-name>: <alert-field-value>
Key Type Description
custom_description String Valfritt. Anpassad beskrivning för aviseringen. Stödjer mustache-mall.
Har lagts till i Databricks CLI version 0.279.0
custom_summary String Valfritt. Anpassad sammanfattning för aviseringen. Stödjer mustache-mall.
Har lagts till i Databricks CLI version 0.279.0
display_name String Obligatoriskt. Visningsnamnet för aviseringen, till exempel Example alert.
Har lagts till i Databricks CLI version 0.279.0
evaluation Map Obligatoriskt. Utvärderingskonfigurationen för aviseringen. Se alert.evaluation.
Har lagts till i Databricks CLI version 0.279.0
file_path String Den lokala filsökvägen för aviseringstillgången.
Har lagts till i Databricks CLI version 0.282.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.279.0
parent_path String Valfritt. Sökvägen till arbetsytan för mappen som innehåller aviseringen. Kan bara ställas in vid skapande och kan inte uppdateras. Exempel: /Users/someone@example.com.
Har lagts till i Databricks CLI version 0.279.0
permissions Sequence Aviseringsbehörigheterna. Se behörigheter.
Har lagts till i Databricks CLI version 0.279.0
query_text String Obligatoriskt. Text för frågan som ska köras, till exempel SELECT 1.
Har lagts till i Databricks CLI version 0.279.0
run_as Map Valfritt. Anger den identitet som ska användas för att köra aviseringen. Med det här fältet kan du konfigurera aviseringar så att de körs som en specifik användare eller tjänstens huvudnamn. Se run_as.
  • För användaridentitet: Ange user_name till e-post för en aktiv arbetsyteanvändare. Användare kan bara ange detta till sin egen e-post.
  • För tjänstens huvudnamn: Ange service_principal_name till program-ID. Kräver rollen som servicePrincipal/user. Om det inte anges körs aviseringen som begärandeanvändare.

Har lagts till i Databricks CLI version 0.279.0
schedule Map Obligatoriskt. Schemakonfigurationen för aviseringen. Se alert.schedule.
Har lagts till i Databricks CLI version 0.279.0
warehouse_id String Obligatoriskt. ID för DET SQL-lager som är kopplat till aviseringen, a7066a8ef796be84till exempel .
Har lagts till i Databricks CLI version 0.279.0

alert.utvärdering

Type: Map

Utvärderingskonfigurationen för aviseringen.

Key Type Description
comparison_operator String Operatorn som används för jämförelse i aviseringsutvärderingen.
empty_result_state String Varningsläget om resultatet är tomt. Undvik att ställa in det här fältet till UNKNOWN eftersom UNKNOWN tillstånd planeras att bli inaktuellt.
notification Map Användaren eller annan mottagare som ska meddelas när aviseringen utlöses. Se alert.evaluation.notification.
source Map Källkolumnen från resultatet som ska användas för att utvärdera aviseringen. Se alert.evaluation.source.
threshold Map Tröskelvärdet som ska användas för aviseringsutvärdering. Det kan vara en kolumn eller ett värde. Se alert.evaluation.threshold.

varning.utvärdering.notifiering

Type: Map

Användaren eller annan mottagare som ska meddelas när aviseringen utlöses.

Key Type Description
notify_on_ok Boolean Valfritt. Om aviseringsprenumeranter ska meddelas när aviseringen återgår till det normala.
retrigger_seconds Integer Valfritt. Antal sekunder som en avisering väntar efter att ha utlösts innan en annan avisering kan skickas. Om den är inställd på 0 eller utelämnas skickar aviseringen inga ytterligare meddelanden efter den första utlösaren. Inställning av det här värdet till 1 gör att aviseringen kan skicka ett meddelande vid varje utvärdering där villkoret uppfylls, vilket effektivt gör att det alltid kan återaktiveras för meddelandesyfte.
subscriptions Sequence Valfritt. Osorterad lista över meddelandeprenumerationer. Se alert.evaluation.notification.subscriptions.
varning.utvärdering.notifikation.prenumerationer

Type: Sequence

En osorterad lista över meddelandeprenumerationer.

Varje objekt i listan är :AlertSubscription

Key Type Description
destination_id String ID för meddelandemålet.
user_email String E-postadressen till användaren som ska meddelas.

varning.utvärdering.källa

Type: Map

Källkolumnen från resultatet som ska användas för att utvärdera aviseringen.

Key Type Description
aggregation String Aggregeringsmetoden som ska tillämpas på källkolumnen. Giltiga värden är SUM, COUNT, COUNT_DISTINCT, AVG, MEDIAN, MIN, , , MAXSTDDEV
display String Visningsnamnet för källkolumnen.
name String Namnet på källkolumnen från frågeresultatet.

varning.utvärdering.gränsvärde

Type: Map

Tröskelvärde som ska användas för aviseringsutvärdering kan vara en kolumn eller ett värde.

Key Type Description
column Map Kolumnreferens som ska användas som tröskelvärde. Se alert.evaluation.source.
value Map Literalvärde som ska användas som tröskelvärde. Se alert.evaluation.threshold.value.
varning.utvärdering.tröskelvärde.värde

Type: Map

Literalvärde som ska användas som tröskelvärde. Ange någon av följande värdetyper.

Key Type Description
bool_value Boolean Valfritt. Booleskt värde för tröskelvärdet, truetill exempel .
double_value Double Valfritt. Numeriskt värde för tröskelvärdet, 1.25till exempel .
string_value String Valfritt. Strängvärde för tröskelvärdet, till exempel test.

larm.tidsplan

Type: Map

Schemakonfigurationen för aviseringen.

Key Type Description
pause_status String Valfritt. Om schemat är pausat eller inte. Giltiga värden: UNPAUSED, PAUSED. Förvald: UNPAUSED.
quartz_cron_schedule String Obligatoriskt. Ett cron-uttryck med hjälp av kvartssyntax som anger schemat för den här pipelinen. Kvartformatet beskrivs i quartz scheduler-format.
timezone_id String Obligatoriskt. Ett Java tidszons-ID. Schemat löses med den här tidszonen. Detta kombineras med quartz_cron_schedule för att fastställa schemat. Se SET TIME ZONE för mer information.

Examples

I följande exempelkonfiguration definieras en avisering med en enkel utvärdering:

resources:
  alerts:
    my_alert:
      display_name: my_alert
      evaluation:
        comparison_operator: EQUAL
        source:
          name: '1'
        threshold:
          value:
            double_value: 2
      query_text: select 2
      schedule:
        quartz_cron_schedule: '44 19 */1 * * ?'
        timezone_id: Europe/Amsterdam
      warehouse_id: 799f096837fzzzz4

I följande exempelkonfiguration definieras en avisering med behörigheter som utvärderas med aggregering och skickar meddelanden:

resources:
  alerts:
    my_alert:
      permissions:
        - level: CAN_MANAGE
          user_name: someone@example.com
      custom_summary: 'My alert'
      display_name: 'My alert'
      evaluation:
        comparison_operator: 'EQUAL'
        notification:
          notify_on_ok: false
          retrigger_seconds: 1
        source:
          aggregation: 'MAX'
          display: '1'
          name: '1'
        threshold:
          value:
            double_value: 2
      query_text: 'select 2'
      schedule:
        pause_status: 'UNPAUSED'
        quartz_cron_schedule: '44 19 */1 * * ?'
        timezone_id: 'Europe/Amsterdam'
      warehouse_id: 799f096837fzzzz4

applikation

Type: Map

Appresursen definierar en Databricks-app. Information om Databricks-appar finns i Databricks-appar.

Om du vill lägga till en app anger du inställningarna för att definiera appen, inklusive nödvändiga source_code_path.

Tip

Du kan initiera ett paket med en Streamlit Databricks-app med hjälp av följande kommando:

databricks bundle init https://github.com/databricks/bundle-examples --template-dir contrib/templates/streamlit-app

Har lagts till i Databricks CLI version 0.239.0

apps:
  <app-name>:
    <app-field-name>: <app-field-value>
Key Type Description
budget_policy_id String ID för budgetpolicy för appen.
Har lagts till i Databricks CLI version 0.243.0
compute_size String Appens beräkningsstorlek. Giltiga värden är MEDIUM, LARGE, eller XLARGE men beror på konfigurationen av arbetsytan.
Har lagts till i Databricks CLI version 0.273.0
config Map Appkonfigurationskommandon och miljövariabler. Se app.config.
Har lagts till i Databricks CLI version 0.283.0
description String Beskrivningen av appen.
Har lagts till i Databricks CLI version 0.239.0
git_repository Map Konfigurationen av Git-lagringsplatsen för appdistributioner. När det anges kan distributioner referera till kod från den här lagringsplatsen genom att endast tillhandahålla git-referensen (gren, tagg eller incheckning). Se app.git_repository.
Har lagts till i Databricks CLI version 0.283.0
git_source Map Git-källkonfigurationen för appdistributioner. Anger vilken Git-referens (gren, tagg eller incheckning) som ska användas när appen distribueras. Används tillsammans med git_repository för att distribuera kod direkt från git. source_code_path Inom git_source anger den relativa sökvägen till appkoden på lagringsplatsen. Se app.git_source.
Har lagts till i Databricks CLI version 0.290.0
lifecycle Map Beteendet för resursen när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
name String Namnet på appen. Namnet får endast innehålla alfanumeriska gemener och bindestreck. Den måste vara unik inom arbetsytan.
Har lagts till i Databricks CLI version 0.239.0
permissions Sequence Appens behörigheter. Se behörigheter.
Har lagts till i Databricks CLI version 0.239.0
resources Sequence Appens beräkningsresurser. Se app.resources.
Har lagts till i Databricks CLI version 0.239.0
source_code_path String Den ./app lokala sökvägen till Databricks-appens källkod.
Har lagts till i Databricks CLI version 0.239.0
telemetry_export_destinations Sequence Telemetriexportmålen för appen. Se app.telemetry_export_destinations.
Har lagts till i Databricks CLI version 0.294.0
usage_policy_id String ID för den serverlösa användningsprincip som ska användas för den här appen.
Har lagts till i Databricks CLI version 0.283.0
user_api_scopes Sequence Omfång för användar-API:et.
Har lagts till i Databricks CLI version 0.246.0

app.config

Appkonfigurationskommandon och miljövariabler. Se Konfigurera Databricks-appens körning med app.yaml.

Key Type Description
command Sequence Kommandona för att köra appen, till exempel ["streamlit", "run", "app.py"]
env Sequence En lista över name och value par som anger appmiljövariabler som ska anges i appkörningsmiljön. Detta åsidosätter miljövariablerna som anges i filen app.yaml. Information om standardvariabler för appmiljöer finns i Databricks Apps-miljön.
Miljövariabler anges inte förrän appen har startats.

app.git_repository

Type: Map

Konfigurationen av Git-lagringsplatsen som anger platsen för lagringsplatsen.

Key Type Description
provider String Obligatoriskt. Git-provider. Skiftlägesokänsligt. Värden som stöds: gitHub, gitHubEnterprise, bitbucketCloud, bitbucketServer, azureDevOpsServices, gitLab, gitLabEnterpriseEdition, awsCodeCommit.
Har lagts till i Databricks CLI version 0.283.0
url String Obligatoriskt. URL för Git-lagringsplatsen.
Har lagts till i Databricks CLI version 0.283.0

app.git_source

Type: Map

Git-källkonfigurationen för appdistributioner.

Key Type Description
branch String Git-grenen som ska checkas ut.
commit String Git-inchecknings-SHA:en som ska checkas ut.
source_code_path String Relativ sökväg till appens källkod på Git-lagringsplatsen. Om det inte anges används lagringsplatsens rot.
tag String Git-taggen som ska checkas ut.

app.resurser

Type: Sequence

En lista över beräkningsresurser för appen.

Varje objekt i listan är :AppResource

Key Type Description
app Map Appnamn och behörigheter
description String Beskrivningen av appresursen.
database Map Inställningarna som identifierar lakebase-etableringsdatabasen som ska användas. Se app.resources.database.
experiment Map Inställningarna som identifierar MLflow-experimentet som ska användas. Se app.resources.experiment.
genie_space Map De inställningar som identifierar genie-agenten som ska användas. Se app.resources.genie_space.
job Map Inställningarna som identifierar jobbresursen som ska användas. Se app.resources.job.
name String Namnet på appresursen.
postgres Map Inställningarna som identifierar den Lakebase Autoscaling-databas som ska användas. Se app.resources.postgres.
secret Map Inställningarna som identifierar den Azure Databricks hemliga resurs som ska användas. Se app.resources.secret.
serving_endpoint Map Inställningarna som identifierar den modell som betjänar slutpunktsresursen som ska användas. Se app.resources.serving_endpoint.
sql_warehouse Map Inställningarna som identifierar den SQL-lagerresurs som ska användas. Se app.resources.sql_warehouse.
uc_securable Map De inställningar som identifierar unity-katalogen som kan användas. Se app.resources.uc_securable.

app.resurser.databas

Type: Map

Inställningarna som identifierar den Lakebase-databas som ska användas.

Key Type Description
database_name String Namnet på databasen.
instance_name String Namnet på databasinstansen.
permission String Behörighetsnivån för databasen. Giltiga värden är CAN_CONNECT_AND_CREATE.

app.resources.experiment

Type: Map

Inställningarna som identifierar MLflow-experimentet som ska användas.

Key Type Description
experiment_id String ID för MLflow-experimentet.
permission String Behörighetsnivån för experimentet. Giltiga värden är CAN_READ, CAN_EDIT, CAN_MANAGE.

app.resurser.genie_space

Type: Map

De inställningar som identifierar genie-agenten som ska användas.

Key Type Description
name String Namnet på Genie-agenten.
permission String Behörighetsnivån för utrymmet. Giltiga värden är CAN_VIEW, CAN_EDIT, CAN_MANAGE, CAN_RUN.
space_id String ID:t för Genie-agenten, till exempel 550e8400-e29b-41d4-a716-999955440000.

app.resources.job

Type: Map

Inställningarna som identifierar jobbresursen som ska användas.

Key Type Description
id String Jobbets ID.
permission String Behörighetsnivån för jobbet. Giltiga värden är CAN_VIEW, CAN_MANAGE_RUN, CAN_MANAGE, IS_OWNER.

app.resources.postgres

Type: Map

Inställningarna som identifierar den Lakebase Autoscaling-databas som ska användas.

Key Type Description
branch String Namnet på grenen, till exempel projects/proj-abc123/branches/branch-xyz789.
database String Namnet på databasinstansen, till exempel projects/proj-abc123/branches/branch-xyz789/databases/db-456.
permission String Behörighetsnivån för databasen. Giltiga värden är CAN_CONNECT_AND_CREATE.

app.resurser.secret

Type: Map

Inställningarna som identifierar den Azure Databricks hemliga resurs som ska användas.

Key Type Description
key String Hemlighetens nyckel för att bevilja behörighet.
permission String Behörighetsnivån för hemligheten. Giltiga värden är READ, WRITE, MANAGE.
scope String Namnet på den hemliga domänen.

app.resources .betjäningsändpunkt

Type: Map

Inställningarna som identifierar den modell som betjänar slutpunktsresursen som ska användas.

Key Type Description
name String Namnet på tjänsteslutpunkten.
permission String Behörighetsnivån för tjänsteslutpunkten. Giltiga värden är CAN_QUERY, CAN_MANAGE, CAN_VIEW.

app.resurser.sql_lager

Type: Map

Inställningarna som identifierar det SQL-lager som ska användas.

Key Type Description
id String ID:t för SQL-lagret.
permission String Behörighetsnivån för SQL-lagret. Giltiga värden är CAN_USE, CAN_MANAGE, IS_OWNER.

app.resources.uc_securable

Type: Map

De inställningar som identifierar unity-katalogen som kan användas. Appar stöder volymer, tabeller, funktioner och anslutningar som skyddsbara resurser.

Key Type Description
permission String Behörighetsnivån för unity-katalogen som kan säkras. Giltiga värden beror på securable_type:
  • VOLUME: , READ_VOLUMEWRITE_VOLUME
  • TABLE: , SELECTMODIFY
  • FUNCTION: EXECUTE
  • CONNECTION: USE_CONNECTION
securable_full_name String Det fullständiga namnet på unity-katalogen som kan säkras i formatet catalog.schema.name. Använd anslutningsnamnet för en anslutning.
securable_type String Typen av Unity-katalog som kan säkras. Giltiga värden är VOLUME, TABLE, FUNCTIONoch CONNECTION.

Note

För volymer, tabeller och funktioner behöver USE CATALOG även appens tjänsthuvudnamn och USE SCHEMA behörigheter i den överordnade katalogen och schemat. Azure Databricks beviljar dessa privilegier automatiskt när du lägger till skyddsbara som en appresurs.

app.telemetry_export_destinations

Type: Sequence

En lista över telemetriexportmål för appen.

Har lagts till i Databricks CLI version 0.294.0

Varje objekt i listan är :AppTelemetryExportDestination

Key Type Description
unity_catalog Map Unity Catalog-mål för OTEL-telemetriexport.
Har lagts till i Databricks CLI version 0.294.0

Examples

En självstudiekurs som beskriver hur du skapar ett paket som definierar en app finns i Hantera Databricks-appar med deklarativa Automation-paket.

I följande exempel definieras en grundläggande app:

resources:
  apps:
    hello_world_app:
      name: 'hello-world-app'
      source_code_path: . # This assumes the app source code is at the root of the project.
      description: 'A Databricks app'

I följande exempel skapas en app med namnet my_app som hanterar ett jobb som skapats av paketet. Det fullständiga exemplet finns i bundle-examples GitHub repository.

resources:
  jobs:
    # Define a job in the bundle
    hello_world:
      name: hello_world
      tasks:
        - task_key: task
          spark_python_task:
            python_file: ../src/main.py
          environment_key: default

      environments:
        - environment_key: default
          spec:
            environment_version: '2'

  # Define an app that manages the job in the bundle
  apps:
    job_manager:
      name: 'job_manager_app'
      description: 'An app which manages a job created by this bundle'

      # The location of the source code for the app
      source_code_path: ../src/app

      # The resources in the bundle which this app has access to. This binds the resource in the app with the bundle resource.
      resources:
        - name: 'app-job'
          job:
            id: ${resources.jobs.hello_world.id}
            permission: 'CAN_MANAGE_RUN'

Motsvarande app.yaml definierar konfigurationen för att köra appen:

command:
  - flask
  - --app
  - app
  - run
  - --debug
env:
  - name: JOB_ID
    valueFrom: 'app-job'

I följande exempel skapas en app som har åtkomst till ett MLflow-experiment som skapats av paketet:

resources:
  experiments:
    # Define an MLflow experiment in the bundle
    my_experiment:
      name: /Users/${workspace.current_user.userName}/my-app-experiment

  apps:
    my_ml_app:
      name: 'my-ml-app'
      description: 'An app with access to an MLflow experiment'
      source_code_path: ./app

      # Grant the app access to the MLflow experiment
      resources:
        - name: 'app-experiment'
          experiment:
            experiment_id: ${resources.experiments.my_experiment.id}
            permission: 'CAN_MANAGE'

Alternativt definierar följande exempel en app med anpassad konfiguration som definierats i paketkonfigurationen:

resources:
  apps:
    my_app:
      name: my_app
      description: my_app_description
      source_code_path: ./app
      config:
        command: ['flask', '--app', 'app', 'run']
        env:
          - name: MY_ENV_VAR
            value: test_value
          - name: ANOTHER_VAR
            value: another_value

I följande exempel definieras en app med en Lakebase Autoscaling-resurs:

resources:
  apps:
    my_app:
      name: my-app
      source_code_path: .
      resources:
        - name: lakebase-db
          postgres:
            branch: projects/my-app/branches/production
            database: projects/my-app/branches/production/databases/db-xxxx-yyyyyyyy
            permission: CAN_CONNECT_AND_CREATE

catalogs

Type: Map

Med katalogresursen kan du definiera kataloger (Unity Catalog) i ett paket.

Note

Du kan bara använda deklarativa Automation-paket för att definiera kataloger om du använder direktdistributionsmotorn.

Har lagts till i Databricks CLI version 0.287.0

catalogs:
  <catalog-name>:
    <catalog-field-name>: <catalog-field-value>
Key Type Description
comment String En beskrivning av katalogens friformatstext som tillhandahålls av användaren.
Har lagts till i Databricks CLI version 0.287.0
connection_name String Namnet på anslutningen till en extern datakälla.
Har lagts till i Databricks CLI version 0.287.0
custom_max_retention_hours Integer Den anpassade maximala lagringstiden, i timmar, för katalogen.
Tillagd i Databricks CLI version 1.5.0
grants Sequence De bidrag som är associerade med katalogen. Se bidrag.
Har lagts till i Databricks CLI version 0.287.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.287.0
managed_encryption_settings Map Kontrollera CMK-kryptering för hanterade katalogdata. Se catalog.managed_encryption_settings.
Har lagts till i Databricks CLI version 0.298.0
name String Obligatoriskt. Namnet på katalogen.
Har lagts till i Databricks CLI version 0.287.0
options Object En karta över nyckel/värde-egenskaper som är kopplade till det säkra.
Har lagts till i Databricks CLI version 0.287.0
properties Object En karta över nyckel/värde-egenskaper som är kopplade till det säkra.
Har lagts till i Databricks CLI version 0.287.0
provider_name String Namnet på OpenSharing-providern. En OpenSharing-katalog är en katalog som baseras på en OpenSharing-resurs på en fjärrdelningsserver. Se Vad är OpenSharing?.
Har lagts till i Databricks CLI version 0.287.0
share_name String Namnet på resursen under resursprovidern.
Har lagts till i Databricks CLI version 0.287.0
storage_root String Lagringsrot-URL:en för hanterade tabeller i katalogen.
Har lagts till i Databricks CLI version 0.287.0

Example

# databricks.yml
bundle:
  name: catalogs-example
  engine: direct # catalogs require the direct deployment engine

resources:
  catalogs:
    my_catalog:
      name: my_catalog
      comment: 'Catalog created by Declarative Automation Bundles'
      properties:
        purpose: 'Testing'
      grants:
        - principal: someone@example.com
          privileges:
            - USE_CATALOG
            - CREATE_SCHEMA

  schemas:
    my_schema:
      name: my_schema
      catalog_name: ${resources.catalogs.my_catalog.name}
      comment: 'Schema in custom catalog'

catalog.managed_encryption_settings

Type: Map

Krypteringsinställningar för hanterade katalogdata. Används för att konfigurera en kundhanterad nyckel (CMK).

Har lagts till i Databricks CLI version 0.298.0

Key Type Description
azure_encryption_settings Map Valfria Azure inställningar – krävs endast om en Azure CMK används.
Har lagts till i Databricks CLI version 0.298.0
azure_key_vault_key_id String AKV-URL:en i Azure, null annars.
Har lagts till i Databricks CLI version 0.298.0
customer_managed_key_id String CMK UUID i AWS och GCP, null annars.
Har lagts till i Databricks CLI version 0.298.0

kluster

Type: Map

Klusterresursen definierar ett kluster.

clusters:
  <cluster-name>:
    <cluster-field-name>: <cluster-field-value>
Key Type Description
apply_policy_default_values Boolean När värdet är true används fasta värden och standardvärden från principen för fält som utelämnas. När värdet är falskt tillämpas endast fasta värden från principen.
autoscale Map Parametrar som behövs för att automatiskt skala upp och ned kluster baserat på belastning. Se autoscale.
autotermination_minutes Integer Avslutar klustret automatiskt när det är inaktivt efter denna tidsperiod i minuter. Om det inte anges avslutas inte klustret automatiskt. Om det anges måste tröskelvärdet vara mellan 10 och 1 0000 minuter. Användare kan också ange det här värdet till 0 för att uttryckligen inaktivera automatisk avslutning.
aws_attributes Map Attribut som är relaterade till kluster som körs på Amazon Web Services. Om det inte anges när klustret skapas används en uppsättning standardvärden. Se aws_attributes.
azure_attributes Map Attribut som är relaterade till kluster som körs på Microsoft Azure. Om det inte anges när klustret skapas används en uppsättning standardvärden. Se azure_attributes.
cluster_log_conf Map Konfigurationen för leverans av Spark-loggar till en långsiktig lagringsdestination. Se cluster_log_conf.
cluster_name String Klusternamn som begärs av användaren. Detta behöver inte vara unikt. Om det inte anges vid skapandet blir klusternamnet en tom sträng.
custom_tags Map Ytterligare taggar för klusterresurser. Databricks taggar alla klusterresurser (t.ex. AWS-instanser och EBS-volymer) med dessa taggar utöver default_tags.
data_security_mode String Den datastyrningsmodell som ska användas vid åtkomst till data från ett kluster. Giltiga värden är DATA_SECURITY_MODE_AUTO, DATA_SECURITY_MODE_STANDARD, DATA_SECURITY_MODE_DEDICATEDoch NONE. USER_ISOLATION och SINGLE_USER är äldre alias för DATA_SECURITY_MODE_STANDARD respektive DATA_SECURITY_MODE_DEDICATED. Lägena LEGACY_* är inaktuella från och med Databricks Runtime 15.0.
dependency_mode String (Beta) Styr beroendekonfigurationen för klustret. Giltiga värden är DEPENDENCY_MODE_ENVIRONMENTS, DEPENDENCY_MODE_CLUSTER_LIBRARIES och DEPENDENCY_MODE_AUTO.
Tillagd i Databricks CLI version 1.10.0
docker_image Map Den anpassade Docker-avbildningen. Se docker_image.
driver_instance_pool_id String Det valfria ID:t för instanspoolen för drivrutinen för klustret tillhör. Poolklustret använder instanspoolen med ID (instans*pool_id) om drivrutinspoolen inte har tilldelats.
driver_node_type_flexibility Map Flexibel nodtypkonfiguration för drivrutinsnoden. Se cluster.driver_node_type_flexibility.
Har lagts till i Databricks CLI version 0.285.0
driver_node_type_id String Nodtypen för Spark-drivrutinen. Det här fältet är valfritt. Om det inte anges anges drivrutinsnodtypen till värdet node_type_idför . Det här fältet, tillsammans med node_type_id, bör inte anges om virtual_cluster_size det har angetts. Om både driver_node_type_id, node_type_idoch virtual_cluster_size anges driver_node_type_id och node_type_id har företräde.
enable_elastic_disk Boolean Lokal lagring med automatisk skalning: när det här klustret är aktiverat hämtas ytterligare diskutrymme dynamiskt när Spark-arbetarna får ont om diskutrymme. Den här funktionen kräver specifika AWS-behörigheter för att fungera korrekt – mer information finns i användarhandboken.
enable_local_disk_encryption Boolean Om du vill aktivera LUKS på virtuella klusterdatorers lokala diskar.
gcp_attributes Map Attribut som rör kluster som körs på Google Cloud Platform. Om det inte anges när klustret skapas används en uppsättning standardvärden. Se gcp_attributes.
init_scripts Sequence Konfigurationen för lagring av init-skript. Valfritt antal destinationer kan anges. Skripten körs sekventiellt i den angivna ordningen. Se init_scripts.
instance_pool_id String Det valfria ID:t för instanspoolen som klustret tillhör.
is_single_node Boolean Det här fältet kan bara användas när kind = CLASSIC_PREVIEW. När värdet är true anger Databricks automatiskt en nodrelaterad custom_tags, spark_confoch num_workers.
Har lagts till i Databricks CLI version 0.237.0
kind String Den typ av beräkning som beskrivs i den här beräkningsspecifikationen.
Har lagts till i Databricks CLI version 0.237.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
node_type_id String Det här fältet kodar, via ett enda värde, de resurser som är tillgängliga för var och en av Spark-noderna i det här klustret. Spark-noderna kan till exempel etableras och optimeras för minnes- eller beräkningsintensiva arbetsbelastningar. En lista över tillgängliga nodtyper kan hämtas med hjälp av API:et Listnodtyper.
num_workers Integer Antal arbetsnoder som klustret ska ha. Ett kluster har en Spark Driver och num_workers Executors, vilket ger totalt num_workers + 1 Spark-noder.
permissions Sequence Klusterbehörigheterna. Se behörigheter.
policy_id String ID:t för klusterprincipen som används för att skapa klustret om tillämpligt.
remote_disk_throughput Integer Fjärrdiskens dataflöde i byte per sekund.
Har lagts till i Databricks CLI version 0.257.0
runtime_engine String Bestämmer klustrets körningsmotor, antingen STANDARD eller PHOTON.
single_user_name String Enskilt användarnamn om data*security_mode är SINGLE_USER.
spark_conf Map Ett objekt som innehåller en uppsättning valfria, användardefinierade Nyckel/värde-par för Spark-konfiguration. Användare kan också skicka in en sträng med extra JVM-alternativ till drivrutinen och exekverarna via spark.driver.extraJavaOptions respektive spark.executor.extraJavaOptions.
spark_env_vars Map Ett objekt som innehåller en uppsättning valfria, användardefinierade nyckelvärdepar för miljövariabler.
spark_version String Spark-versionen av klustret, t.ex. 3.3.x-scala2.11. En lista över tillgängliga Spark-versioner kan hämtas med hjälp av API:et List available Spark versions (Lista tillgängliga Spark-versioner).
ssh_public_keys Sequence Innehåll med offentlig SSH-nyckel som läggs till i varje Spark-nod i det här klustret. Motsvarande privata nycklar kan användas för att logga in med användarnamnet ubuntu på porten 2200. Upp till 10 nycklar kan anges.
total_initial_remote_disk_size Integer Total initial fjärrdiskstorlek i byte.
Har lagts till i Databricks CLI version 0.257.0
use_ml_runtime Boolean Det här fältet kan bara användas när kind = CLASSIC_PREVIEW. effective_spark_version bestäms av spark_version (Databricks Runtime-versionen), det här fältet use_ml_runtimeoch om node_type_id är gpu-nod eller inte.
Har lagts till i Databricks CLI version 0.237.0
worker_node_type_flexibility Map Flexibel nodtypkonfiguration för arbetsnoder. Se cluster.worker_node_type_flexibility.
Har lagts till i Databricks CLI version 0.285.0
workload_type Map Klusterattribut som visas för klusterarbetsbelastningstyper. Se workload_type.

cluster.autoscale

Type: Map

Parametrar för automatisk skalning av kluster upp och ned baserat på belastning.

Key Type Description
min_workers Integer Det minsta antalet arbetare som klustret kan skalas ned till när det är underutnyttrat. Det är också det första antalet arbetare som klustret kommer att ha när det har skapats.
max_workers Integer Det maximala antalet arbetare som klustret kan skalas upp till när det är överbelastat. max_workers måste vara strikt större än min_workers.

kluster.aws_egenskaper

Type: Map

Attribut som är relaterade till kluster som körs på Amazon Web Services.

Key Type Description
zone_id String Identifierare för tillgänglighetszonen/datacentret där klustret finns. Strängen kommer att ha ett format som us-west-2a.
availability String Tillgänglighetstyp som används för alla följande noder efter first_on_demand. Giltiga värden är SPOT, ON_DEMAND, SPOT_WITH_FALLBACK. Om first_on_demand är noll används denna tillgänglighetstyp för hela klustret.
spot_bid_price_percent Integer Det högsta priset för AWS-spotinstanser, som en procentandel av motsvarande instanstyps pris på begäran.
instance_profile_arn String Noder för det här klustret placeras bara på AWS-instanser med den här instansprofilen.
first_on_demand Integer De första first_on_demand noderna i klustret placeras på on-demand-instansier. Det här värdet bör vara större än 0, för att säkerställa att klusterdrivrutinsnoden placeras på en instans på begäran.
ebs_volume_type String Den typ av EBS-volymer som ska lanseras med det här klustret. Giltiga värden är GENERAL_PURPOSE_SSD eller THROUGHPUT_OPTIMIZED_HDD.
ebs_volume_count Integer Antalet volymer som lanseras för varje instans.
ebs_volume_size Integer Storleken på varje EBS-volym (i GiB) som startas för varje instans.
ebs_volume_iops Integer Antalet IOPS per EBS gp3-volym.
ebs_volume_throughput Integer Dataflödet i MiB per sekund per EBS gp3-volym.

cluster.azure_attributes

Type: Map

Attribut som är relaterade till kluster som körs på Microsoft Azure.

Key Type Description
first_on_demand Integer De första first_on_demand noderna i klustret placeras på on-demand-instansier.
availability String Tillgänglighetstyp som används för alla följande noder efter first_on_demand. Giltiga värden är SPOT_AZURE, ON_DEMAND_AZURE, SPOT_WITH_FALLBACK_AZURE. Om first_on_demand är noll används denna tillgänglighetstyp för hela klustret.
spot_bid_max_price Nummer Det högsta priset för Azure spot-instanser. Använd -1 för att ange lägsta pris.
capacity_reservation_group String Azure-kapacitetsreservationsgruppens resurs-ID att använda för att starta VM:er, i formatet /subscriptions/{subscriptionId}/resourceGroups/{resourceGroupName}/providers/Microsoft.Compute/capacityReservationGroups/{capacityReservationGroupName}. När det anges startas VM:er med den tillhandahållna kapacitetsreservationen.
Kapacitetsreservationer kan endast specificeras när arbetsytan använder en injicerad VNet (en kunddefinierad VNet som inte hanteras av Databricks). Enterprise databricks-login-prod Application måste beviljas följande fyra behörigheter: Microsoft.Compute/capacityReservationGroups/read, Microsoft.Compute/capacityReservationGroups/deploy/action, , Microsoft.Compute/capacityReservationGroups/capacityReservations/read, och Microsoft.Compute/capacityReservationGroups/capacityReservations/deploy/action.
Tillagd i Databricks CLI version 1.5.0
log_analytics_info Map Konfigurationen för Azure Log Analytics agent. Se log_analytics_info.

cluster.azure_attributes.log_analytics_info

Type: Map

Konfigurationen för Azure Log Analytics agent.

Key Type Description
log_analytics_workspace_id String ID:t för den Azure Log Analytics arbetsytan.
log_analytics_primary_key String Primärnyckeln för Azure Log Analytics arbetsyta.

cluster.gcp_attributes

Type: Map

Attribut som rör kluster som körs på Google Cloud Platform.

Key Type Description
use_preemptible_executors Boolean Om du vill använda fördefinierade körbara filer. Fördefinierade exekutorer är fördefinierade GCE-instanser som kan återkallas av GCE när som helst.
google_service_account String Google-tjänstkontot som ska användas av databricks-kluster-VM-instanserna.
local_ssd_count Integer Antalet lokala SSD:er som ska kopplas till varje nod i klustret. Standardvärdet är 0.
zone_id String Identifierare för tillgänglighetszonen/datacentret där klustret finns.
availability String Avgör om Spark-exekutorerna är schemalagda att köras på preavpbara VM:er, on-demand-VM:er eller preemptibla VM:ar med en reservplan till on-demand-VM:er om den förstnämnda inte är tillgänglig. Giltiga värden är PREEMPTIBLE_GCP, ON_DEMAND_GCP, PREEMPTIBLE_WITH_FALLBACK_GCP.
boot_disk_size Integer Storleken på startdisken i GB. Värden varierar vanligtvis från 100 till 1 000.

cluster.cluster_log_conf

Konfigurationen för att leverera Spark-loggar till ett långsiktigt lagringsmål.

Key Type Description
dbfs Map DBFS-plats för klusterloggleverans. Se dbfs.
s3 Map S3-plats för klusterloggleverans. Se s3.
volumes Map Volymplats för klusterloggleverans. Se volymer.

cluster.cluster_log_conf.dbfs

Type: Map

DBFS-plats för klusterloggleverans.

Key Type Description
destination String DBFS-sökvägen för klusterloggleverans (till exempel dbfs:/cluster-logs).

cluster.cluster_log_conf.s3

Type: Map

S3-plats för klusterloggleverans.

Key Type Description
destination String S3-URI:n för klusterloggleverans (till exempel s3://my-bucket/cluster-logs).
region String AWS-regionen för S3-korgen.
endpoint String S3-slutpunktens URL (valfritt).
enable_encryption Boolean Om du vill aktivera kryptering för klusterloggar.
encryption_type String Krypteringstypen. Giltiga värden är SSE_S3, SSE_KMS.
kms_key String KMS-nyckelns ARN för kryptering (vid användning av SSE_KMS).
canned_acl String Den fördefinierade ACL som ska tillämpas på klusterloggar.

cluster.cluster_log_conf.volymer

Type: Map

Volymplats för klusterloggleverans.

Key Type Description
destination String Volymsökvägen för klusterloggleverans (till exempel /Volumes/catalog/schema/volume/cluster_log).

cluster.docker_image

Type: Map

Den anpassade Docker-avbildningskonfigurationen.

Key Type Description
url String URL för Docker-avbildningen.
basic_auth Map Grundläggande autentisering för Docker-lagringsplatsen. Se basic_auth.

cluster.docker_image.basic_auth

Type: Map

Grundläggande autentisering för Docker-lagringsplatsen.

Key Type Description
username String Användarnamnet för Docker-registerautentisering.
password String Lösenordet för Docker-registerautentisering.

kluster.init_scripts

Type: Map

Konfigurationen för lagring av init-skript. Minst en platstyp måste anges.

Key Type Description
dbfs Map DBFS-platsen för init-skriptet. Se dbfs.
workspace Map Arbetsytans plats för init-skriptet. Se arbetsyta.
s3 Map S3-plats för init-skript. Se s3.
abfss Map ABFSS-platsen för init-skriptet. Se abfss.
gcs Map GCS-plats för init-skript. Se gcs.
volumes Map Unity Catalog Volymer plats för init-skript. Se volymer.

cluster.init_scripts.dbfs

Type: Map

DBFS-platsen för init-skriptet.

Key Type Description
destination String DBFS-sökvägen för init-skriptet.

cluster.init_scripts.workspace

Type: Map

Arbetsytans plats för init-skriptet.

Key Type Description
destination String Arbetsytans sökväg för init-skriptet.

kluster.initieringsskript.s3

Type: Map

S3-plats för init-skript.

Key Type Description
destination String S3-URI:n för init-skriptet.
region String AWS-regionen för S3-korgen.
endpoint String S3-slutpunktens URL (valfritt).

cluster.init_scripts.abfss

Type: Map

ABFSS-platsen för init-skriptet.

Key Type Description
destination String ABFSS-sökvägen för init-skriptet.

kluster.init_scripts.gcs

Type: Map

GCS-plats för init-skript.

Key Type Description
destination String GCS-sökvägen för init-skriptet.

cluster.init_scripts.volymer

Type: Map

Volymplats för init-skript.

Key Type Description
destination String Sökvägen Unity Catalog Volumes för init-skriptet.

cluster.driver_node_type_flexibility

Type: Map

Flexibel nodtypkonfiguration för drivrutinsnoden.

Har lagts till i Databricks CLI version 0.285.0

Key Type Description
alternate_node_type_ids Sequence En lista över nodtyp-ID:t som ska användas som återställningar när den primära nodtypen inte är tillgänglig.
Har lagts till i Databricks CLI version 0.285.0

cluster.worker_node_type_flexibility

Type: Map

Flexibel nodtypkonfiguration för arbetsnoder.

Har lagts till i Databricks CLI version 0.285.0

Key Type Description
alternate_node_type_ids Sequence En lista över nodtyp-ID:t som ska användas som återställningar när den primära nodtypen inte är tillgänglig.
Har lagts till i Databricks CLI version 0.285.0

cluster.workload_typ (typ av arbetsbelastning)

Type: Map

Klusterattribut som visar klusterarbetsbelastningstyper.

Key Type Description
clients Map Definierar vilken typ av klienter som kan använda klustret. Se klienter.

cluster.arbetsbelastning_typ.clients

Type: Map

Typen av klienter för den här beräkningsarbetsbelastningen.

Key Type Description
jobs Boolean Om klustret kan utföra uppgifter.
notebooks Boolean Om klustret kan köra notebook-filer.

Examples

I följande exempel skapas ett dedikerat kluster (en användare) för den aktuella användaren med Databricks Runtime 15.4 LTS och en klusterprincip:

resources:
  clusters:
    my_cluster:
      num_workers: 0
      node_type_id: 'i3.xlarge'
      driver_node_type_id: 'i3.xlarge'
      spark_version: '15.4.x-scala2.12'
      spark_conf:
        'spark.executor.memory': '2g'
      autotermination_minutes: 60
      enable_elastic_disk: true
      single_user_name: ${workspace.current_user.userName}
      policy_id: '000128DB309672CA'
      enable_local_disk_encryption: false
      data_security_mode: SINGLE_USER
      runtime_engine: STANDARD

Det här exemplet skapar ett enkelt kluster my_cluster och anger det som det kluster som ska användas för att köra notebook-filen i my_job:

bundle:
  name: clusters

resources:
  clusters:
    my_cluster:
      num_workers: 2
      node_type_id: 'i3.xlarge'
      autoscale:
        min_workers: 2
        max_workers: 7
      spark_version: '13.3.x-scala2.12'
      spark_conf:
        'spark.executor.memory': '2g'

  jobs:
    my_job:
      tasks:
        - task_key: test_task
          notebook_task:
            notebook_path: './src/my_notebook.py'
          existing_cluster_id: ${resources.clusters.my_cluster.id}

översiktspanel

Type: Map

Med instrumentpanelsresursen kan du hantera AI/BI-instrumentpaneler i ett paket. Information om AI/BI-instrumentpaneler finns i Instrumentpaneler.

Om du har distribuerat ett paket som innehåller en instrumentpanel från din lokala miljö och sedan använder användargränssnittet för att ändra instrumentpanelen, tillämpas inte ändringar som görs via användargränssnittet på instrumentpanelens JSON-fil i det lokala paketet om du inte uttryckligen uppdaterar den med .bundle generate Du kan använda alternativet --watch för att kontinuerligt avsöka och hämta ändringar på instrumentpanelen. Se generera databricks-paket.

Om du försöker distribuera ett paket från din lokala miljö som innehåller en JSON-instrumentpanelsfil som skiljer sig från den på fjärrarbetsytan uppstår dessutom ett fel. Använd alternativet --force för att tvinga fram distributionen och skriva över den lokala instrumentpanelen på fjärrarbetsytan. Se distribuera databricks-paket.

Har lagts till i Databricks CLI version 0.232.0

Note

När du använder Deklarativa Automation-paket med git-stöd för instrumentpanelen förhindrar dubbletter av instrumentpaneler från att genereras genom att lägga till synkroniseringsmappningen för att undanta instrumentpanelerna från att synkroniseras som filer:

sync:
  exclude:
    - src/*.lvdash.json
dashboards:
  <dashboard-name>:
    <dashboard-field-name>: <dashboard-field-value>
Key Type Description
dataset_catalog String Standardkatalogvärdet som används av alla datauppsättningar på instrumentpanelen om inget annat anges i frågan. Exempel på konfiguration som anger det här fältet finns i Instrumentpanelskatalog och schemaparameterisering.
Har lagts till i Databricks CLI version 0.283.0
dataset_schema String Standardschemavärdet som används av alla datauppsättningar på instrumentpanelen om inget annat anges i frågan. Exempel på konfiguration som anger det här fältet finns i Instrumentpanelskatalog och schemaparameterisering.
Har lagts till i Databricks CLI version 0.283.0
display_name String Instrumentpanelens visningsnamn.
Har lagts till i Databricks CLI version 0.232.0
embed_credentials Boolean Om autentiseringsuppgifterna för paketdistributionsidentiteten används för att köra frågor för alla instrumentpanelsvisningsprogram. Om den är inställd på falseanvänds ett visningsprograms autentiseringsuppgifter. Standardvärdet är false.
Har lagts till i Databricks CLI version 0.232.0
etag String Etag för instrumentpanelen. Valfritt kan anges vid uppdateringar för att säkerställa att instrumentpanelen inte har ändrats sedan den senaste läsningen.
Har lagts till i Databricks CLI version 0.234.0
file_path String Den lokala sökvägen till kontrollpanelresursen, inklusive filnamnet. Exporterade instrumentpaneler har alltid filnamnstillägget .lvdash.json.
Har lagts till i Databricks CLI version 0.232.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
parent_path String Arbetsytans sökväg till mappen som innehåller instrumentpanelen. Innehåller inledande snedstreck och inget avslutande snedstreck.
Har lagts till i Databricks CLI version 0.232.0
path String Sökvägen till arbetsytan för instrumentpanelens tillgång, inklusive tillgångsnamnet.
Har lagts till i Databricks CLI version 0.234.0
permissions Sequence Instrumentpanelens behörigheter. Se behörigheter.
Har lagts till i Databricks CLI version 0.232.0
serialized_dashboard Any Innehållet i instrumentpanelen i serialiserad strängform.
Har lagts till i Databricks CLI version 0.232.0
warehouse_id String Det lager-ID som användes för att köra instrumentpanelen.
Har lagts till i Databricks CLI version 0.232.0

Example

I följande exempel ingår och distribueras exempelinstrumentpanelen NYC Taxi Trip Analysis till Databricks-arbetsytan.

resources:
  dashboards:
    nyc_taxi_trip_analysis:
      display_name: 'NYC Taxi Trip Analysis'
      file_path: ../src/nyc_taxi_trip_analysis.lvdash.json
      warehouse_id: ${var.warehouse_id}

databaskatalog

Type: Map

Med databaskatalogresursen kan du definiera databaskataloger som motsvarar databasinstanser i ett paket. En databaskatalog är en Lakebase-databas som är registrerad som en Unity Catalog-katalog.

Information om databaskataloger finns i Skapa en katalog.

Har lagts till i Databricks CLI version 0.265.0

database_catalogs:
  <database_catalog-name>:
    <database_catalog-field-name>: <database_catalog-field-value>
Key Type Description
create_database_if_not_exists Boolean Om databasen ska skapas om den inte finns.
Har lagts till i Databricks CLI version 0.265.0
database_instance_name String Namnet på den instans som finns i databasen.
Har lagts till i Databricks CLI version 0.265.0
database_name String Namnet på databasen (i en instans) som är kopplad till katalogen.
Har lagts till i Databricks CLI version 0.265.0
lifecycle Map Innehåller livscykelinställningarna för en resurs, inklusive resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.265.0
name String Namnet på katalogen i Unity Catalog.
Har lagts till i Databricks CLI version 0.265.0

Example

I följande exempel definieras en databasinstans med en motsvarande databaskatalog:

resources:
  database_instances:
    my_instance:
      name: my-instance
      capacity: CU_1
  database_catalogs:
    my_catalog:
      database_instance_name: ${resources.database_instances.my_instance.name}
      name: example_catalog
      database_name: my_database
      create_database_if_not_exists: true

database_instance

Type: Map

Med databasinstansresursen kan du definiera databasinstanser i ett paket. En Lakebase-databasinstans hanterar lagrings- och beräkningsresurser och tillhandahåller de slutpunkter som användarna ansluter till.

Note

Nya databasinstanser som skapats av resursen database_instances skapas nu som Lakebase Autoscaling-projekt. Mer information finns i Autoskalning som standard . För nytt Lakebase-arbete rekommenderar vi att du använder resursen postgres_projects i stället.

Viktigt!

När du distribuerar ett paket med en databasinstans börjar instansen omedelbart köras och omfattas av priser. Se Priser för Lakebase.

Information om databasinstanser finns i Lakebase Provisioned.

Har lagts till i Databricks CLI version 0.265.0

database_instances:
  <database_instance-name>:
    <database_instance-field-name>: <database_instance-field-value>
Key Type Description
capacity String SKU:n för instansen. Giltiga värden är CU_1, CU_2, CU_4, CU_8.
Har lagts till i Databricks CLI version 0.265.0
custom_tags Sequence En lista över nyckel/värde-par som anger anpassade taggar som är associerade med instansen.
Har lagts till i Databricks CLI version 0.273.0
enable_pg_native_login Boolean Om instansen har PG-inbyggt lösenordsinloggning aktiverat. Standardinställningen är true.
Har lagts till i Databricks CLI version 0.267.0
enable_readable_secondaries Boolean Om du vill aktivera sekundärfiler för att hantera skrivskyddad trafik. Standardinställningen är false.
Har lagts till i Databricks CLI version 0.265.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
name String Namnet på instansen. Det här är den unika identifieraren för instansen.
Har lagts till i Databricks CLI version 0.265.0
node_count Integer Antalet noder i instansen, bestående av 1 primär och 0 eller fler sekundärfiler. Standardvärdet är 1 primär och 0 sekundär.
Har lagts till i Databricks CLI version 0.265.0
parent_instance_ref Map Referensen för den överordnade instansen. Detta är endast tillgängligt om instansen är en underordnad instans. Se överordnad instans.
Har lagts till i Databricks CLI version 0.265.0
permissions Sequence Databasinstansens behörigheter. Se behörigheter.
Har lagts till i Databricks CLI version 0.265.0
retention_window_in_days Integer Kvarhållningsfönstret för instansen. Det här är tidsfönstret i dagar då historiska data behålls. Standardvärdet är 7 dagar. Giltiga värden är mellan 2 och 35 dagar.
Har lagts till i Databricks CLI version 0.265.0
stopped Boolean Om instansen stoppas.
Har lagts till i Databricks CLI version 0.265.0
usage_policy_id String Önskad serverlös användningsprincip som ska associeras med instansen.
Har lagts till i Databricks CLI version 0.273.0

databas_instans.föräldrainstans_ref

Type: Map

Referensen för den överordnade instansen. Detta är endast tillgängligt om instansen är en underordnad instans.

Key Type Description
branch_time String Grenningstid för referensdatabasinstansen. För en överordnad referensinstans är detta tidpunkten för den överordnade instans som instansen skapades från. För en underordnad referensinstans är detta tidpunkten för den instans som den underordnade instansen skapades från.
lsn String Användardefinerad WAL LSN för referensdatabasinstansen.
name String Namnet på referensdatabasinstansen.

Example

I följande exempel definieras en databasinstans med en motsvarande databaskatalog:

resources:
  database_instances:
    my_instance:
      name: my-instance
      capacity: CU_1
  database_catalogs:
    my_catalog:
      database_instance_name: ${resources.database_instances.my_instance.name}
      name: example_catalog
      database_name: my_database
      create_database_if_not_exists: true

Ett exempelpaket som visar hur du definierar en databasinstans och motsvarande databaskatalog finns i bundle-examples GitHub lagringsplats.

Experiment

Type: Map

Med experimentresursen kan du definiera MLflow-experiment i ett paket. Information om MLflow-experiment finns i Organisera träningskörningar med MLflow-experiment.

experiments:
  <experiment-name>:
    <experiment-field-name>: <experiment-field-value>
Key Type Description
artifact_location String Platsen där artefakter för experimentet lagras. Platsen måste innehålla ett URI-schema som dbfs: eller s3:. Om du vill lagra artefakter i en Unity Catalog-volym (rekommenderas kräver MLflow 2.15.0 eller senare) använder du en sökväg i formuläret dbfs:/Volumes/<catalog>/<schema>/<volume>/<path>. Se Skapa experiment från arbetsytan.
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
name String Det vänliga namnet som identifierar experimentet. Ett experimentnamn måste vara en absolut sökväg i Databricks-arbetsytan, till exempel /Workspace/Users/someone@example.com/my_experiment.
permissions Sequence Experimentets behörigheter. Se behörigheter.
tags Sequence Ytterligare nyckel/värde-par för metadata. Se taggar. Använd taggen om du vill ange en beskrivning för experimentet mlflow.note.content . Om du vill koppla en serverlös budgetprincip använder du taggen mlflow.workload_creation_policy_id . Se Attributanvändning med serverlösa användningsprinciper.

Example

I följande exempel definieras ett experiment som alla användare kan visa:

resources:
  experiments:
    experiment:
      name: /Workspace/Users/someone@example.com/my_experiment
      permissions:
        - level: CAN_READ
          group_name: users
      tags:
        - key: mlflow.note.content
          value: MLflow experiment used to track runs

external_location (Unity-katalogen)

Type: Map

Med den externa platsresursen kan du definiera externa platser (Unity Catalog) i ett paket.

Note

Du kan bara använda deklarativa Automation-paket för att definiera externa platser om du använder direktdistributionsmotorn.

Har lagts till i Databricks CLI version 0.289.0

external_locations:
  <external-location-name>:
    <external-location-field-name>: <external-location-field-value>
Key Type Description
comment String En textbeskrivning av den externa platsen som tillhandahålls av användaren.
Har lagts till i Databricks CLI version 0.289.0
credential_name String Obligatoriskt. Namnet på lagringsautentiseringsuppgifterna som används med den här platsen.
Har lagts till i Databricks CLI version 0.289.0
enable_file_events Boolean Om du vill aktivera filhändelser på den här externa platsen. Standardinställningen är true. Det faktiska tillämpade värdet kan variera på grund av standardvärden på serversidan. Sök efter effective_enable_file_events det effektiva tillståndet.
Har lagts till i Databricks CLI version 0.289.0
encryption_details Map Krypteringsalternativ som gäller för klienter som ansluter till molnlagring. Se external_location.encryption_details.
Har lagts till i Databricks CLI version 0.289.0
fallback Boolean Anger om återställningsläget är aktiverat för den här externa platsen. När återställningsläget är aktiverat återgår åtkomsten till platsen till klusterautentiseringsuppgifterna om Unity Catalog-autentiseringsuppgifterna inte är tillräckliga.
Har lagts till i Databricks CLI version 0.289.0
file_event_queue Map Inställningar för filhändelseköer för den här externa platsen. Om enable_file_events inte falsemåste den här nyckeln definieras och ha exakt en av de dokumenterade egenskaperna. Se external_location.file_event_queue.
Har lagts till i Databricks CLI version 0.289.0
grants Sequence De bidrag som är associerade med den externa platsen. Se bidrag.
Har lagts till i Databricks CLI version 0.289.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.289.0
name String Obligatoriskt. Namnet på den externa platsen.
Har lagts till i Databricks CLI version 0.289.0
read_only Boolean Anger huruvida den externa platsen är skrivskyddad.
Har lagts till i Databricks CLI version 0.289.0
skip_validation Boolean Hoppar över valideringen av lagringsautentiseringsuppgifterna som är associerade med den externa platsen.
Har lagts till i Databricks CLI version 0.289.0
url String Obligatoriskt. Sökvägs-URL för den externa platsen.
Har lagts till i Databricks CLI version 0.289.0

external_location.encryption_details

Type: Map

Krypteringsalternativ som gäller för klienter som ansluter till molnlagring.

Key Type Description
sse_encryption_details Map Krypteringsegenskaper på serversidan för klienter som kommunicerar med Amazon S3.

external_location.file_event_queue

Type: Map

Inställningar för filhändelseköer för den här externa platsen.

Key Type Description
managed_aqs Map Hanterade inställningar för Azure Queue Storage.
managed_pubsub Map Hanterade Inställningar för Google Cloud Pub/Sub.
managed_sqs Map Hanterade Amazon SQS-inställningar.
provided_aqs Map Användardefinierade inställningar för Azure Queue Storage.
provided_pubsub Map Användardefinierade Inställningar för Google Cloud Pub/Under.
provided_sqs Map Användardefinierade Amazon SQS-inställningar.

Example

# databricks.yml
bundle:
  name: external-locations-example
  engine: direct # External locations require the direct deployment engine

resources:
  external_locations:
    my_external_location:
      name: my_external_location
      url: 's3://my-bucket/my-path'
      credential_name: my_storage_credential
      comment: 'External location created by Databricks Asset Bundles'
      grants:
        - principal: someone@example.com
          privileges:
            - CREATE_EXTERNAL_TABLE
            - READ_FILES

genie_space

Type: Map

Med Genie-agentresursen kan du definiera Genie-agenter i ett paket. Mer information om Genie-agenter finns i Genie-agenter.

Note

Det går bara att använda deklarativa Automation-paket för att definiera Genie-agenter om du använder direktdistributionsmotorn.

Har lagts till i Databricks CLI version 1.3.0

genie_spaces:
  <genie_space-name>:
    <genie_space-field-name>: <genie_space-field-value>
Key Type Description
description String Beskrivning av Genie-agenten.
Har lagts till i Databricks CLI version 1.3.0
file_path String Sökvägen till en lokal fil (till exempel sales_analytics.geniespace.json) som ska användas i stället för posten serialized_space .
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 1.3.0
parent_path String Sökvägen till den överordnade mappen där Genie-agenten registreras.
Har lagts till i Databricks CLI version 1.3.0
permissions Sequence Genie-agentens behörigheter. Se behörigheter.
Har lagts till i Databricks CLI version 1.3.0
serialized_space String Obligatoriskt. Innehållet i Genie Agent i serialiserat strängformulär. Det här fältet innehåller strukturen för JSON-strängen som representerar utrymmets layout och komponenter. Om file_path anges tar det precendence över serialized_space.
Har lagts till i Databricks CLI version 1.3.0
title String En valfri rubrik åsidosättning för Genie-agenten.
Har lagts till i Databricks CLI version 1.3.0
warehouse_id String Obligatoriskt. ID:t för SQL-lagret som ska associeras med det nya utrymmet.
Har lagts till i Databricks CLI version 1.3.0

Examples

I följande exempel definieras en Genie-agentresurs:

# databricks.yml
bundle:
  name: nyc-taxi-genie
  engine: direct # genie_spaces require the direct deployment engine

resources:
  genie_spaces:
    nyc_taxi_genie:
      title: 'NYC Taxi Trip Analysis'
      description: 'Ask questions about NYC taxi trip data in natural language'
      warehouse_id: <warehouse-id>
      file_path: ./nyc_taxi_genie.geniespace.json
      permissions:
        - level: CAN_RUN
          group_name: users

Motsvarande nyc_taxi_genie.geniespace.json fil innehåller den serialiserade definitionen av utrymmet, inklusive dess datakällor, instruktioner och exempelfrågor. Det kan också anges i YAML i nyckeln i serialized_space stället.

// nyc_taxi_genie.geniespace.json
{
  "version": 2,
  "config": {
    "sample_questions": [
      {
        "id": "11111111111111111111111111111111",
        "question": ["What is the average fare per trip?"]
      }
    ]
  },
  "data_sources": {
    "tables": [
      {
        "identifier": "samples.nyctaxi.trips",
        "column_configs": [
          { "column_name": "fare_amount" },
          { "column_name": "pickup_zip" },
          { "column_name": "tpep_pickup_datetime" },
          { "column_name": "trip_distance" }
        ]
      }
    ]
  },
  "instructions": {
    "text_instructions": [
      {
        "id": "22222222222222222222222222222222",
        "content": ["Fare amounts are in USD. When asked about revenue, use SUM(fare_amount)."]
      }
    ]
  }
}

instance_pool

Type: Map

Den instance_pool resursen låter dig definiera instanspooler i ett paket. En instanspool har en uppsättning inaktiva, färdiga molninstanser så att kluster kopplade till poolen startar och skalar snabbare. För information om instanspooler, se Connect to pools.

Note

Att använda Deklarative Automation Bundles för att definiera instanspooler stöds endast om du använder den direkta distributionsmotorn.

Har lagts till i Databricks CLI version 1.9.0

instance_pools:
  <instance_pool-name>:
    <instance_pool-field-name>: <instance_pool-field-value>
Key Type Description
aws_attributes Map Attribut relaterade till instanspooler som körs på Amazon Web Services. Om det inte anges vid poolskapandet används en uppsättning standardvärden. Se instance_pool.aws_attributes.
Har lagts till i Databricks CLI version 1.9.0
azure_attributes Map Attribut relaterade till instanspooler som körs på Azure. Om det inte anges vid poolskapandet används en uppsättning standardvärden. Se instance_pool.azure_attributes.
Har lagts till i Databricks CLI version 1.9.0
custom_tags Map Ytterligare taggar för poolresurser. Databricks taggar alla poolresurser (till exempel AWS-instanser och EBS-volymer) med dessa taggar utöver default_tags. Databricks tillåter högst 45 anpassade taggar.
Har lagts till i Databricks CLI version 1.9.0
disk_spec Map Specifikationen av diskarna för att ansluta till alla Spark-behållare. Se instance_pool.disk_spec.
Har lagts till i Databricks CLI version 1.9.0
enable_elastic_disk Boolean Autoskalning av lokal lagring: när det är aktiverat får instanserna i denna pool dynamiskt extra diskutrymme när deras Spark-arbetare börjar få slut på diskutrymme. I AWS kräver denna funktion specifika AWS-behörigheter för att fungera korrekt.
Har lagts till i Databricks CLI version 1.9.0
gcp_attributes Map Attribut relaterade till instanspooler som körs på Google Cloud Platform. Om det inte anges vid poolskapandet används en uppsättning standardvärden. Se instance_pool.gcp_attributes.
Har lagts till i Databricks CLI version 1.9.0
idle_instance_autotermination_minutes Integer Avslutar automatiskt de extra instanserna i poolcachen efter att de varit inaktiva under denna tid inom några minuter, om kravet min_idle_instances redan är uppfyllt. Om de inte är inställda avslutas de extra poolinstanserna automatiskt efter en standardtimeout. Om angiven måste tröskeln vara mellan 0 och 10000 minuter. Ställ in detta värde på 0 att omedelbart ta bort inaktiva instanser från cachen om minsta cachestorlek fortfarande kan hållas.
Har lagts till i Databricks CLI version 1.9.0
instance_pool_name String Obligatoriskt. Poolnamnet. Poolens namn måste vara unikt och dess längd måste vara mellan 1 och 100 tecken.
Har lagts till i Databricks CLI version 1.9.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 1.9.0
max_capacity Integer Det maximala antalet utestående instanser att behålla i poolen, inklusive både instanser som används av kluster och inaktiva instanser. Kluster som kräver ytterligare instansprovisionering misslyckas under uppskalningsförfrågningar.
Har lagts till i Databricks CLI version 1.9.0
min_idle_instances Integer Det minsta antalet inaktiva instanser som ska ha i instanspoolen.
Har lagts till i Databricks CLI version 1.9.0
node_type_flexibility Map Flexibel nodtyp konfiguration för poolen. Se instance_pool.node_type_flexibility.
Har lagts till i Databricks CLI version 1.9.0
node_type_id String Obligatoriskt. Detta fält kodar, genom ett enda värde, de resurser som finns tillgängliga för varje Spark-nod i klustren som använder denna pool. Spark-noderna kan till exempel etableras och optimeras för minnes- eller beräkningsintensiva arbetsbelastningar. En lista över tillgängliga nodtyper kan hämtas med hjälp av API:et Listnodtyper.
Har lagts till i Databricks CLI version 1.9.0
permissions Sequence Behörigheterna för instanspoolen. Tillåtna nivåer är CAN_MANAGE och CAN_ATTACH_TO. Se behörigheter.
Har lagts till i Databricks CLI version 1.9.0
preloaded_docker_images Sequence De anpassade Docker-bilderna för att förladda på poolinstanserna. Se instance_pool.preloaded_docker_images.
Har lagts till i Databricks CLI version 1.9.0
preloaded_spark_versions Sequence En lista som innehåller högst en förladdad Spark-bildversion för poolen. Poolbackade kluster startade med den förinstallerade Spark-versionen snabbare. En lista över tillgängliga Spark-versioner kan hämtas med hjälp av API:et List available Spark versions (Lista tillgängliga Spark-versioner).
Har lagts till i Databricks CLI version 1.9.0
remote_disk_throughput Integer Den konfigurerbara genomströmningen, i MB per sekund, för den fjärrdisken. Stöds för närvarande endast för GCP-typer HYPERDISK_BALANCED .
Har lagts till i Databricks CLI version 1.9.0
total_initial_remote_disk_size Integer Den totala initiala volymstorleken, i GB, för de fjärrdiskarna. Stöds för närvarande endast för GCP-typer HYPERDISK_BALANCED .
Har lagts till i Databricks CLI version 1.9.0

instance_pool.aws_attribut

Type: Map

Attribut relaterade till instanspooler som körs på Amazon Web Services. Om det inte anges vid poolskapandet används en uppsättning standardvärden.

Har lagts till i Databricks CLI version 1.9.0

Key Type Description
availability String Tillgänglighetstypen som används för spotnoderna. Giltiga värden är SPOT och ON_DEMAND.
Har lagts till i Databricks CLI version 1.9.0
instance_profile_arn String (Beta) Alla AWS-instanser som tillhör instanspoolen har denna instansprofil. Om det utelämnas startas instanserna initialt med arbetsytans standardinstansprofil. Om definierat ärver kluster som använder poolen instansprofilen och får inte specificera sin egen instansprofil vid klusterskapande eller uppdatering. Om poolen inte specificerar en instansprofil kan kluster som använder poolen ange vilken instansprofil som helst. Instansprofilen måste tidigare ha lagts till i Databricks-miljön av en kontoadministratör. Denna funktion kan endast vara tillgänglig för vissa kundplaner.
Har lagts till i Databricks CLI version 1.9.0
spot_bid_price_percent Integer Beräknar budpriset för AWS-spotinstanser som en procentandel av motsvarande instanstyps on-demand-pris. Till exempel, om detta fält sätts till 50 och poolen behöver en ny r3.xlarge spotinstans, är budpriset hälften av priset för en on-demand-instans r3.xlarge . Om det inte anges är 100standardvärdet . Detta fält får inte vara mer än 10000.
Har lagts till i Databricks CLI version 1.9.0
zone_id String Identifierare för tillgänglighetszonen/datacentret där poolen finns, till exempel us-west-2a. Den tillhandahållna tillgänglighetszonen måste ligga i samma region som Databricks-distributionen. Detta är ett valfritt fält, och om det inte specificeras används en standardzon. Listan över tillgängliga zoner samt standardvärdet kan hittas genom att använda List zones API.
Har lagts till i Databricks CLI version 1.9.0

instance_pool.azure_attributes

Type: Map

Attribut relaterade till instanspooler som körs på Azure. Om det inte anges vid poolskapandet används en uppsättning standardvärden.

Har lagts till i Databricks CLI version 1.9.0

Key Type Description
availability String Tillgänglighetstypen som används för spotnoderna. Giltiga värden är SPOT_AZURE och ON_DEMAND_AZURE.
Har lagts till i Databricks CLI version 1.9.0
capacity_reservation_group String Azure capacity reservation resource group ID för att använda för att starta VM:er i denna pool. När det anges startas VM:er med den tillhandahållna kapacitetsreservationen. Att utelämna detta fält rensar alla befintliga konfigurerade kapacitetsreservationsgrupper i poolen.
Kapacitetsreservationer kan endast specificeras när arbetsytan använder en injicerad VNet (en kunddefinierad VNet som inte hanteras av Databricks). Enterprise databricks-login-prod Application måste beviljas följande fyra behörigheter:
  • Microsoft.Compute/capacityReservationGroups/read
  • Microsoft.Compute/capacityReservationGroups/deploy/action
  • Microsoft.Compute/capacityReservationGroups/capacityReservations/read
  • Microsoft.Compute/capacityReservationGroups/capacityReservations/deploy/action

Använd formatet /subscriptions/{subscriptionId}/resourceGroups/{resourceGroupName}/providers/Microsoft.Compute/capacityReservationGroups/{capacityReservationGroupName}.
Har lagts till i Databricks CLI version 1.9.0
spot_bid_max_price Nummer Det högsta priset för Azure spot-instanser, i amerikanska dollar (USD). Till exempel sätter värdet 2 ett maxpris på 2,00 USD per timme. Sätt maxpriset så -1 att VM:n inte vräks baserat på priset. Priset för VM:n är det aktuella priset för spot-VM eller priset för en standard-VM, beroende på vilket som är lägst, så länge det finns kapacitet och kvot tillgänglig.
Har lagts till i Databricks CLI version 1.9.0

instance_pool.disk_spec

Type: Map

Specifikationen av diskarna för att ansluta till alla Spark-behållare.

Har lagts till i Databricks CLI version 1.9.0

Key Type Description
disk_count Integer Antalet diskar som startades för varje instans. Denna funktion är endast aktiverad för stödda nodtyper, och du kan välja upp till gränsen för antalet diskar som stöds av nodtypen. För nodtyper utan OS-disk måste minst en disk specificeras, annars misslyckas klusterskapandet.
Om diskar är anslutna konfigurerar Databricks Spark så att endast diskarna används för scratch-lagring, eftersom heterogent stora scratch-enheter kan leda till ineffektiv diskanvändning. Om inga diskar är anslutna konfigurerar Databricks Spark för att använda instanslagringsdiskar. Om diskar specificeras, överskrivs Spark-konfigurationen spark.local.dir .
Diskar monteras vid /ebs0, /ebs1, och så vidare för AWS, och vid /remote_volume0, /remote_volume1, och så vidare för Azure.
Har lagts till i Databricks CLI version 1.9.0
disk_iops Integer Antalet IOPS som ska tillhandahållas för varje ansluten disk.
Har lagts till i Databricks CLI version 1.9.0
disk_size Integer Storleken på varje disk, i GiB, startades för varje instans. Värden måste falla inom det stödda intervallet för en viss instanstyp. För AWS är en allmän SSD 100–4096 GiB och en genomströmningsoptimerad HDD 500–4096 GiB. För Azure är Premium LRS (SSD) 1–1023 GiB och Standard LRS (HDD) 1–1023 GiB.
Har lagts till i Databricks CLI version 1.9.0
disk_throughput Integer Diskens genomströmning för varje ansluten disk i MB per sekund.
Har lagts till i Databricks CLI version 1.9.0
disk_type Map Vilken typ av diskar som ska startas med poolinstanserna. Sätt antingen azure_disk_volume_type (giltiga värden är PREMIUM_LRS och STANDARD_LRS) eller ebs_volume_type (giltiga värden är GENERAL_PURPOSE_SSD och THROUGHPUT_OPTIMIZED_HDD).
Har lagts till i Databricks CLI version 1.9.0

instance_pool.gcp_attribut

Type: Map

Attribut relaterade till instanspooler som körs på Google Cloud Platform. Om det inte anges vid poolskapandet används en uppsättning standardvärden.

Har lagts till i Databricks CLI version 1.9.0

Key Type Description
gcp_availability String Avgör om instanspoolen innehåller preemptibla VM:er, on-demand-VM:er eller preemptibla VM:ar med en reservplan till on-demand-VM:er om den förstnämnda inte är tillgänglig. Giltiga värden är PREEMPTIBLE_GCP, ON_DEMAND_GCP och PREEMPTIBLE_WITH_FALLBACK_GCP.
Har lagts till i Databricks CLI version 1.9.0
local_ssd_count Integer Om det finns tillgängligt har varje nod i instanspoolen detta antal lokala SSD:er kopplade. Varje lokal SSD är 375 GB stor. För det stödda antalet lokala SSD:er för varje instanstyp, se GCP-dokumentationen.
Har lagts till i Databricks CLI version 1.9.0
zone_id String Identifierare för tillgänglighetszonen/datacentret där poolen finns, till exempel us-west1-a. Den tillhandahållna tillgänglighetszonen måste vara i samma region som Databricks arbetsyta. Detta är ett valfritt fält, och om det inte specificeras används en standardzon. Sätt detta fält till HA hög tillgänglighet, vilket sprider noder över tillgänglighetszoner för Databricks-distributionsregionen, eller till en av de tillgängliga zonerna för maskintypen och regionen. Om den är tom, väljer Databricks en tillgänglighetszon.
Har lagts till i Databricks CLI version 1.9.0

instance_pool.node_type_flexibility

Type: Map

Flexibel nodtyp konfiguration för poolen.

Har lagts till i Databricks CLI version 1.9.0

Key Type Description
alternate_node_type_ids Sequence En lista över nodtyp-ID:t som ska användas som återställningar när den primära nodtypen inte är tillgänglig.
Har lagts till i Databricks CLI version 1.9.0

instance_pool.preloaded_docker_images

Type: Sequence

De anpassade Docker-bilderna för att förladda på poolinstanserna.

Har lagts till i Databricks CLI version 1.9.0

Key Type Description
basic_auth Map Grundläggande autentisering för Docker-arkivet. Ange username och password.
Har lagts till i Databricks CLI version 1.9.0
url String URL:en till Docker-bilden.
Har lagts till i Databricks CLI version 1.9.0

Example

Följande exempel definierar en instanspool och ett kluster som använder den:

resources:
  instance_pools:
    my_pool:
      instance_pool_name: my-pool
      node_type_id: i3.xlarge
      min_idle_instances: 2
      max_capacity: 10
      idle_instance_autotermination_minutes: 15
      preloaded_spark_versions:
        - '15.4.x-scala2.12'

  clusters:
    my_cluster:
      cluster_name: my-cluster
      instance_pool_id: ${resources.instance_pools.my_pool.id}
      spark_version: '15.4.x-scala2.12'
      num_workers: 2

jobb

Type: Map

Jobb stöds i Python för deklarativa Automation-paket. Se databricks.bundles.jobs.

Med jobbresursen kan du definiera jobb och deras motsvarande uppgifter i ditt paket.

Information om jobb finns i Lakeflow-jobb. En självstudiekurs som använder en mall för deklarativa automationspaket för att skapa ett jobb finns i Utveckla ett jobb med deklarativa Automation-paket.

jobs:
  <job-name>:
    <job-field-name>: <job-field-value>
Key Type Description
budget_policy_id String ID:t för den användardefinierade budgetprincip som ska användas för det här jobbet. Om det inte anges kan en standardbudgetprincip tillämpas när du skapar eller ändrar jobbet. Se effective_budget_policy_id för den budgetprincip som används av den här arbetsbelastningen.
Har lagts till i Databricks CLI version 0.231.0
continuous Map En valfri kontinuerlig egenskap för det här arbetet. Den ständiga inställningen säkerställer att det alltid finns en process som körs. Endast en av schedule och continuous kan användas. Se kontinuerligt.
deployment Map Distributionsinformation för jobb som hanteras av externa källor. Se driftsättning.
description String En valfri beskrivning av jobbet. Den maximala längden är 27700 tecken i UTF-8-kodning.
email_notifications Map En valfri uppsättning e-postadresser som meddelas när detta jobb startar eller avslutas samt när detta jobb raderas. Se email_notifications.
environments Sequence En lista över miljöspecifikationer för aktivitetskörning som kan refereras till av serverlösa uppgifter i det här jobbet. En miljö måste finnas för serverlösa uppgifter. För serverlösa notebook-uppgifter är miljön tillgänglig i notebook-miljöpanelen. För andra serverlösa uppgifter måste aktivitetsmiljön anges med hjälp av environment_key i aktivitetsinställningarna. Se även miljöer.
format String Deprecated. Jobbets format.
git_source Map En valfri specifikation för en fjärransluten Git-lagringsplats som innehåller källkoden som används av uppgifter. Se job.git_source.
Viktig: Fältet git_source och aktivitetsfältet source som anges till GIT rekommenderas inte för paket, eftersom lokala relativa sökvägar kanske inte pekar på samma innehåll på Git-lagringsplatsen, och paketen förväntar sig att ett distribuerat jobb har samma innehåll som den lokala kopian från där det distribuerades.
Klona i stället lagringsplatsen lokalt och konfigurera ditt paketprojekt på den här lagringsplatsen, så att källan för aktiviteter är arbetsytan.
health Map En valfri uppsättning hälsoregler som kan definieras för det här jobbet. Se hälsa.
job_clusters Sequence En lista över specifikationer för jobbkluster som kan delas och återanvändas av uppgifter i det här jobbet. Se job_clusters.
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
max_concurrent_runs Integer Ett valfritt högsta tillåtna antal samtidiga körningar av jobbet. Ange det här värdet om du vill kunna köra samma jobb parallellt.
name String Ett valfritt namn för jobbet. Den maximala längden är 4 096 byte i UTF-8-kodning.
notification_settings Map Valfria meddelandeinställningar som används när meddelanden skickas till var och en av email_notifications och webhook_notifications för det här jobbet. Kontrollera notification_settings.
parameters Sequence Parameterdefinitioner på jobbnivå. Se job.parameters.
performance_target String Definierar hur högpresterande eller kostnadseffektiv körningen på serverlös ska vara.
Har lagts till i Databricks CLI version 0.241.0
permissions Sequence Jobbets behörigheter. Se behörigheter.
queue Map Jobbets köinställningar. Se kön.
run_as Map Användaren eller tjänsteprincipen som jobbet körs som. Detta fält anger den explicita konfigurationen av run_as för jobbet. Om det inte anges körs jobbet som den användare som skapade jobbet. Antingen user_name eller service_principal_name ska anges. Annars utlöses ett fel. Se run_as.
schedule Map Ett valfritt periodiskt schema för det här jobbet. Standardbeteendet är att jobbet bara körs när det utlöses genom att klicka på "Kör nu" i användargränssnittet för jobb eller skicka en API-begäran till runNow. Se schema.
tags Map En karta över taggar som är associerade med jobbet. Dessa vidarebefordras till klustret som klustertaggar för jobbkluster och omfattas av samma begränsningar som klustertaggar. Högst 25 taggar kan läggas till i jobbet.
tasks Sequence En lista över uppgiftsspecifikationer som ska utföras av den här uppgiften. Se Lägga till uppgifter i jobb i Deklarativa Automation-paket.
Har lagts till i Databricks CLI version 0.237.0
timeout_seconds Integer En valfri tidsgräns som tillämpas för varje körning av den här uppgiften. Ett värde av 0 betyder ingen timeout.
trigger Map En konfiguration som utlöser en körning när vissa villkor uppfylls. Se utlösare.
usage_policy_id String ID för den serverlösa användningsprincip som ska användas för det här jobbet.
Har lagts till i Databricks CLI version 0.273.0
webhook_notifications Map En samling systemnotifierings-ID:n som används för att meddela när körningar av detta jobb påbörjas eller slutförs. Se webhook_notifications.

job.kontinuerlig

Type: Map

Konfiguration för kontinuerlig jobbkörning.

Key Type Description
pause_status String Om det kontinuerliga arbetet är pausat eller inte. Giltiga värden: PAUSED, UNPAUSED.
task_retry_mode String Ange hur det fortlöpande arbetet tillämpar återförsök på aktivitetsnivå. Giltiga värden är NEVER och ON_FAILURE. Standardinställningen är NEVER.

jobb. utplacering

Type: Map

Distributionsinformation för jobb som hanteras av externa källor.

Key Type Description
kind String Typen av distribution. Till exempel BUNDLE.
metadata_file_path String Sökvägen till metadatafilen för distributionen.

job.email-aviseringar

Type: Map

Inställningar för e-postavisering för jobbkörningar.

Key Type Description
on_start Sequence En lista över e-postadresser som ska meddelas när en körning startar.
on_success Sequence En lista över e-postadresser som ska meddelas när en körning lyckas.
on_failure Sequence En lista över e-postadresser som ska meddelas när en körning misslyckas.
on_duration_warning_threshold_exceeded Sequence En lista över e-postadresser som meddelas när en exekveringstid överskrider varningströskeln.
no_alert_for_skipped_runs Boolean Huruvida man ska hoppa över att skicka aviseringar för överhoppade körningar.
on_streaming_backlog_exceeded Sequence En lista över e-postadresser som ska meddelas när tröskelvärden för kvarvarande strömningsloggar överskrids för alla strömmar. Tröskelvärden för kvarvarande strömningsloggar kan anges i health fältet med hjälp av följande mått: STREAMING_BACKLOG_BYTES, STREAMING_BACKLOG_RECORDS, STREAMING_BACKLOG_SECONDSeller STREAMING_BACKLOG_FILES. Aviseringar baseras på medelvärdet på 10 minuter för dessa mått. Om problemet kvarstår skickas meddelanden var 30:e minut.

jobb.miljöer

Type: Sequence

En lista över miljöspecifikationer för uppgiftsexekvering som serverlösa uppgifter i ett jobb kan referera till.

Varje objekt i listan är :JobEnvironment

Key Type Description
environment_key String Nyckeln för en miljö. Det måste vara unikt i ett jobb.
spec Map Entiteten som representerar en serverlös miljö. Se job.environments.spec.

jobb.environments.spec

Type: Map

Entiteten som representerar en serverlös miljö.

Key Type Description
client String Deprecated. Klientversionen.
dependencies Sequence Lista över pip-beroenden, som stöds av pip-versionen i den här miljön.
environment_version String Obligatoriskt. Miljöversion som används av miljön. Varje version levereras med en specifik Python version och en uppsättning Python paket. Versionen är en sträng som består av ett heltal.

job.git_source

Type: Map

Git-lagringsplatskonfiguration för jobbkällkod.

Key Type Description
git_branch String Namnet på den gren som ska checkas ut och användas av denna uppgift. Det går inte att ange det här fältet tillsammans med git_tag eller git_commit.
git_commit String Checka in för att checkas ut och användas av det här jobbet. Det går inte att ange det här fältet tillsammans med git_branch eller git_tag.
git_provider String Unik identifierare för tjänsten som används som värd för Git-lagringsplatsen. Värdet är skiftlägesoberoende. Giltiga värden är gitHub, bitbucketCloud, gitLab, azureDevOpsServices, gitHubEnterprise, , bitbucketServer. gitLabEnterpriseEdition
git_snapshot Map Skrivskyddat läge för fjärrlagret när jobbet kördes. Det här fältet ingår bara i jobbkörningar. Se git_snapshot.
git_tag String Namnet på taggen som ska checkas ut och användas av det här jobbet. Det går inte att ange det här fältet tillsammans med git_branch eller git_commit.
git_url String URL för lagringsplatsen som ska klonas av det här jobbet.
sparse_checkout Map Gles utcheckningskonfiguration för Git-lagringsplatsen. Se job.git_source.sparse_checkout.
Har lagts till i Databricks CLI version 0.290.0

job.git_source.sparse_checkout

Type: Map

Gles utcheckningskonfiguration för Git-lagringsplatsen.

Har lagts till i Databricks CLI version 0.290.0

Key Type Description
patterns Sequence Lista över mönster som ska inkluderas för gles utcheckning.
Har lagts till i Databricks CLI version 0.290.0

job.git_source.git_snapshot

Type: Map

Ögonblicksbild av skrivskyddad incheckningsinformation.

Key Type Description
used_commit String Incheckning som användes för att köra körningen. Om git_branch har angetts, pekar detta på grenens HEAD vid tidpunkten för körningen; om git_tag har angetts, pekar detta på den commit som taggen pekar på.

jobbtillstånd

Type: Map

Konfiguration av hälsoövervakning för jobbet.

Key Type Description
rules Sequence En lista över arbetshälsoregler. Varje regel innehåller en metric och op (operator) och value. Se job.health.rules.

jobb.hälsa.regler

Type: Sequence

En lista över arbetshälsoregler.

Varje objekt i listan är :JobHealthRule

Key Type Description
metric String Anger det hälsomått som utvärderas för en viss hälsoregel.
  • RUN_DURATION_SECONDS: Förväntad total tid för en körning i sekunder.
  • STREAMING_BACKLOG_BYTES: En uppskattning av det maximala antalet byte av data som väntar på att förbrukas över alla strömmar. Det här måttet finns i offentlig förhandsversion.
  • STREAMING_BACKLOG_RECORDS: En uppskattning av den maximala förskjutningsfördröjningen för alla strömmar. Det här måttet finns i offentlig förhandsversion.
  • STREAMING_BACKLOG_SECONDS: En uppskattning av den maximala konsumentfördröjningen för alla strömmar. Det här måttet finns i offentlig förhandsversion.
  • STREAMING_BACKLOG_FILES: En uppskattning av det maximala antalet utestående filer i alla strömmar. Det här måttet finns i offentlig förhandsversion.
op String Anger operatorn som används för att jämföra hälsomåttvärdet med det angivna tröskelvärdet.
value Integer Anger det tröskelvärde som hälsomåttet ska följa för att uppfylla hälsoregeln.

jobb.jobb_kluster

Type: Sequence

En lista över specifikationer för jobbkluster som kan delas och återanvändas av uppgifter i det här jobbet. Bibliotek kan inte deklareras i ett delat jobbkluster. Du måste deklarera beroende bibliotek i aktivitetsinställningar.

Varje objekt i listan är :JobCluster

Key Type Description
job_cluster_key String Ett unikt namn för jobbklustret. Det här fältet krävs och måste vara unikt i jobbet. JobTaskSettings kan referera till det här fältet för att avgöra vilket kluster som ska startas för uppgiftsutförandet.
new_cluster Map Om new_cluster en beskrivning av ett kluster som skapas för varje aktivitet. Se kluster.

jobb.notifikationsinställningar

Type: Map

Meddelandeinställningar som gäller för alla meddelanden för jobbet.

Key Type Description
no_alert_for_skipped_runs Boolean Huruvida man ska hoppa över att skicka aviseringar för överhoppade körningar.
no_alert_for_canceled_runs Boolean Om du vill hoppa över att skicka aviseringar för avbrutna körningar.

jobb.parametrar

Type: Sequence

En lista över definitioner för jobbparametrar.

Varje objekt i listan är :JobParameter

Key Type Description
default String Obligatoriskt. Standardvärdet för parametern, till exempel "användare".
name String Obligatoriskt. Namnet på den definierade parametern, till exempel "table". Giltiga värden innehåller endast alfanumeriska tecken, _, -och ..

jobb.kö

Type: Map

Köinställningar för jobbet.

Key Type Description
enabled Boolean Huruvida man ska aktivera köhantering för jobbet.

jobb.planera

Type: Map

Schemalägg konfiguration för periodisk jobbkörning.

Key Type Description
quartz_cron_expression String Ett Cron-uttryck med Quartz-syntax som anger när uppgiften utförs. Kör till exempel 0 0 9 * * ? jobbet varje dag kl. 09:00 UTC.
timezone_id String Tidszonen för schemat. Till exempel America/Los_Angeles eller UTC.
pause_status String Om schemat är pausat eller inte. Giltiga värden: PAUSED, UNPAUSED.

jobb.utlösare

Type: Map

Utlösarkonfiguration för händelsestyrd jobbkörning.

Key Type Description
file_arrival Map Utlösare vid filens ankomst. Se file_arrival.
table Map Utlösare baserad på en tabellstruktur. Se tabell.
table_update Map Utlösare baserat på tabelluppdateringar. Se table_update.
periodic Map Periodisk utlösare. Referera till periodisk.
pause_status String Oavsett om avtryckaren är pausad eller inte. Giltiga värden: PAUSED, UNPAUSED.

jobb.utlösare.fil_ankomst

Type: Map

Utlösarkonfiguration baserat på filens ankomst.

Key Type Description
url String Filsökvägen som ska övervakas för nya filer.
min_time_between_triggers_seconds Integer Minsta tid i sekunder mellan utlösarhändelser.
wait_after_last_change_seconds Integer Väntetid i sekunder efter den senaste filändringen innan den utlöses.

jobb.utlösare.tabell

Type: Map

Utlösarkonfiguration baserat på en tabell.

Key Type Description
table_names Sequence En lista över tabellnamn som ska övervakas.
condition String Det SQL-villkor som måste uppfyllas för att utlösa jobbet.

job.trigger.tabelluppdatering

Type: Map

Utlösarkonfiguration baserat på tabelluppdateringar.

Key Type Description
table_names Sequence En lista över tabellnamn som ska övervakas för uppdateringar.
condition String Det SQL-villkor som måste uppfyllas för att utlösa jobbet.
wait_after_last_change_seconds Integer Väntetid i sekunder efter den senaste tabelluppdateringen innan den utlöses.

job.trigger.periodisk

Type: Map

Periodisk utlösarkonfiguration.

Key Type Description
interval Integer Intervallvärdet för den periodiska utlösaren.
unit String Tidsenhet för intervallet. Giltiga värden: HOURS, DAYS, WEEKS.

jobb.webhook_notifieringar

Type: Map

Webhook-meddelandeinställningar för jobbkörningar.

Key Type Description
on_start Sequence En lista över webhook-meddelande-ID:er som ska meddelas när en körning startar.
on_success Sequence En lista över webhook-meddelande-ID:er som ska meddelas när en körning lyckas.
on_failure Sequence En lista över webhook-ID:er som ska informeras när en process misslyckas.
on_duration_warning_threshold_exceeded Sequence En lista över webhook-notifierings-ID:n som ska meddelas när körningens varaktighet överskrider varningströskeln.
on_streaming_backlog_exceeded Sequence En lista över systemmeddelande-ID:t som ska anropas när tröskelvärden för kvarvarande strömningsloggar överskrids för alla strömmar. Tröskelvärden för kvarvarande strömningsloggar kan anges i health fältet med hjälp av följande mått: STREAMING_BACKLOG_BYTES, STREAMING_BACKLOG_RECORDS, STREAMING_BACKLOG_SECONDSeller STREAMING_BACKLOG_FILES. Aviseringar baseras på medelvärdet på 10 minuter för dessa mått. Om problemet kvarstår skickas meddelanden var 30:e minut. Högst 3 mål kan anges.

Examples

I följande exempel definieras ett jobb med resursnyckeln hello-job med en notebook-uppgift:

resources:
  jobs:
    hello-job:
      name: hello-job
      tasks:
        - task_key: hello-task
          notebook_task:
            notebook_path: ./hello.py

I följande exempel definieras ett jobb med en SQL-notebook-fil:

resources:
  jobs:
    job_with_sql_notebook:
      name: 'Job to demonstrate using a SQL notebook with a SQL warehouse'
      tasks:
        - task_key: notebook
          notebook_task:
            notebook_path: ./select.sql
            warehouse_id: 799f096837fzzzz4

Ytterligare jobbkonfigurationsexempel finns i Jobbkonfiguration.

Information om hur du definierar jobbaktiviteter och övergripande jobbinställningar finns i:

job_run

Type: Map

Den job_run resursen triggar en körning av ett befintligt jobb som en del av paketdistributionen. Till skillnad från ett jobb, som definierar ett jobb, refererar ett jobb kört till ett befintligt jobb med ID.

Note

Att använda Deklarative Automation Bundles för att definiera jobbkörningar stöds endast om du använder Direct Deployment-motorn.

Har lagts till i Databricks CLI version 1.7.0

job_runs:
  <job_run-name>:
    <job_run-field-name>: <job_run-field-value>
Key Type Description
job_id Integer Obligatoriskt. ID för jobbet som ska köras.
Har lagts till i Databricks CLI version 1.7.0
job_parameters Map Jobbnivåparametrarna som används i körningen, till exempel param: overriding_val.
Har lagts till i Databricks CLI version 1.7.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 1.7.0
only Sequence En lista över aktivitetsnycklar som ska köras i jobbet. Om detta fält inte finns tillgängligt körs alla uppgifter i jobbet.
Prefixera en aktivitetsnyckel med för + att även köra dess uppströmsuppgifter, eller suffixera den med + för att även köra dess nedströmsuppgifter. Till exempel +my_task kör my_task och allt uppströms från den, my_task+ kör my_task och allt nedströms från den, och +my_task+ kör båda. En aktivitetsnyckel utan kör + bara den uppgiften.
Har lagts till i Databricks CLI version 1.7.0
performance_target String Prestandaläget på ett serverlöst jobb. Prestandamålet bestämmer nivån på beräkningsprestanda eller kostnadseffektivitet för körningen och åsidosätter det prestandamål som definierats på jobbnivå. Giltiga värden är STANDARD, vilket möjliggör kostnadseffektiv exekvering av serverlösa arbetsbelastningar, och PERFORMANCE_OPTIMIZED, som prioriterar snabb uppstart och exekveringstider genom snabb skalning och optimerad klusterprestanda.
Har lagts till i Databricks CLI version 1.7.0
pipeline_params Map Uppdateringsinställningarna för en pipeline-uppgift under körning. Se job_run.pipeline_params.
Har lagts till i Databricks CLI version 1.7.0
queue Map Köinställningarna för runet. Ställ enabled in på true för att aktivera kö för körningen.
Har lagts till i Databricks CLI version 1.7.0

job_run.pipeline_params

Type: Map

Uppdateringsinställningarna för en pipeline-uppgift under körning.

Har lagts till i Databricks CLI version 1.7.0

Key Type Description
full_refresh Boolean Om man ska trigga en fullständig uppdatering av Sparks deklarativa pipeline.
Har lagts till i Databricks CLI version 1.7.0
full_refresh_selection Sequence (Beta) En lista med tabeller som ska uppdateras med en fullständig uppdatering.
Har lagts till i Databricks CLI version 1.7.0
refresh_flow_selection Sequence (Beta) Flödesnamnen för selektiv uppdatering. Dessa kombineras med de andra selektiva uppdateringsalternativen, refresh_selection och full_refresh_selection, för att bestämma den slutliga uppsättningen flöden som ska uppdateras.
Har lagts till i Databricks CLI version 1.7.0
refresh_selection Sequence (Beta) En lista med tabeller att uppdatera utan fullständig uppdatering.
Har lagts till i Databricks CLI version 1.7.0
reset_checkpoint_selection Sequence (Beta) En lista över strömmande flöden för vilka man återställer kontrollpunkter utan att rensa data.
Har lagts till i Databricks CLI version 1.7.0

Example

Följande exempel utlöser en körning av ett befintligt jobb, som åsidosätter en jobbparameter och begränsar körningen till en enda uppgift och dess uppströmsuppgifter:

resources:
  job_runs:
    my_job_run:
      job_id: 123456789
      job_parameters:
        catalog: main
      only:
        - +my_task

modell (äldre)

Type: Map

Med modellresursen kan du definiera äldre modeller i paket. Databricks rekommenderar att du använder registrerade Unity Catalog-modeller i stället.

modellservering-endpunkt

Type: Map

Med den model_serving_endpoint resursen kan du definiera modell som betjänar slutpunkter. Se Hantera modell som betjänar slutpunkter.

model_serving_endpoints:
  <model_serving_endpoint-name>:
    <model_serving_endpoint-field-name>: <model_serving_endpoint-field-value>
Key Type Description
ai_gateway Map AI Gateway-konfigurationen för tjänandeslutpunkten. Obs! Endast externa modeller och etablerade dataflödesslutpunkter stöds för närvarande. Se ai_gateway.
Har lagts till i Databricks CLI version 0.230.0
budget_policy_id String ID:t för den budgetprincip som ska användas för den här slutpunkten.
Har lagts till i Databricks CLI version 0.244.0
config Map Kärnkonfigurationen för serverändpunkten. Se konfiguration.
description String En beskrivning av serverdelsslutpunkten.
Har lagts till i Databricks CLI version 0.260.0
email_notifications Map Konfiguration av e-postmeddelanden för serverdelsslutpunkten. Se email_notifications.
Har lagts till i Databricks CLI-version 0.264.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
name String Namnet på tjänsteslutpunkten. Det här fältet krävs och måste vara unikt för en Databricks-arbetsyta. Ett slutpunktsnamn kan bestå av alfanumeriska tecken, bindestreck och understreck.
permissions Sequence Den modell som betjänar slutpunktens behörigheter. Se behörigheter.
rate_limits Sequence Deprecated. Hastighetsbegränsningar som ska tillämpas på server-endpunkten. Använd AI Gateway för att hantera hastighetsgränser.
route_optimized Boolean Aktivera optimering av rutt för tjänsteändpunkten.
tags Sequence Taggar som ska kopplas till slutpunkt för servering och som automatiskt vidarebefordras till faktureringsloggar.
telemetry_config Map Konfigurationen för att bevara slutpunktstelemetri (loggar, spår och metrik) till Unity Catalog-tabeller. Vi telemetry_config.
Tillagd i Databricks CLI version 1.6.0

model_serving_endpoint.telemetry_config

Type: Map

Konfigurationen för att bevara slutpunktstelemetri (loggar, spår och metrik) till Unity Catalog-tabeller.

Tillagd i Databricks CLI version 1.6.0

Key Type Description
inference_table_config Map Konfigurationen för inferenstabellsloggning av nyttolast, inklusive provtagning.
Tillagd i Databricks CLI version 1.6.0
table_names Map Unity-katalogtabellerna till vilka ändpunktstelemetri (loggar, spår och metrik) exporteras. Ange detta för att skapa en ny telemetriprofil för slutpunkten från de givna tabellerna.
Tillagd i Databricks CLI version 1.10.0
telemetry_profile_id String ID:t för en befintlig telemetriprofil som ska tillämpas på denna endpoint. Ange detta för att återanvända en telemetriprofil som redan har skapats, istället för att specificera table_names.
Tillagd i Databricks CLI version 1.10.0

model_serving_endpoint.email_notifications

Type: Map

Konfiguration av e-postmeddelanden för serverdelsslutpunkten.

Key Type Description
on_update_failure Sequence En lista över e-postadresser som ska meddelas när en slutpunkt inte kan uppdatera sin konfiguration eller sitt tillstånd.
on_update_success Sequence En lista över e-postadresser som ska meddelas när en slutpunkt uppdaterar konfigurationen eller tillståndet.

modelbetjäningsändpunkt.ai-gateway

Type: Map

AI Gateway-konfiguration för tjänstslutpunkten.

Key Type Description
fallback_config Map Konfiguration för återställning av trafik som automatiskt återställs till andra hanterade entiteter om begäran till en hanterad entitet misslyckas med vissa felkoder för att öka tillgängligheten. Se fallback_config.
guardrails Map Skyddsräckeskonfiguration. Se skyddsräcken.
inference_table_config Map Konfiguration för slutsatsdragningsloggning till Unity Catalog-tabeller. Se inference_table_config.
rate_limits Sequence Hastighetsbegränsningskonfigurationer.
usage_tracking_config Map Konfiguration för spårning av användning. Se usage_tracking_config.

model_serving_endpoint.ai_gateway.fallback_config

Type: Map

Konfiguration för återställning av trafik som automatiskt återställs till andra hanterade entiteter om en begäran misslyckas med vissa felkoder.

Key Type Description
enabled Boolean Om återställning är aktiverat för den här slutpunkten.

modell_serving_endpoint.ai_gateway.skyddsräcken

Type: Map

Konfigurationen av AI-gatewayskyddsmekanismer.

Key Type Description
input Map Inmatningsbegränsningskonfiguration med fält som safety, pii.
output Map Utdataskyddskonfiguration med fält som safety, pii.
invalid_keywords Sequence En lista över nyckelord som ska blockeras.

model_serving_endpoint.ai_gateway.inference_table_config

Type: Map

Konfiguration för slutsatsdragningsloggning till Unity Catalog-tabeller.

Key Type Description
catalog_name String Namnet på katalogen i Unity Catalog.
schema_name String Namnet på schemat i Unity Catalog.
table_name_prefix String Prefixet för inferenstabellnamn.
enabled Boolean Om inferenstabellloggning är aktiverad.

model_serving_endpoint.ai_gateway.användningsspårningskonfiguration

Type: Map

AI-gatewaykonfigurationen för spårning av användning.

Key Type Description
enabled Boolean Om användningsspårning är aktiverat.

model_serving_endpoint.config

Type: Map

Kärnkonfigurationen för tjänstslutpunkten.

Key Type Description
served_entities Sequence En lista över betjänade entiteter som slutpunkten ska hantera. Varje hanterad entitet innehåller fält som entity_name, entity_version, workload_size, scale_to_zero_enabled, workload_type, environment_vars.
served_models Sequence (Inaktuell: använd served_entities i stället) En lista över serverade modeller för slutpunkten som ska användas.
traffic_config Map Trafikkonfigurationen som definierar hur anrop till serverslutpunkten ska dirigeras. Se traffic_config.

modell_serving_endpoint.config.traffic_config

Type: Map

Trafikkonfigurationen som definierar hur anrop till serverslutpunkten ska dirigeras.

Key Type Description
routes Sequence En lista över vägar för trafikdistribution. Varje väg innehåller served_model_name och traffic_percentage.

Example

I följande exempel definieras en Unity Catalog-modell som betjänar slutpunkten:

resources:
  model_serving_endpoints:
    uc_model_serving_endpoint:
      name: 'uc-model-endpoint'
      config:
        served_entities:
          - entity_name: 'myCatalog.mySchema.my-ads-model'
            entity_version: '10'
            workload_size: 'Small'
            scale_to_zero_enabled: 'true'
        traffic_config:
          routes:
            - served_model_name: 'my-ads-model-10'
              traffic_percentage: '100'
      tags:
        - key: 'team'
          value: 'data science'

-rörledning

Type: Map

Pipelines stöds i Python för deklarativa Automation-paket. Se databricks.bundles.pipelines.

Med pipelineresursen kan du skapa pipelines. Information om pipelines finns i Spark Deklarativa pipelines. En självstudiekurs som använder mallen Deklarativ Automation-paket för att skapa en pipeline finns i Utveckla pipelines med deklarativa Automation-paket.

pipelines:
  <pipeline-name>:
    <pipeline-field-name>: <pipeline-field-value>
Key Type Description
allow_duplicate_names Boolean Om det är falskt misslyckas distributionen om namnet står i konflikt med namnet på en annan pipeline.
Har lagts till i Databricks CLI version 0.261.0
budget_policy_id String Budgetprincip för den här pipelinen.
Har lagts till i Databricks CLI version 0.230.0
cascade_on_destroy Boolean Om förstörelsen av pipelinen också raderar dess dataset (materialiserade vyer, strömningstabeller och vyer). När den avaktiveras gäller serverstandarden. Ställ in på false att behålla dataseten vid destroy. Stöds av direktutrullningsmotorn.
Tillagd i Databricks CLI version 1.12.0
catalog String En katalog i Unity Catalog som du kan publicera data från den här pipelinen till. Om target anges publiceras tabeller i den här pipelinen till ett target schema inuti catalog (till exempel catalog.target.table). Om target inte anges publiceras inga data till Unity Catalog.
channel String Lakeflow-pipelines Release Channel som anger vilken version av Lakeflow-pipelines som ska användas.
clusters Sequence Klusterinställningarna för den här pipeline-distributionen. Se kluster.
configuration Map Konfigurationen för den här pipelinekörningen.
continuous Boolean Om pipelinen är kontinuerlig eller triggad. Detta ersätter trigger.
deployment Map Distributionstyp för den här pipelinen. Se driftsättning.
development Boolean Om pipelinen är i utvecklingsläge. Standardvärdet är falskt.
dry_run Boolean Om pipelinen är en torrkörningspipeline.
edition String Pipeline-produktutgåvan.
environment Map Miljöspecifikationen för den här pipelinen som används för att installera beroenden för serverlös beräkning. Se miljö. Den här nyckeln stöds endast i Databricks CLI version 0.258 och senare.
Har lagts till i Databricks CLI version 0.257.0
event_log Map Händelseloggkonfigurationen för den här pipelinen. Se event_log.
Har lagts till i Databricks CLI version 0.246.0
filters Map Filtren som avgör vilka pipelinepaket som ska ingå i den distribuerade grafen. Se filter.
gateway_definition Map Konfigurationen för en gateway-pipeline. De här inställningarna kan inte användas med ingestion_definition inställningarna.
id String Unik identifierare för den här pipelinen.
ingestion_definition Map Konfigurationen för en hanterad inmatningspipeline. De här inställningarna kan inte användas med librariesinställningarna , schema, targeteller catalog . Se ingestion_definition.
libraries Sequence En lista över bibliotek eller kod som behövs för den här distributionen. Se pipeline.libraries.
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
name String Ett vänligt namn för den här pipelinen.
notifications Sequence Meddelandeinställningarna för den här pipelinen. Se meddelanden.
parameters Map Standardparametrarna att använda för pipeline-exekvering, där varje nyckel är namnet på parametern och värdet är parametervärdet. Den maximala totala storleken är 10 000 tecken i JSON-format.
permissions Sequence Pipelinens behörigheter. Se behörigheter.
photon Boolean Om Photon är aktiverat för den här pipelinen. Den här nyckeln ignoreras om serverless är inställd på true.
restart_window Map Definierar ett omstartsfönster för den här pipelinen. Pipelines kan startas om i det här fönstret utan att hamna på efterkälken.
root_path String Rotsökvägen för den här pipelinen. Detta används som rotkatalog när du redigerar pipelinen i Databricks-användargränssnittet och läggs till i sys.path när Python-källor körs under pipelinekörningen.
Har lagts till i Databricks CLI version 0.253.0
run_as Map Identiteten som pipelinen körs som. Om den inte anges körs pipelinen som den användare som skapade pipelinen. Endast user_name eller service_principal_name kan anges. Om båda anges utlöses ett fel. Se run_as.
Har lagts till i Databricks CLI version 0.241.0
schema String Standardschemat (databasen) där tabeller läse från eller publiceras till.
Har lagts till i Databricks CLI version 0.230.0
serverless Boolean Om serverlös beräkning är aktiverad för den här pipelinen.
storage String DBFS-rotkatalogen för lagring av kontrollpunkter och tabeller.
tags Map En karta över taggar som är associerade med pipelinen. Dessa vidarebefordras till klustret som klustertaggar och omfattas därför av samma begränsningar. Högst 25 taggar kan läggas till i pipelinen.
Har lagts till i Databricks CLI version 0.256.0
target String Målschema (databas) för att lägga till tabeller i den här pipelinen. Exakt en av schema eller target måste anges. Om du vill publicera till Unity Catalog, ange också catalog. Det här äldre fältet är inaktuellt för att skapa pipelinen till förmån för fältet schema .
usage_policy_id String ID för den serverlösa användningsprincip som ska användas för den här pipelinen.
Har lagts till i Databricks CLI version 0.273.0

pipeline.driftsättning

Type: Map

Konfiguration av distributionstyp för pipelinen.

Key Type Description
kind String Typen av distribution. Till exempel BUNDLE.
metadata_file_path String Sökvägen till metadatafilen för distributionen.

pipeline.miljö

Type: Map

Miljöspecifikation för installation av beroenden på serverlös beräkning.

Key Type Description
dependencies Sequence En lista över pip-beroenden som stöds av pip-versionen i den här miljön. Varje beroende är en rad i en pip-kravfil.
environment_version String (Beta) Miljöversionen av den serverlösa Python-miljön som används för att köra kund-Python-kod, till exempel4. Varje miljöversion inkluderar en specifik Python-version och en kurerad uppsättning förinstallerade bibliotek med definierade versioner, vilket ger en stabil och reproducerbar exekveringsmiljö. Databricks stöder en livscykel på tre år för varje miljöversion. För tillgängliga versioner och deras inkluderade paket, se Miljöversioner.
Har lagts till i Databricks CLI version 0.294.0

pipeline.event_log

Type: Map

Konfiguration av händelselogg för pipelinen.

Key Type Description
catalog String Unity Catalog-katalogen som händelseloggen publiceras under.
name String Namnet som händelseloggen publiceras till i Unity Catalog.
schema String Unity Catalog-schemat som händelseloggen publiceras under.

rörledning.filter

Type: Map

Filter som avgör vilka pipelinepaket som ska ingå i den distribuerade grafen.

Key Type Description
include Sequence En lista över paketnamn som ska inkluderas.
exclude Sequence En lista över paketnamn som ska undantas.

pipeline.ingestion_definition

Type: Map

Konfiguration för en hanterad inmatningspipeline. De här inställningarna kan inte användas med librariesinställningarna , schema, targeteller catalog .

Key Type Description
connection_name String Namnet på anslutningen som ska användas för inmatning. Om du vill skapa anslutningar programmatiskt för anslutningsappar som stöder API-endast autentisering använder du databricks connections create i ett fördistribueringsskript eller jobbuppgift. Se Distribution.
connector_type String Valfritt. Anslutningstyp för källor. Giltiga värden är CDC och QUERY_BASED.
Har lagts till i Databricks CLI-version 0.296.0
data_staging_options Map Valfritt. Plats för mellanlagrad datalagring. Detta krävs för migrering från en CDC-hanterad inmatningspipeline med en gateway-pipeline till en kombinerad CDC-hanterad inmatningspipeline. Om det inte anges skapas volymen för mellanlagrade data i katalogen och schemat/målet som anges i pipelinedefinitionen på den översta nivån.
Har lagts till i Databricks CLI-version 0.296.0
full_refresh_window Map Valfritt. Ett fönster som anger en uppsättning tidsintervall för ögonblicksbildsfrågor i CDC.
ingest_from_uc_foreign_catalog Boolean Oföränderliga. Om värdet är true matar pipelinen in tabeller från unity-katalogens externa kataloger direkt utan att behöva ange en Unity Catalog-anslutning eller inmatningsgateway. Fälten source_catalog i objekten i IngestionConfig tolkas som unity-katalogens externa kataloger att mata in från.
Har lagts till i Databricks CLI version 0.279.0
ingestion_gateway_id String ID för inmatningsgatewayen.
objects Sequence Obligatoriskt. Inställningar som anger tabeller som ska replikeras och målet för de replikerade tabellerna. Varje objekt kan vara en SchemaSpec, TableSpec eller ReportSpec.
source_type String Krävs när du använder source_configurations. Anger anslutningstypen (till exempel POSTGRESQL, MYSQL).
source_configurations Sequence Källkonfigurationsparametrar på katalognivå. När du använder det här fältet måste du också ange source_type. Se source_configurations.
table_configuration Map Konfiguration för inmatningstabellerna. Titta på table_configuration.

SchemaSpec

Type: Map

Schemaobjektspecifikation för inmatning av alla tabeller från ett schema.

Key Type Description
source_schema String Namnet på källschemat som ska matas in.
destination_catalog String Namnet på målkatalogen i Unity Catalog.
destination_schema String Namnet på målschemat i Unity Catalog.
table_configuration Map Konfiguration som ska tillämpas på alla tabeller i det här schemat. Se pipeline.ingestion_definition.table_configuration.

TableSpec

Type: Map

Tabellobjektspecifikation för inmatning av en specifik tabell.

Key Type Description
source_schema String Namnet på källschemat som innehåller tabellen.
source_table String Namnet på källtabellen som ska importeras.
destination_catalog String Namnet på målkatalogen i Unity Catalog.
destination_schema String Namnet på målschemat i Unity Catalog.
destination_table String Namnet på måltabellen i Unity Catalog.
table_configuration Map Konfiguration för den här specifika tabellen. Se pipeline.ingestion_definition.table_configuration.

Rapportspecifikation

Type: Map

Rapportobjektspecifikation för inmatning av analysrapporter.

Key Type Description
source_url String Url:en för källrapporten.
source_report String Källrapportens namn eller identifierare.
destination_catalog String Namnet på målkatalogen i Unity Catalog.
destination_schema String Namnet på målschemat i Unity Catalog.
destination_table String Namnet på måltabellen för rapportdata.
table_configuration Map Konfiguration för rapporttabellen. Se pipeline.ingestion_definition.table_configuration.

pipeline.ingestion_definition.source_konfigurationer

Type: Sequence

Konfiguration för källan. Varje element i sekvensen är en karta som innehåller konfiguration på katalognivå.

Key Type Description
catalog Map Källkonfigurationsparametrar på katalognivå. Se katalog.
pipeline.ingestion_definition.source_configurations.catalog

Type: Map

Källkonfigurationsparametrar på katalognivå

Key Type Description
postgres Map Postgres-specifika konfigurationsparametrar på katalognivå. Innehåller en slot_config nyckel som representerar Map postgres-fackkonfigurationen som ska användas för logisk replikering.
source_catalog String Källkatalogens namn.

pipeline.ingestion_definition.table_konfiguration

Type: Map

Konfigurationsalternativ för inmatningstabeller.

Key Type Description
exclude_columns Sequence En lista över kolumnnamn som ska undantas för inmatningen. När det inte anges include_columns styr fullständigt vilka kolumner som ska matas in. När de anges inkluderas alla andra kolumner, inklusive framtida, automatiskt för inmatning. Det här fältet är ömsesidigt uteslutande med include_columns.
include_columns Sequence En lista över kolumnnamn som ska inkluderas för inmatningen. När det inte anges inkluderas alla kolumner utom de som finns i exclude_columns . Framtida kolumner inkluderas automatiskt. När de anges undantas alla andra framtida kolumner automatiskt från inmatning. Det här fältet är ömsesidigt uteslutande med exclude_columns.
primary_keys Sequence En lista över kolumnnamn som ska användas som primära nycklar för tabellen.
sequence_by Sequence Kolumnnamnen som anger den logiska ordningen för händelser i källdata. Spark Declarative Pipelines använder den här sekvenseringen för att hantera ändringshändelser som anländer utanför ordningen.

pipelines.bibliotek

Type: Sequence

Definierar listan över bibliotek eller kod som behövs av den här pipelinen.

Varje objekt i listan är en definition:

Key Type Description
file Map Sökvägen till en fil som definierar en pipeline och lagras i Databricks Repos. Se pipeline.libraries.file.
glob Map Det enhetliga fältet som ska innehålla källkod. Varje post kan vara en notebook-sökväg, en filsökväg eller en mappsökväg som slutar /**. Det här fältet kan inte användas tillsammans med notebook eller file. Se pipeline.libraries.glob.
notebook Map Sökvägen till en notebook-fil som definierar en pipeline och lagras på Databricks-arbetsytan. Se pipeline.libraries.notebook.
whl String Det här fältet är inaktuellt

pipeline.bibliotek.fil

Type: Map

Sökvägen till en fil som definierar en pipeline och lagras i Databricks-Repos.

Key Type Description
path String Den absoluta sökvägen för källkoden.

pipeline.bibliotek.glob

Type: Map

Det enhetliga fältet som ska innehålla källkod. Varje post kan vara en notebook-sökväg, en filsökväg eller en mappsökväg som slutar /**. Det här fältet kan inte användas tillsammans med notebook eller file.

Key Type Description
include String Källkoden som ska inkluderas för pipelines

pipeline.libraries.notebook

Type: Map

Sökvägen till en notebook-fil som definierar en pipeline och lagras på Databricks-arbetsytan.

Key Type Description
path String Den absoluta sökvägen för källkoden.

pipeline.notifikationer

Type: Sequence

Meddelandeinställningarna för den här pipelinen. Varje objekt i sekvensen är en meddelandekonfiguration.

Key Type Description
alerts Sequence En lista över aviseringar som utlöser meddelanden. Giltiga värden är on-update-success, on-update-failure, on-update-fatal-failure, on-flow-failure.
email_recipients Sequence En lista över e-postadresser som ska meddelas när en konfigurerad avisering utlöses.

Example

I följande exempel definieras en pipeline med resursnyckeln hello-pipeline:

resources:
  pipelines:
    hello-pipeline:
      name: hello-pipeline
      clusters:
        - label: default
          num_workers: 1
      development: true
      continuous: false
      channel: CURRENT
      edition: CORE
      photon: false
      libraries:
        - notebook:
            path: ./pipeline.py

Ytterligare exempel på pipelinekonfiguration finns i Pipelinekonfiguration.

postgres_branch

Viktigt!

Den här funktionen finns i Beta.

Type:Map

Med Postgres-grenresursen kan du definiera Lakebase-grenar i ett paket. Du måste också definiera motsvarande Postgres-projekt och beräkningsslutpunkter.

Har lagts till i Databricks CLI version 0.287.0

postgres_branches:
  <postgres_branch-name>:
    <postgres_branch-field-name>: <postgres_branches-field-value>
Key Type Description
branch_id String Det ID som ska användas för grenen. Detta blir den sista komponenten i grenens resursnamn. ID:t krävs och måste vara 1–63 tecken långt, börja med en gemen bokstav och endast innehålla gemener, siffror och bindestreck. Till exempel kommer development att bli projects/my-app/branches/development.
Har lagts till i Databricks CLI version 0.287.0
expire_time String Absolut förfallotidsstämpel. När grenen har angetts upphör den att gälla just nu.
Har lagts till i Databricks CLI version 0.287.0
is_protected Boolean När värdet är true skyddar du grenen från borttagning och återställning. Associerade beräkningsslutpunkter och projektet kan inte tas bort medan grenen är skyddad.
Har lagts till i Databricks CLI version 0.287.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.287.0
no_expiry Boolean Inaktivera förfallodatum uttryckligen. När värdet är true upphör grenen inte att gälla. Om värdet är falskt är begäran ogiltig. ange antingen ttl eller expire_time i stället.
Har lagts till i Databricks CLI version 0.287.0
parent String Projektet där den här grenen ska skapas. Format: projects/{project_id}
Har lagts till i Databricks CLI version 0.287.0
purge_on_delete Boolean Om man ska rensa filialens data när den raderas.
Har lagts till i Databricks CLI version 1.7.0
replace_existing Boolean Om du vill ersätta en befintlig gren som har samma ID vid distribution.
Har lagts till i Databricks CLI version 1.0.0
source_branch String Namnet på källgrenen som den här grenen skapades från (data härkomst för återställning till tidpunkt). Om det inte anges, är standardvärdet för projektets standardgren. Format: projects/{project_id}/branches/{branch_id}
Har lagts till i Databricks CLI version 0.287.0
source_branch_lsn String Loggsekvensnumret (LSN) på källgrenen som den här grenen skapades från.
Har lagts till i Databricks CLI version 0.287.0
source_branch_time String Tidpunkten för källgrenen som den här grenen skapades från.
Har lagts till i Databricks CLI version 0.287.0
ttl String Relativ varaktighet för time-to-live. När grenen har angetts upphör den att gälla vid creation_time + ttl.
Har lagts till i Databricks CLI version 0.287.0

Example

Se postgres_projects exempel.

postgres_catalog

Viktigt!

Den här funktionen finns i Beta.

Type: Map

Med Postgres-katalogresursen kan du definiera Lakebase Postgres-kataloger i ett paket. Varje katalog binder en Unity Catalog-katalog till en Postgres-databas på en Lakebase Autoscaling-gren.

Har lagts till i Databricks CLI version 1.0.0

postgres_catalogs:
  <postgres_catalog-name>:
    <postgres_catalog-field-name>: <postgres_catalog-field-value>
Key Type Description
branch String Lakebase Autoscaling-grenen som stöder katalogen.
Har lagts till i Databricks CLI version 1.0.0
catalog_id String Obligatoriskt. ID:t för Unity Catalog-katalogen som ska bindas till Postgres-databasen.
Har lagts till i Databricks CLI version 1.0.0
create_database_if_missing Boolean Om du vill skapa Postgres-databasen om den inte redan finns.
Har lagts till i Databricks CLI version 1.0.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 1.0.0
postgres_database String Obligatoriskt. Namnet på Postgres-databasen som ska bindas till katalogen.
Har lagts till i Databricks CLI version 1.0.0

Example

resources:
  postgres_projects:
    project:
      project_id: test-pg-project
      display_name: Test Postgres Project

  postgres_catalogs:
    catalog:
      catalog_id: test_catalog
      branch: ${resources.postgres_projects.project.name}/branches/production
      postgres_database: appdb
      create_database_if_missing: true

postgres_database

Viktigt!

Den här funktionen finns i Beta.

Type: Map

Med Postgres-databasresursen kan du definiera Lakebase Postgres-databaser i ett paket. Varje databas skapas på en Lakebase Autoscaling-gren.

Har lagts till i Databricks CLI version 1.4.0

postgres_databases:
  <postgres_database-name>:
    <postgres_database-field-name>: <postgres_database-field-value>
Key Type Description
database_id String Obligatoriskt. Det ID som ska användas för databasen. Detta blir den sista komponenten i databasens resursnamn.
Har lagts till i Databricks CLI version 1.4.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 1.4.0
parent String Obligatoriskt. Den gren där den här databasen skapas. Format: projects/{project_id}/branches/{branch_id}.
Har lagts till i Databricks CLI version 1.4.0
postgres_database String Namnet på Postgres-databasen.
Har lagts till i Databricks CLI version 1.4.0
replace_existing Boolean Om du vill ersätta en befintlig databas som har samma ID vid distribution.
Har lagts till i Databricks CLI version 1.7.0
role String Krävs vid skapande. Resursnamnet för postgres-rollen som äger databasen. Format: projects/{project_id}/branches/{branch_id}/roles/{role_id}.
Har lagts till i Databricks CLI version 1.4.0

Examples

resources:
  postgres_projects:
    my_project:
      project_id: test-pg-proj
      display_name: 'Test Project for Database'
      pg_version: 16
      history_retention_duration: '604800s'

  postgres_branches:
    main:
      parent: ${resources.postgres_projects.my_project.id}
      branch_id: main
      no_expiry: true

  postgres_roles:
    owner:
      parent: ${resources.postgres_branches.main.id}
      role_id: app-owner
      postgres_role: app_owner

  postgres_databases:
    my_database:
      parent: ${resources.postgres_branches.main.id}
      database_id: my-database
      postgres_database: app_db
      # The live API requires `role`. Declare an explicit role so the bundle is
      # portable across users (the auto-created project-owner role's id is
      # derived from the creator's identity).
      role: ${resources.postgres_roles.owner.id}

postgres_endpoint

Viktigt!

Den här funktionen finns i Beta.

Type: Map

Postgres endpoint-resurs låter dig definiera Lakebase-beräkningsendpoints i ett paket. Du måste också definiera motsvarande Lakebase-projekt och Lakebase-grenar.

Har lagts till i Databricks CLI version 0.287.0

postgres_endpoints:
  <postgres_endpoint-name>:
    <postgres_endpoint-field-name>: <postgres_endpoint-field-value>
Key Type Description
autoscaling_limit_max_cu Nummer Det maximala antalet beräkningsenheter. Minimivärdet är 0,5.
Har lagts till i Databricks CLI version 0.287.0
autoscaling_limit_min_cu Nummer Det minsta antalet beräkningsenheter. Minimivärdet är 0,5.
Har lagts till i Databricks CLI version 0.287.0
disabled Boolean Om anslutningar till beräkningsslutpunkten ska begränsas. Om du aktiverar det här alternativet schemaläggs en pausad beräkningsåtgärd. En inaktiverad beräkningsslutpunkt kan inte aktiveras av en anslutnings- eller konsolåtgärd.
Har lagts till i Databricks CLI version 0.287.0
endpoint_id String Det ID som ska användas för slutpunkten. Detta blir den sista komponenten i slutpunktens resursnamn. ID:t krävs och måste vara 1–63 tecken långt, börja med en gemen bokstav och endast innehålla gemener, siffror och bindestreck. Till exempel kommer primary att bli projects/my-app/branches/development/endpoints/primary.
Har lagts till i Databricks CLI version 0.287.0
endpoint_type String Slutpunktstypen. En gren kan bara ha en READ_WRITE slutpunkt. Möjliga värden: ENDPOINT_TYPE_READ_WRITE, ENDPOINT_TYPE_READ_ONLY.
Har lagts till i Databricks CLI version 0.287.0
group Map Konfiguration av slutpunktsgrupp. Se postgres_endpoint.group.
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.287.0
no_suspension Boolean När värdet är true inaktiverar du uttryckligen automatisk avstängning (pausa aldrig). Ska anges till sant när det anges.
Har lagts till i Databricks CLI version 0.287.0
parent String Den gren där den här slutpunkten skapas. Format: projects/{project_id}/branches/{branch_id}
Har lagts till i Databricks CLI version 0.287.0
replace_existing Boolean Om du vill ersätta en befintlig beräkningsslutpunkt som har samma ID vid distribution.
Har lagts till i Databricks CLI version 1.0.0
settings Map En samling inställningar för en beräkningsslutpunkt.
Har lagts till i Databricks CLI version 0.287.0
suspend_timeout_duration String Varaktighet för inaktivitet varefter beräkningsslutpunkten pausas automatiskt. Om det anges bör vara mellan 60-talet och 604800-talet (1 minut till 1 vecka).
Har lagts till i Databricks CLI version 0.287.0

postgres_endpoint.grupp

Type: Map

Konfiguration av slutpunktsgrupp.

Key Type Description
enable_readable_secondaries Boolean Om du vill tillåta skrivskyddade anslutningar till skrivskyddade slutpunkter. Endast relevant för skrivskyddade slutpunkter där group.max > 1.
max Integer Obligatoriskt. Det maximala antalet beräkningar i slutpunktsgruppen. För närvarande måste detta vara lika med min. Ange till 1 för enskilda beräkningsslutpunkter för att inaktivera hög tillgänglighet (HA). Om du vill pausa alla beräkningar i en slutpunktsgrupp manuellt anger du disabled till true på slutpunkten.
min Integer Obligatoriskt. Det minsta antalet beräkningar i slutpunktsgruppen. För närvarande måste detta vara lika med max. Detta måste vara större än eller lika med 1.

Example

Se postgres_projects exempel.

postgres_project

Viktigt!

Den här funktionen finns i Beta.

Type: Map

Med Postgres-projektresursen kan du definiera Postgres-databasprojekt för autoskalning av Lakebase i ett paket. Du måste också definiera motsvarande Postgres-grenar och beräkningsslutpunkter.

Har lagts till i Databricks CLI version 0.287.0

postgres_projects:
  <postgres_project-name>:
    <postgres_project-field-name>: <postgres_project-field-value>
Key Type Description
budget_policy_id String Budgetprincip-ID för det här projektet.
custom_tags Sequence Anpassade taggar för det här projektet. Se postgres_project.custom_tags.
default_branch String Standardgrenen för projektet i formatet projects/{project_id}/branches/{branch_id}.
default_endpoint_settings Map En samling inställningar för en beräkningsslutpunkt. Se postgres_project.default_endpoint_settings.
Har lagts till i Databricks CLI version 0.287.0
display_name String Projektnamn som kan läsas av människor. Längden ska vara mellan 1 och 256 tecken.
Har lagts till i Databricks CLI version 0.287.0
enable_pg_native_login Boolean Om du vill aktivera inbyggd Postgres-inloggning för projektet.
Har lagts till i Databricks CLI version 0.294.0
history_retention_duration String Antalet sekunder för att behålla den delade historiken för återställning till tidpunkt för alla grenar i det här projektet. Värdet ska vara mellan 0s och 2592000s (upp till 30 dagar).
Har lagts till i Databricks CLI version 0.287.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.287.0
permissions Sequence Behörigheterna för Postgres-projektet. Se behörigheter.
Har lagts till i Databricks CLI version 0.292.0
pg_version Integer Huvudnumret för Postgres-versionen. Versioner som stöds är 16 och 17.
Har lagts till i Databricks CLI version 0.287.0
project_id String Det ID som ska användas för Project. Detta blir den sista komponenten i projektets resursnamn. ID:t krävs och måste vara 1–63 tecken långt, börja med en gemen bokstav och endast innehålla gemener, siffror och bindestreck. Till exempel kommer my-app att bli projects/my-app.
Har lagts till i Databricks CLI version 0.287.0
purge_on_delete Boolean Om projektets data ska rensas när de tas bort.
Har lagts till i Databricks CLI version 1.2.0

exempel

resources:
  postgres_projects:
    my_db:
      project_id: test-prod-app
      display_name: 'Production Database'
      pg_version: 17

  postgres_branches:
    main:
      parent: ${resources.postgres_projects.my_db.id}
      branch_id: main
      is_protected: false
      no_expiry: true

  postgres_endpoints:
    primary:
      parent: ${resources.postgres_branches.main.id}
      endpoint_id: primary
      endpoint_type: ENDPOINT_TYPE_READ_WRITE
      autoscaling_limit_min_cu: 0.5
      autoscaling_limit_max_cu: 4

postgres_project.custom_tags

Type: Sequence

En lista över anpassade taggar för projektet.

Key Type Description
key String Nyckeln för den anpassade taggen.
value String Värdet för den anpassade taggen.

postgres_project.default_endpoint_settings

Type: Map

Key Type Description
autoscaling_limit_max_cu Nummer Det maximala antalet beräkningsenheter. Minimivärdet är 0,5.
autoscaling_limit_min_cu Nummer Det minsta antalet beräkningsenheter. Minimivärdet är 0,5.
no_suspension Boolean När värdet är true inaktiverar du uttryckligen automatisk avstängning (pausa aldrig). Ska anges till sant när det anges. Ömsesidigt uteslutande med suspend_timeout_duration. När du uppdaterar använder du spec.project_default_settings.suspension i update_mask.
pg_settings Map En rå representation av Postgres-inställningar.
suspend_timeout_duration String Varaktighet för inaktivitet varefter beräkningsslutpunkten pausas automatiskt. Om det anges bör vara mellan 60-talet och 604800-talet (1 minut till 1 vecka). Ömsesidigt uteslutande med no_suspension. När du uppdaterar använder du spec.project_default_settings.suspension i update_mask.

postgres_role

Viktigt!

Den här funktionen finns i Beta.

Type: Map

Med Postgres-rollresursen kan du definiera Lakebase Postgres-roller i ett paket. Varje roll skapas på en Lakebase Autoscaling-gren.

Har lagts till i Databricks CLI version 1.4.0

postgres_roles:
  <postgres_role-name>:
    <postgres_role-field-name>: <postgres_role-field-value>
Key Type Description
attributes Map Önskade API-exponerade Postgres-rollattribut som ska associeras med rollen. Se postgres_role.attributes.
Har lagts till i Databricks CLI version 1.4.0
auth_method String Hur rollen autentiseras när du ansluter till Postgres. Om det lämnas ospecificerat härleds en meningsfull autentiseringsmetod från identity_type. Giltiga värden är NO_LOGIN, PG_PASSWORD_SCRAM_SHA_256, LAKEBASE_OAUTH_V1.
Har lagts till i Databricks CLI version 1.4.0
identity_type String Den typ av Databricks-hanterad identitet som den här rollen representerar. Lämna tom om du vill skapa en vanlig Postgres-roll som inte är associerad med en Databricks-identitet. Giltiga värden är USER, SERVICE_PRINCIPAL, GROUP.
Har lagts till i Databricks CLI version 1.4.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 1.4.0
membership_roles Sequence Standardroller som den här rollen är medlem i.
Har lagts till i Databricks CLI version 1.4.0
parent String Obligatoriskt. Grenen där den här rollen skapas. Format: projects/{project_id}/branches/{branch_id}.
Har lagts till i Databricks CLI version 1.4.0
postgres_role String Namnet på Postgres-rollen. Krävs när du skapar rollen. Om du vill skapa en Postgres-roll som backas upp av en hanterad Databricks-identitet postgres_role måste du vara något av följande:
  • Användarens e-post, för en identity_type av USER.
  • Program-ID för en identity_type av SERVICE_PRINCIPAL.
  • Gruppnamn, för en identity_type av GROUP.

Har lagts till i Databricks CLI version 1.4.0
replace_existing Boolean Om du vill ersätta en befintlig roll som har samma ID vid distribution.
Har lagts till i Databricks CLI version 1.7.0
role_id String Obligatoriskt. Det användardefinierade roll-ID:t; blir den sista komponenten i rollens resursnamn. Måste vara 4–63 tecken, gemener, siffror och bindestreck (RFC 1123).
Har lagts till i Databricks CLI version 1.4.0

postgres_role.attribut

Type: Map

Önskade API-exponerade Postgres-rollattribut som ska associeras med rollen.

Har lagts till i Databricks CLI version 1.4.0

Key Type Description
bypassrls Boolean Om rollen kringgår säkerhet på radnivå.
createdb Boolean Om rollen kan skapa databaser.
createrole Boolean Om rollen kan skapa, ändra, släppa, kommentera och ändra säkerhetsetiketten för andra roller.

Examples

resources:
  postgres_projects:
    my_project:
      project_id: my-pg-proj
      display_name: 'Test Project for Role'
      pg_version: 16
      history_retention_duration: '604800s'

  postgres_branches:
    main:
      parent: ${resources.postgres_projects.my_project.id}
      branch_id: main
      no_expiry: true

  postgres_roles:
    my_role:
      parent: ${resources.postgres_branches.main.id}
      role_id: my-role
      postgres_role: app_role
      attributes:
        createdb: true

postgres_synced_table

Viktigt!

Den här funktionen finns i Beta.

Type: Map

Med den postgres-synkroniserade tabellresursen kan du definiera Lakebase Postgres-synkroniserade tabeller i ett paket. Varje synkroniserad tabell replikerar kontinuerligt en Unity Catalog Delta-källtabell till en Postgres-tabell på en Lakebase Autoscaling-instans.

Har lagts till i Databricks CLI version 1.0.0

postgres_synced_tables:
  <postgres_synced_table-name>:
    <postgres_synced_table-field-name>: <postgres_synced_table-field-value>
Key Type Description
branch String Lakebase Autoscaling-grenen där den synkroniserade tabellen skapas.
Har lagts till i Databricks CLI version 1.0.0
create_database_objects_if_missing Boolean Om du vill skapa den synkroniserade tabellens logiska databas och schemaresurser om de inte redan finns.
Har lagts till i Databricks CLI version 1.0.0
existing_pipeline_id String ID:t för en befintlig pipeline. Om detta anges kommer den synkroniserade tabellen att binpackas till den befintliga pipeline:n som refereras till. Detta undviker att skapa en ny pipeline och tillåter delning av befintlig beräkning. I det här fallet måste den scheduling_policy synkroniserade tabellen matcha schemaläggningsprincipen för den befintliga pipelinen. Högst en av existing_pipeline_id och new_pipeline_spec bör definieras.
Har lagts till i Databricks CLI version 1.0.0
extra_columns Sequence De extra PostgreSQL-kolumnerna att lägga till i den synkroniserade tabellen, utöver de som replikeras från källtabellen.
Tillagd i Databricks CLI version 1.10.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 1.0.0
new_pipeline_spec Map Specifikationen för en ny rörledning. Se postgres_synced_table.new_pipeline_spec. Högst en av existing_pipeline_id och new_pipeline_spec bör definieras.
Har lagts till i Databricks CLI version 1.0.0
postgres_database String Namnet på postgres-måldatabasen för den synkroniserade tabellen.
Har lagts till i Databricks CLI version 1.0.0
primary_key_columns Sequence Listan med kolumnnamn som utgör primärnyckeln.
Har lagts till i Databricks CLI version 1.0.0
scheduling_policy String Schemaläggningsprincip för den synkroniserade tabellens underliggande pipeline. Giltiga värden är CONTINUOUS, TRIGGERED, SNAPSHOT.
Har lagts till i Databricks CLI version 1.0.0
source_table_full_name String Det fullständiga namnet på källtabellen i formatet catalog.schema.table.
Har lagts till i Databricks CLI version 1.0.0
synced_table_id String Obligatoriskt. Det ID som ska användas för den synkroniserade tabellen.
Har lagts till i Databricks CLI version 1.0.0
timeseries_key String Tidsserienyckel för att avduplicera rader med samma primärnyckel.
Har lagts till i Databricks CLI version 1.0.0
type_overrides Sequence Åsidosätter standardmappningen för Delta-till-PostgreSQL-typen för specifika kolumner. Se postgres_synced_table.type_overrides.
Tillagd i Databricks CLI version 1.5.0

postgres_synced_table.new_pipeline_spec

Type: Map

Specifikationen för en ny pipeline som används av den synkroniserade tabellen.

Har lagts till i Databricks CLI version 1.0.0

Key Type Description
budget_policy_id String Den budgetprincip som ska anges för den nyskapade pipelinen.
storage_catalog String Katalogen för pipelinen för att lagra mellanliggande filer, till exempel kontrollpunkter och händelseloggar. Detta måste vara en standardkatalog där användaren har behörighet att skapa Delta-tabeller.
storage_schema String Schemat för pipelinen för att lagra mellanliggande filer, till exempel kontrollpunkter och händelseloggar. Detta måste finnas i standardkatalogen där användaren har behörighet att skapa Delta-tabeller.

postgres_synced_table.type_overrides

Type: Sequence

Åsidosätter standardmappningen Delta-till-PostgreSQL-typen för en enda kolumn.

Tillagd i Databricks CLI version 1.5.0

Key Type Description
column_name String Obligatoriskt. (Beta) Namnet på källkolumnen vars måltyp PostgreSQL ska åsidosättas.
Tillagd i Databricks CLI version 1.5.0
pg_type String Obligatoriskt. (Beta) Den PostgreSQL-specifika måltypen att använda för kolumnen. Det enda giltiga värdet är PG_SPECIFIC_TYPE_VECTOR.
Tillagd i Databricks CLI version 1.5.0
size Integer (Beta) Storleksparametern för måltypen, för typer som tar en, såsom vektordimension eller varcharlängd. Krävs när den utvalda pg_type behöver en storlek.
Tillagd i Databricks CLI version 1.5.0

Example

resources:
  schemas:
    pipeline_storage:
      name: test_pipeline_storage
      catalog_name: main
      comment: 'Pipeline storage for the synced-table test'

  postgres_projects:
    my_project:
      project_id: test-pg-proj
      display_name: 'Test Project for Synced Table'
      pg_version: 17

  postgres_catalogs:
    my_catalog:
      catalog_id: lakebase_test
      branch: ${resources.postgres_projects.my_project.id}/branches/production
      postgres_database: appdb
      create_database_if_missing: true

  postgres_synced_tables:
    my_table:
      synced_table_id: ${resources.postgres_catalogs.my_catalog.catalog_id}.public.trips_synced
      source_table_full_name: main.source_test.trips_source
      primary_key_columns: ['tpep_pickup_datetime']
      scheduling_policy: SNAPSHOT
      postgres_database: appdb
      branch: ${resources.postgres_projects.my_project.id}/branches/production
      create_database_objects_if_missing: true
      new_pipeline_spec:
        storage_catalog: ${resources.schemas.pipeline_storage.catalog_name}
        storage_schema: ${resources.schemas.pipeline_storage.name}

kvalitetsövervakning (Unity Catalog)

Type: Map

Med quality_monitor resurs kan du definiera en tabellövervakare i Unity Catalog. Information om övervakare finns i Dataprofilering.

quality_monitors:
  <quality_monitor-name>:
    <quality_monitor-field-name>: <quality_monitor-field-value>
Key Type Description
assets_dir String Katalogen som ska lagra övervakningstillgångar (t.ex. instrumentpanel, måtttabeller).
baseline_table_name String Namnet på baslinjetabellen som driftmått beräknas från. Kolumner i den övervakade tabellen bör också finnas i baslinjetabellen.
custom_metrics Sequence Anpassade mått för beräkning i den övervakade tabellen. Dessa kan vara aggregerade mått, härledda mått (från redan beräknade aggregeringsmått) eller driftmått (jämföra mått över tidsperioder). Se custom_metrics.
inference_log Map Konfiguration för övervakning av slutsatsdragningsloggar. Se inference_log.
latest_monitor_failure_msg String Det senaste felmeddelandet för ett övervakningsfel. Det här är ett skrivskyddat fält som fylls i när en övervakare misslyckas.
Har lagts till i Databricks CLI-version 0.264.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
notifications Map Inställningarna för aviseringar på skärmen. Se meddelanden.
output_schema_name String Schema där utdatamåtttabeller skapas.
schedule Map Schemat för att automatiskt uppdatera måtttabeller. Se schema.
skip_builtin_dashboard Boolean Huruvida man ska hoppa över att skapa en standardpanel som sammanfattar mått på datakvalitet.
slicing_exprs Sequence Lista över kolumnuttryck att segmentera data med för riktad analys. Data grupperas efter varje uttryck oberoende av varandra, vilket resulterar i en separat sektor för varje predikat och dess komplement. För kolumner med hög kardinalitet kommer endast de 100 högsta unika värdena efter frekvens att generera segment.
snapshot Map Konfiguration för övervakning av ögonblicksbildstabeller. Se snapshot.
table_name String Det fullständiga namnet på tabellen.
Har lagts till i Databricks CLI version 0.235.0
time_series Map Konfiguration för övervakning av tidsserietabeller. Se tidsserie.
warehouse_id String Valfritt argument för att ange lagret för att skapa en instrumentpanel. Om det inte anges, används det första tillgängliga lagret.

quality_monitor.anpassade_mätvärden

Type: Sequence

En lista över anpassade måttdefinitioner.

Varje objekt i listan är :CustomMetric

Key Type Description
definition String Jinja-mall för ett SQL-uttryck som anger hur måttet ska beräknas. Se skapa måttdefinition.
input_columns Sequence En lista med kolumnnamn i indatatabellen som måttet ska beräknas för. Kan användas :table för att ange att måttet behöver information från flera kolumner.
name String Namnet på måttet i utdatatabellerna.
output_data_type String Utdatatypen för det anpassade måttet.
type String Kan bara vara en av CUSTOM_METRIC_TYPE_AGGREGATE, CUSTOM_METRIC_TYPE_DERIVEDeller CUSTOM_METRIC_TYPE_DRIFT. Måtten CUSTOM_METRIC_TYPE_AGGREGATE och CUSTOM_METRIC_TYPE_DERIVED beräknas i en enda tabell, medan jämförelsemåtten CUSTOM_METRIC_TYPE_DRIFT används för att jämföra mellan baslinje- och indatatabellen eller mellan de två efterföljande tidsfönstren.
  • CUSTOM_METRIC_TYPE_AGGREGATE: beror endast på de befintliga kolumnerna i tabellen
  • CUSTOM_METRIC_TYPE_DERIVED: beror på tidigare beräknade aggregeringsmått
  • CUSTOM_METRIC_TYPE_DRIFT: beror på tidigare beräknade aggregerings- eller härledda mått

kvalitetsövervakning.inference_log

Type: Map

Konfiguration för övervakning av slutsatsdragningsloggar.

Key Type Description
granularities Sequence Tidskornigheter för aggregering av slutsatsloggar (till exempel ["1 day"]).
model_id_col String Namnet på kolumnen som innehåller modell-ID:t.
prediction_col String Namnet på kolumnen som innehåller förutsägelsen.
timestamp_col String Namnet på kolumnen som innehåller tidsstämpeln.
problem_type String Typ av ML-problem. Giltiga värden är PROBLEM_TYPE_CLASSIFICATION, PROBLEM_TYPE_REGRESSION.
label_col String Namnet på kolumnen som innehåller etiketten (grund sanning).
prediction_proba_col String Namnet på kolumnen som innehåller förutsägelseannolikheterna.

kvalitetsövervakning.notifikationer

Type: Map

Meddelandeinställningar för skärmen.

Key Type Description
on_failure Map Inställningar för meddelanden när bildskärmen fallerar. Se on_failure.
on_new_classification_tag_detected Map Meddelandeinställningar när nya klassificeringstaggar identifieras. Se även on_new_classification_tag_detected.

kvalitetsmonitor.notiser.vid_fel

Type: Map

Inställningar för meddelanden när bildskärmen fallerar.

Key Type Description
email_addresses Sequence En lista över e-postadresser som ska meddelas vid övervakningsfel.

quality_monitor.notifications.vid_detection_av_ny_klassificeringstagg

Type: Map

Meddelandeinställningar när nya klassificeringstaggar identifieras.

Key Type Description
email_addresses Sequence En lista över e-postadresser som ska meddelas när nya klassificeringstaggar identifieras.

kvalitetsövervakning.schema

Type: Map

Schemalägg för automatisk uppdatering och uppfräschning av måtttabeller.

Key Type Description
quartz_cron_expression String Ett Cron-uttryck med Quartz-syntax. Till exempel körs 0 0 8 * * ? varje dag kl. 08:00.
timezone_id String Tidszonen för schemat (till exempel UTC, America/Los_Angeles).
pause_status String Om schemat har pausats. Giltiga värden: PAUSED, UNPAUSED.

kvalitetsövervakare.ögonblicksbild

Type: Map

Konfiguration för övervakning av ögonblicksbildstabeller.

kvalitetsövervakare.tidsserie

Konfiguration för övervakning av tidsserietabeller.

Key Type Description
granularities Sequence Tidskornigheter för aggregering av tidsseriedata (till exempel ["30 minutes"]).
timestamp_col String Namnet på kolumnen som innehåller tidsstämpeln.

Examples

I följande exempel definieras kvalitetsövervakare för profiltyperna InferenceLog, TimeSeries och Snapshot .

# InferenceLog profile type
resources:
  quality_monitors:
    my_quality_monitor:
      table_name: dev.mlops_schema.predictions
      output_schema_name: ${bundle.target}.mlops_schema
      assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
      inference_log:
        granularities: [1 day]
        model_id_col: model_id
        prediction_col: prediction
        label_col: price
        problem_type: PROBLEM_TYPE_REGRESSION
        timestamp_col: timestamp
      schedule:
        quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
        timezone_id: UTC
# TimeSeries profile type
resources:
  quality_monitors:
    my_quality_monitor:
      table_name: dev.mlops_schema.predictions
      output_schema_name: ${bundle.target}.mlops_schema
      assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
      time_series:
        granularities: [30 minutes]
        timestamp_col: timestamp
      schedule:
        quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
        timezone_id: UTC
# Snapshot profile type
resources:
  quality_monitors:
    my_quality_monitor:
      table_name: dev.mlops_schema.predictions
      output_schema_name: ${bundle.target}.mlops_schema
      assets_dir: /Workspace/Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
      snapshot: {}
      schedule:
        quartz_cron_expression: 0 0 8 * * ? # Run Every day at 8am
        timezone_id: UTC

I följande exempel konfigureras en kvalitetsövervakare och ett motsvarande modellträningsjobb baserat på övervakningen:

# Quality monitoring workflow
resources:
  quality_monitors:
    mlops_quality_monitor:
      table_name: ${bundle.target}.mlops_demo.predictions
      output_schema_name: ${bundle.target}.mlops_demo
      assets_dir: /Users/${workspace.current_user.userName}/databricks_lakehouse_monitoring
      inference_log:
        granularities: [1 hour]
        model_id_col: model_version
        prediction_col: prediction
        label_col: fare_amount
        problem_type: PROBLEM_TYPE_REGRESSION
        timestamp_col: inference_timestamp
      schedule:
        quartz_cron_expression: 57 0 14 * * ? # refresh monitoring metrics every day at 7 am PT
        timezone_id: UTC
  jobs:
    retraining_job:
      name: ${bundle.target}-mlops_demo-monitoring-retraining-job
      tasks:
        - task_key: monitored_metric_violation_check
          notebook_task:
            notebook_path: ../monitoring/notebooks/MonitoredMetricViolationCheck.py
            base_parameters:
              env: ${bundle.target}
              table_name_under_monitor: ${bundle.target}.mlops_demo.predictions
              metric_to_monitor: r2_score
              metric_violation_threshold: 0.7
              num_evaluation_windows: 24
              num_violation_windows: 5 # 5 out of the past 24 windows have metrics lower than threshold

        - task_key: is_metric_violated
          depends_on:
            - task_key: monitored_metric_violation_check
          condition_task:
            op: EQUAL_TO
            left: '{{tasks.monitored_metric_violation_check.values.is_metric_violated}}'
            right: 'true'

        - task_key: trigger_retraining
          depends_on:
            - task_key: is_metric_violated
              outcome: 'true'
          run_job_task:
            job_id: ${resources.jobs.model_training_job.id}

      schedule:
        quartz_cron_expression: '0 0 15 * * ?' # daily at 8 am PDT
        timezone_id: UTC

      # To get notifications, provide a list of emails to the on_failure argument.
      #
      #  email_notifications:
      #    on_failure:
      #      - someone@example.com

registrerad_modell (Unity Catalog)

Type: Map

Med den registrerade modellresursen kan du definiera modeller i Unity Catalog. Information om registrerade Unity Catalog-modeller finns i Hantera modelllivscykel i Unity Catalog.

registered_models:
  <registered_model-name>:
    <registered_model-field-name>: <registered_model-field-value>
Key Type Description
aliases Sequence Lista över alias som är associerade med den registrerade modellen. Se registered_model.aliases.
Har lagts till i Databricks CLI version 0.273.0
catalog_name String Namnet på katalogen där schemat och den registrerade modellen finns.
comment String Kommentaren som är kopplad till den registrerade modellen.
created_at Integer Tidsstämpel för skapande av den registrerade modellen i millisekunder sedan Unix-epoken.
Har lagts till i Databricks CLI version 0.273.0
created_by String Identifieraren för den användare som skapade den registrerade modellen.
Har lagts till i Databricks CLI version 0.273.0
full_name String Namnet på den registrerade modellen på tre nivåer (fullständigt kvalificerat).
Har lagts till i Databricks CLI version 0.273.0
grants Sequence De bidrag som är associerade med den registrerade modellen. Se bidrag.
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
metastore_id String Metaarkivets unika identifierare.
Har lagts till i Databricks CLI version 0.273.0
name String Namnet på den registrerade modellen.
owner String Identifieraren för den användare som äger den registrerade modellen.
Har lagts till i Databricks CLI version 0.273.0
schema_name String Namnet på schemat där den registrerade modellen finns.
storage_location String Lagringsplatsen i molnet under vilken modellversionsdatafiler lagras.
updated_at String Tidsstämpeln för senaste uppdatering av den registrerade modellen i millisekunder sedan Unix-epoken.
Har lagts till i Databricks CLI version 0.273.0
updated_by String Identifieraren för den användare som uppdaterade den registrerade modellen förra gången.
Har lagts till i Databricks CLI version 0.273.0

registered_model.aliaser

Type: Sequence

En lista över alias som är associerade med den registrerade modellen.

Varje objekt i listan är :Alias

Key Type Description
alias_name String Namnet på aliaset, t.ex. "champion" eller "latest_stable"
catalog_name String Namnet på katalogen som innehåller modellversionen
id String Aliasets unika identifierare
model_name String Namnet på den överordnade registrerade modellen för modellversionen i förhållande till det överordnade schemat
schema_name String Namnet på schemat som innehåller modellversionen i förhållande till den överordnade katalogen
version_num Integer Heltalsversionsnummer för den modellversion som det här aliaset pekar på.

Example

I följande exempel definieras en registrerad modell i Unity Catalog:

resources:
  registered_models:
    model:
      name: my_model
      catalog_name: ${bundle.target}
      schema_name: mlops_schema
      comment: Registered model in Unity Catalog for ${bundle.target} deployment target
      grants:
        - privileges:
            - EXECUTE
          principal: account users

schema (Unity-katalogen)

Type: Map

Scheman stöds i Python för deklarativa Automation-paket. Se databricks.bundles.schemas.

Med schemaresurstypen kan du definiera Unity Catalog-scheman för tabeller och andra tillgångar i dina arbetsflöden och pipelines som skapats som en del av ett paket. Ett schema, som skiljer sig från andra resurstyper, har följande begränsningar:

  • Ägaren till en schemaresurs är alltid distributionsanvändaren och kan inte ändras. Om run_as anges i paketet ignoreras det av åtgärder i schemat.
  • Endast fält som stöds av motsvarande API för att skapa schemaobjekt är tillgängliga för schemaresursen. Till exempel enable_predictive_optimization stöds inte eftersom det bara är tillgängligt i uppdaterings-API:et.
schemas:
  <schema-name>:
    <schema-field-name>: <schema-field-value>
Key Type Description
catalog_name String Namnet på den överordnade katalogen.
comment String En fritt formulerad textbeskrivning som tillhandahålls av användaren.
custom_max_retention_hours Integer Den anpassade maximala lagringstiden, i timmar, för schemat.
Tillagd i Databricks CLI version 1.5.0
grants Sequence De bidrag som är associerade med schemat. Se bidrag.
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
name String Namnet på schemat i förhållande till den överordnade katalogen.
properties Map En karta över nyckel/värde-egenskaper som är kopplade till schemat.
storage_root String Lagringsrot-URL:en för hanterade tabeller i schemat.

Examples

I följande exempel definieras en pipeline med resursnyckeln my_pipeline som skapar ett Unity Catalog-schema med nyckeln my_schema som mål. I det här exemplet används ersättningar.

resources:
  pipelines:
    my_pipeline:
      name: test-pipeline
      libraries:
        - notebook:
            path: ../src/nb.ipynb
        - file:
            path: ../src/range.sql
      development: true
      catalog: ${resources.schemas.my_schema.catalog_name}
      target: ${resources.schemas.my_schema.id}

  schemas:
    my_schema:
      name: test-schema
      catalog_name: main
      comment: This schema was created by Declarative Automation Bundles.

Mappning av bidrag på den översta nivån stöds inte av deklarativa Automation-paket, så om du vill ange bidrag för ett schema definierar du bidragen för schemat i mappningen schemas . Mer information om bidrag finns i Visa, bevilja och återkalla privilegier.

I följande exempel definieras ett Unity Catalog-schema med bidrag:

resources:
  schemas:
    my_schema:
      name: test-schema
      grants:
        - principal: users
          privileges:
            - SELECT
        - principal: my_team
          privileges:
            - MANAGE
      catalog_name: main

hemlig (Unity-katalogen)

Type: Map

Den hemliga resursen låter dig definiera en hemlighet som lagras i Unity Catalog. Secrets är trenivå-namnrymdsobjekt (catalog.schema.secret) som säkert lagrar känslig inloggningsdata såsom lösenord, tokens och nycklar.

Note

Att använda Deklarative Automation Bundles för att definiera hemligheter stöds endast om du använder den direkta distributionsmotorn.

Tillagd i Databricks CLI version 1.12.0

secrets:
  <secret-name>:
    <secret-field-name>: <secret-field-value>
Key Type Description
catalog_name String Obligatoriskt. Namnet på katalogen där schemat och hemligheten finns.
Tillagd i Databricks CLI version 1.12.0
comment String Användartillhandahållen fri textbeskrivning av hemligheten. Måste vara mellan 1 och 65536 tecken.
Tillagd i Databricks CLI version 1.12.0
expire_time String Användargiven utgångstid för hemligheten. Detta fält anger när hemligheten inte längre ska användas och kan visas som en varning i användargränssnittet. Den är rent informationsbaserad och utlöser inga automatiska handlingar eller påverkar hemlighetens livscykel.
Tillagd i Databricks CLI version 1.12.0
grants Sequence Bidragen för att ansöka om denna hemlighet. Se bidrag.
Tillagd i Databricks CLI version 1.12.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Tillagd i Databricks CLI version 1.12.0
name String Obligatoriskt. Namnet på hemligheten, i förhållande till dess föräldraschema.
Tillagd i Databricks CLI version 1.12.0
owner String Ägaren till hemligheten. Som standard är det skapande principet vid skapandet. Kan uppdateras för att överföra äganderätten till hemligheten till en annan huvudsaklig.
Tillagd i Databricks CLI version 1.12.0
schema_name String Obligatoriskt. Namnet på schemat där hemligheten finns.
Tillagd i Databricks CLI version 1.12.0
value String Obligatoriskt. Det hemliga värdet att lagra. Detta fält är endast indata och returneras inte i svar—använd effective_value fältet (via GetSecret med include_value satt till true) för att läsa det hemliga värdet. Maxstorleken är 60 KiB (före kryptering). Godkänt innehåll inkluderar lösenord, tokens, nycklar och annan känslig legitimationsinformation. Måste vara mellan 1 och 61440 tecken.
Tillagd i Databricks CLI version 1.12.0

Examples

Följande exempel definierar en Unity-kataloghemlighet vars värde tillhandahålls av en bundle-variabel vid deploying:

bundle:
  name: my-bundle

variables:
  my_secret_value:
    description: 'Secret value passed at deploy time'

resources:
  secrets:
    my_secret:
      catalog_name: main
      schema_name: default
      name: my_api_key
      value: ${var.my_secret_value}
      comment: 'API key for external service'

hemligt_omfång

Type: Map

Med resursen secret_scope kan du definiera secret scopes i ett paket. Information om hemliga omfång finns i Hemlighetshantering.

Har lagts till i Databricks CLI version 0.252.0

secret_scopes:
  <secret_scope-name>:
    <secret_scope-field-name>: <secret_scope-field-value>
Key Type Description
backend_type String Serverdelstypen med vilken omfånget skapas. Om det inte anges är standardinställningen DATABRICKS.
Har lagts till i Databricks CLI version 0.252.0
keyvault_metadata Map Metadata för den hemliga omfattningen backend_type är AZURE_KEYVAULT. Se keyvault_metadata.
Har lagts till i Databricks CLI version 0.252.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
name String Namn på sektionen efterfrågat av användaren. Omfångsnamn är unika.
Har lagts till i Databricks CLI version 0.252.0
permissions Sequence Behörigheterna som ska tillämpas på det hemliga omfånget. Behörigheter hanteras via hemliga scope-ACL:er, så varje group_name, user_name, eller service_principal_name översätts till ett principal fält i ACL:n. Tillåtna nivåer är READ, WRITE, och MANAGE. Se behörigheter.
Har lagts till i Databricks CLI version 0.252.0

secret_scope.keyvault_metadata

Type: Map

Metadata för Azure Key Vault-backade hemliga omfång.

Key Type Description
resource_id String Azure resurs-ID för Key Vault.
dns_name String DNS-namnet på Azure Key Vault.

Examples

I följande exempel definieras ett hemligt omfång som använder en nyckelvalvsserverdel:

resources:
  secret_scopes:
    secret_scope_azure:
      name: test-secrets-azure-backend
      backend_type: 'AZURE_KEYVAULT'
      keyvault_metadata:
        resource_id: my_azure_keyvault_id
        dns_name: my_azure_keyvault_dns_name

I följande exempel anges en anpassad ACL med hjälp av hemliga omfång och behörigheter:

resources:
  secret_scopes:
    my_secret_scope:
      name: my_secret_scope
      permissions:
        - user_name: admins
          level: WRITE
        - user_name: users
          level: READ

Ett exempelpaket som visar hur du definierar ett hemligt omfång och ett jobb med en uppgift som läser från den i ett paket finns i bundle-examples GitHub repository.

SQL_warehouse

Type: Map

Med SQL-lagerresursen kan du definiera ett SQL-lager i ett paket. Information om SQL-lager finns i Datalager på Azure Databricks.

Har lagts till i Databricks CLI version 0.260.0

sql_warehouses:
  <sql-warehouse-name>:
    <sql-warehouse-field-name>: <sql-warehouse-field-value>
Key Type Description
auto_stop_mins Integer Hur lång tid i minuter ett SQL-lager måste vara inaktivt (till exempel inga RUNNING-frågor) innan det stoppas automatiskt. Giltiga värden är 0, vilket indikerar att autostop inte finns, eller större än eller lika med 10 (classic/pro) eller 1 (serverless). Standard är 120 (klassisk/proffs) och 10 (serverlös).
Har lagts till i Databricks CLI version 0.260.0
channel Map Kanalinformationen. Se kanal.
Har lagts till i Databricks CLI version 0.260.0
cluster_size String Storleken på de kluster som allokerats för det här lagret. Om du ökar storleken på ett Spark-kluster kan du köra större frågor på det. Om du vill öka antalet samtidiga frågor justerar du max_num_clusters. Mer information om värden som stöds finns i cluster_size.
Har lagts till i Databricks CLI version 0.260.0
creator_name String Namnet på den användare som skapade lagret.
Har lagts till i Databricks CLI version 0.260.0
enable_photon Boolean Om lagret ska använda Photon-optimerade kluster. Standardvärdet är falskt.
Har lagts till i Databricks CLI version 0.260.0
enable_serverless_compute Boolean Om lagret ska använda serverlös beräkning.
Har lagts till i Databricks CLI version 0.260.0
instance_profile_arn String Deprecated. Instansprofil som används för att skicka IAM-rollen till klustret.
Har lagts till i Databricks CLI version 0.260.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
max_num_clusters Integer Det maximala antalet kluster som autoskalningsappen skapar för att hantera samtidiga frågor. Värdena måste vara mindre än eller lika med 30 och större än eller lika med min_num_clusters. Standardvärdet är min_clusters om det tas bort.
Har lagts till i Databricks CLI version 0.260.0
min_num_clusters Integer Det minsta antalet tillgängliga kluster som ska underhållas för det här SQL-lagret. Om du ökar detta medför det att ett större antal kluster alltid körs och därför kan minska kallstarttiden för nya sökfrågor. Detta liknar reserverade jämfört med återkallningsbara kärnor i en resurshanterare. Värdena måste vara större än 0 och mindre än eller lika med min(max_num_clusters, 30). Standardvärdet är 1.
Har lagts till i Databricks CLI version 0.260.0
name String Klustrets logiska namn. Namnet måste vara unikt inom en organisation och mindre än 100 tecken.
Har lagts till i Databricks CLI version 0.260.0
permissions Sequence Behörigheterna som ska tillämpas på lagret. Se behörigheter.
Har lagts till i Databricks CLI version 0.260.0
spot_instance_policy String Om du vill använda instanser av oanvänd kapacitet. Giltiga värden är POLICY_UNSPECIFIED, COST_OPTIMIZED, RELIABILITY_OPTIMIZED. Standardvärdet är COST_OPTIMIZED.
Har lagts till i Databricks CLI version 0.260.0
tags Map En uppsättning anpassade taggar för lagret. Se sql_warehouse.tags.
Har lagts till i Databricks CLI version 0.260.0
warehouse_type String Lagertypen. Giltiga värden är PRO och CLASSIC. Om du vill använda serverlös beräkning anger du det här fältet till PRO och anger även fältet enable_serverless_compute till true.
Har lagts till i Databricks CLI version 0.260.0

sql_warehouse.kanal

Type: Map

Kanalkonfigurationen för SQL-lagret.

Key Type Description
name String Namnet på kanalen. Giltiga värden är CHANNEL_NAME_CURRENT, CHANNEL_NAME_PREVIEW, CHANNEL_NAME_CUSTOM.
dbsql_version String DBSQL-versionen för anpassade kanaler.

sql_warehouse.taggar

Type: Map

De anpassade taggarna för SQL-lagret.

Key Type Description
custom_tags Sequence En uppsättning nyckel/värde-par som identifierar taggar på alla resurser (till exempel AWS-instanser och EBS-volymer) som är associerade med det här SQL-lagret. Antalet taggar måste vara mindre än 45.

Example

I följande exempel definieras ett SQL-lager:

resources:
  sql_warehouses:
    my_sql_warehouse:
      name: my_sql_warehouse
      cluster_size: X-Large
      enable_serverless_compute: true
      max_num_clusters: 3
      min_num_clusters: 1
      auto_stop_mins: 60
      warehouse_type: PRO
      tags:
        custom_tags:
          - key: 'bizunit'
            value: 'commercial'
          - key: 'area'
            value: 'marketing'

synkroniserad_databas_tabell

Type: Map

Med den synkroniserade databastabellresursen kan du definiera Lakebase-databastabeller i ett paket.

Information om synkroniserade databastabeller finns i Lakebase Provisioned.

Har lagts till i Databricks CLI version 0.266.0

synced_database_tables:
  <synced_database_table-name>:
    <synced_database_table-field-name>: <synced_database_table-field-value>
Key Type Description
database_instance_name String Namnet på måldatabasinstansen. Detta krävs när du skapar synkroniserade databastabeller i standardkataloger. Detta är valfritt när man skapar synkroniserade databastabeller i registrerade kataloger; Om det anges i så fall måste databasinstansens namn matcha namnet på den registrerade katalogen, annars avslås begäran.
Har lagts till i Databricks CLI version 0.266.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
logical_database_name String Namnet på postgres-måldatabasobjektet (logisk databas) för den här tabellen.
När man skapar en synkad tabell i en registrerad Postgres-katalog antas det registrerade Postgres-databasnamnet vara den registrerade katalogen. Om detta fält anges i det fallet måste Postgres-databasens namn matcha namnet på den registrerade katalogen, annars avslås förfrågan.
När man skapar en synkroniserad tabell i en standardkatalog krävs detta fält, och att specificera det möjliggör att man riktar in sig på en godtycklig Postgres-databas. Observera att detta har implikationer för create_database_objects_if_missing fältet i spec.
Har lagts till i Databricks CLI version 0.266.0
name String Obligatoriskt. Det fullständiga namnet på tabellen i formuläret catalog.schema.table.
Har lagts till i Databricks CLI version 0.266.0
spec Map Specifikationen för databastabellen. Se specifikationen för synkroniserad databastabell.
Har lagts till i Databricks CLI version 0.266.0

synced_database_table.spec

Type: Map

Specifikationen för databastabellen.

Har lagts till i Databricks CLI version 0.266.0

Key Type Description
create_database_objects_if_missing Boolean Om du vill skapa den synkroniserade tabellens logiska databas och schemaresurser om de inte redan finns.
existing_pipeline_id String ID:t för en befintlig pipeline. Om detta anges kommer den synkroniserade tabellen att binpackas till den befintliga pipeline:n som refereras till. Detta undviker att skapa en ny pipeline och tillåter delning av befintlig beräkning. I det här fallet måste den scheduling_policy synkroniserade tabellen matcha schemaläggningsprincipen för den befintliga pipelinen. Högst en av existing_pipeline_id och new_pipeline_spec bör definieras.
new_pipeline_spec Map Specifikationen för en ny rörledning. Se new_pipeline_spec. Högst en av existing_pipeline_id och new_pipeline_spec bör definieras.
primary_key_columns Sequence Listan med kolumnnamn som utgör primärnyckeln.
scheduling_policy String Schemaläggningsprincipen för synkronisering. Giltiga värden är SNAPSHOT, CONTINUOUS, TRIGGERED.
source_table_full_name String Det fullständiga namnet på källtabellen i formatet catalog.schema.table.
timeseries_key String Tidsserienyckel för att avduplicera rader med samma primärnyckel.

synkroniserad_databas_tabell.spec.ny_pipeline_spec

Type: Map

Specifikationen för en ny pipeline som används av den synkroniserade databastabellen.

Key Type Description
budget_policy_id String ID:t för den budgetprincip som ska anges för den nyligen skapade pipelinen.
storage_catalog String Katalogen för pipelinen för att lagra mellanliggande filer, till exempel kontrollpunkter och händelseloggar. Detta måste vara en standardkatalog där användaren har behörighet att skapa Delta-tabeller.
storage_schema String Schemat för pipelinen för att lagra mellanliggande filer, till exempel kontrollpunkter och händelseloggar. Detta måste finnas i standardkatalogen där användaren har behörighet att skapa Delta-tabeller.

Examples

I följande exempel definieras en synkroniserad databastabell i en motsvarande databaskatalog:

resources:
  database_instances:
    my_instance:
      name: my-instance
      capacity: CU_1
  database_catalogs:
    my_catalog:
      database_instance_name: my-instance
      database_name: 'my_database'
      name: my_catalog
      create_database_if_not_exists: true
  synced_database_tables:
    my_synced_table:
      name: ${resources.database_catalogs.my_catalog.name}.${resources.database_catalogs.my_catalog.database_name}.my_destination_table
      database_instance_name: ${resources.database_catalogs.my_catalog.database_instance_name}
      logical_database_name: ${resources.database_catalogs.my_catalog.database_name}
      spec:
        source_table_full_name: 'my_source_table'
        scheduling_policy: SNAPSHOT
        primary_key_columns:
          - my_pk_column
        new_pipeline_spec:
          storage_catalog: 'my_delta_catalog'
          storage_schema: 'my_delta_schema'

I följande exempel definieras en synkroniserad databastabell i en standardkatalog:

resources:
  synced_database_tables:
    my_synced_table:
      name: 'my_standard_catalog.public.synced_table'
      # database_instance_name is required for synced tables created in standard catalogs.
      database_instance_name: 'my-database-instance'
      # logical_database_name is required for synced tables created in standard catalogs:
      logical_database_name: ${resources.database_catalogs.my_catalog.database_name}
      spec:
        source_table_full_name: 'source_catalog.schema.table'
        scheduling_policy: SNAPSHOT
        primary_key_columns:
          - my_pk_column
        create_database_objects_if_missing: true
        new_pipeline_spec:
          storage_catalog: 'my_delta_catalog'
          storage_schema: 'my_delta_schema'

Det här exemplet skapar en synkroniserad databastabell och anpassar pipelineschemat för den. Det förutsätter att du redan har:

  • En databasinstans med namnet my-database-instance
  • En standardkatalog med namnet my_standard_catalog
  • Ett schema i standardkatalogen med namnet default
  • En källdeltattabell med namnet source_delta.schema.customer med primärnyckeln c_custkey
resources:
  synced_database_tables:
    my_synced_table:
      name: 'my_standard_catalog.default.my_synced_table'
      database_instance_name: 'my-database-instance'
      logical_database_name: 'test_db'
      spec:
        source_table_full_name: 'source_delta.schema.customer'
        scheduling_policy: SNAPSHOT
        primary_key_columns:
          - c_custkey
        create_database_objects_if_missing: true
        new_pipeline_spec:
          storage_catalog: 'source_delta'
          storage_schema: 'schema'

  jobs:
    sync_pipeline_schedule_job:
      name: sync_pipeline_schedule_job
      description: 'Job to schedule synced database table pipeline.'
      tasks:
        - task_key: synced-table-pipeline
          pipeline_task:
            pipeline_id: ${resources.synced_database_tables.my_synced_table.data_synchronization_status.pipeline_id}
      schedule:
        quartz_cron_expression: '0 0 0 * * ?'

vector_search_endpoint

Type: Map

Med den vector_search_endpoint resursen kan du definiera AI Search-slutpunkter i ett paket. Information om AI Search finns i Databricks AI Search.

Note

Du kan bara använda deklarativa Automation-paket för att definiera slutpunkter för vektorsökning om du använder direktdistributionsmotorn.

Har lagts till i Databricks CLI version 0.298.0

vector_search_endpoints:
  <vector_search_endpoint-name>:
    <vector_search_endpoint-field-name>: <vector_search_endpoint-field-value>
Key Type Description
budget_policy_id String ID:t för den budgetprincip som ska användas för den här slutpunkten.
Har lagts till i Databricks CLI version 0.298.0
endpoint_type String Typ av slutpunkt. Giltiga värden är STORAGE_OPTIMIZED och STANDARD.
Har lagts till i Databricks CLI version 0.298.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.298.0
name String Namnet på AI Search-slutpunkten.
Har lagts till i Databricks CLI version 0.298.0
permissions Sequence Behörigheterna som ska tillämpas på AI Search-slutpunkten. Tillåtna nivåer är CAN_CREATE, CAN_MANAGE, och CAN_USE. Se behörigheter.
Har lagts till i Databricks CLI version 0.298.0
target_qps Integer Målfrågorna per sekund för AI Search-slutpunkten. Ömsesidigt uteslutande med num_replicas. Det faktiska antalet repliker beräknas vid indexskapandet eller synkroniseringstiden baserat på detta värde. Detta är ett bästa försök-mål; systemet garanterar inte att denna QPS uppnås.
Tillagd i Databricks CLI version 0.299.2

Example

I följande exempel definieras en AI Search-slutpunkt:

# databricks.yml
bundle:
  name: vector-search-example
  engine: direct # Vector Search requires the direct deployment engine

resources:
  vector_search_endpoints:
    my_vector_search_endpoint:
      name: my_vector_search_endpoint
      endpoint_type: STANDARD

vector_search_index

Type: Map

Med vector_search_index resurs kan du definiera vektorsökningsindex i ett paket. Information om vektorsökning finns i Databricks AI Search.

Har lagts till i Databricks CLI version 1.1.0

vector_search_indexes:
  <vector_search_index-name>:
    <vector_search_index-field-name>: <vector_search_index-field-value>
Key Type Description
delta_sync_index_spec Map Specifikation för Delta Sync Index. Krävs om index_type är DELTA_SYNC. Se vector_search_index.delta_sync_index_spec.
Har lagts till i Databricks CLI version 1.1.0
direct_access_index_spec Map Specifikation för Direct Vector Access Index. Krävs om index_type är DIRECT_ACCESS. Se vector_search_index.direct_access_index_spec.
Har lagts till i Databricks CLI version 1.1.0
endpoint_name String Obligatoriskt. Namnet på slutpunkten som ska användas för att hantera indexet.
Har lagts till i Databricks CLI version 1.1.0
grants Sequence De bidrag som är associerade med vektorsökningsindexet. Se bidrag.
Har lagts till i Databricks CLI version 1.1.0
index_subtype String (Beta) Undertypen för indexet. Giltiga värden är HYBRID och FULL_TEXT. VECTOR stöds inte.
Har lagts till i Databricks CLI version 1.1.0
index_type String Obligatoriskt. Typen av index. Giltiga värden är:
  • DELTA_SYNC: Ett index som automatiskt synkroniseras med en deltatabell för källan, som automatiskt och inkrementellt uppdaterar indexet när underliggande data ändras.
  • DIRECT_ACCESS: Ett index som stöder direkt läsning och skrivning av vektorer och metadata via REST- och SDK-API:erna. Med den här modellen hanterar användaren indexuppdateringar. Har lagts till i Databricks CLI version 1.1.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 1.1.0
name String Obligatoriskt. Indexets namn.
Har lagts till i Databricks CLI version 1.1.0
primary_key String Obligatoriskt. Primärnyckel för indexet.
Har lagts till i Databricks CLI version 1.1.0

vector_search_index.delta_sync_index_spec

Type: Map

Specifikation för ett Delta Sync-index.

Har lagts till i Databricks CLI version 1.1.0

Key Type Description
columns_to_index Sequence Valfritt. Alias för columns_to_sync. Välj de kolumner som ska inkluderas i vektorindexet. Om det här fältet är tomt inkluderas alla kolumner från källtabellen. Den primära nyckelkolumnen och inbäddningskällans kolumn eller inbäddade vektorkolumn ingår alltid. Endast en av columns_to_sync eller columns_to_index kan anges.
columns_to_sync Sequence Valfritt. Välj de kolumner som ska synkroniseras med vektorindexet. Om det här fältet är tomt synkroniseras alla kolumner från källtabellen med indexet. Den primära nyckelkolumnen och den inbäddade källkolumnen eller vektorkolumnen för inbäddning synkroniseras alltid.
embedding_source_columns Sequence Kolumnerna som innehåller inbäddningskällan.
embedding_vector_columns Sequence Kolumnerna som innehåller inbäddningsvektorerna.
embedding_writeback_table String Valfritt. Namnet på deltatabellen som ska synkronisera innehållet i vektorindexet och beräknade inbäddningar till.
pipeline_type String Pipelinekörningsläge. Giltiga värden är:
  • TRIGGERED: Systemet slutar bearbeta efter att ha uppdaterat källtabellen i pipelinen en gång, vilket säkerställer att tabellen uppdateras baserat på tillgängliga data när uppdateringen startade.
  • CONTINUOUS: Pipelinen bearbetar nya data när de tas emot i källtabellen för att hålla vektorindexet fräscht.
source_table String Namnet på källtabellen.

vector_search_index.direct_access_index_spec

Type: Map

Specifikation för ett direktvektoråtkomstindex.

Har lagts till i Databricks CLI version 1.1.0

Key Type Description
embedding_source_columns Sequence Kolumnerna som innehåller inbäddningskällan. Formatet ska vara array[double].
embedding_vector_columns Sequence Kolumnerna som innehåller inbäddningsvektorerna. Formatet ska vara array[double].
schema_json String Schemat för indexet i JSON-format. Typer som stöds är integer, long, float, double, boolean, string, , date. timestamp Typer som stöds för vektorkolumner: array<float>, array<double>.

Example

I följande exempel definieras ett deltasynkroniseringsvektorsökindex:

resources:
  vector_search_endpoints:
    my_endpoint:
      name: my-endpoint
      endpoint_type: STANDARD
  vector_search_indexes:
    my_index:
      name: main.default.my_index
      endpoint_name: ${resources.vector_search_endpoints.my_endpoint.name}
      primary_key: id
      index_type: DELTA_SYNC
      delta_sync_index_spec:
        source_table: main.default.source
        pipeline_type: TRIGGERED
      grants:
        - principal: data-engineers
          privileges: [SELECT]

volym (Unity Catalog)

Type: Map

Volymer stöds i Python för deklarativa Automation-paket. Se databricks.bundles.volumes.

Med volymresurstypen kan du definiera och skapa Unity Catalog-volymer som en del av ett paket. Observera att när du distribuerar ett paket med en definierad volym:

  • Det går inte att referera till en volym i artifact_path för paketet förrän den finns på arbetsytan. Om du vill använda deklarativa Automation-paket för att skapa volymen måste du först definiera volymen i paketet, distribuera den för att skapa volymen och sedan referera till den i artifact_path efterföljande distributioner.
  • Volymer i paketet föregås inte av prefixet dev_${workspace.current_user.short_name} när distributionsmålet har konfigurerats med mode: development. Du kan dock konfigurera prefixet manuellt. Se Anpassade förinställningar.

Har lagts till i Databricks CLI version 0.236.0

volumes:
  <volume-name>:
    <volume-field-name>: <volume-field-value>
Key Type Description
catalog_name String Namnet på katalogen för schemat och volymen.
Har lagts till i Databricks CLI version 0.236.0
comment String Kommentar kopplad till volymen.
Har lagts till i Databricks CLI version 0.236.0
grants Sequence De bidrag som är associerade med volymen. Se bidrag.
Har lagts till i Databricks CLI version 0.236.0
lifecycle Map Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs. Se livscykeln.
Har lagts till i Databricks CLI version 0.268.0
name String Namnet på volymen.
Har lagts till i Databricks CLI version 0.236.0
schema_name String Namnet på den schema där volymen finns.
Har lagts till i Databricks CLI version 0.236.0
storage_location String Lagringsplatsen i molnet.
Har lagts till i Databricks CLI version 0.236.0
volume_type String Volymtypen, antingen EXTERNAL eller MANAGED. En extern volym finns på den angivna externa platsen. En hanterad volym finns på standardplatsen som anges av det överordnade schemat, den överordnade katalogen eller metaarkivet. Se Hanterade kontra externa volymer.

Example

I följande exempel skapas en Unity Catalog-volym med nyckeln my_volume_id:

resources:
  volumes:
    my_volume_id:
      catalog_name: main
      name: my_volume
      schema_name: my_schema

Ett exempelpaket som kör ett jobb som skriver till en fil i Unity Catalog-volymen finns i bundle-examples GitHub lagringsplats.

Vanliga objekt

bevilja

Type: Map

Definierar huvudprincipalen och behörigheterna som ska tilldelas huvudprincipalen. Mer information om bidrag finns i Visa, bevilja och återkalla privilegier.

Key Type Description
principal String Namnet på den huvudman som ska beviljas behörigheter. Detta kan vara en användare, grupp eller tjänstens huvudnamn.
privileges Sequence Behörigheterna att bevilja den angivna entiteten. Giltiga värden beror på resurstypen (till exempel , SELECT, MODIFYCREATE, USAGE, , READ_FILES, WRITE_FILES, , EXECUTE). ALL_PRIVILEGES

Example

I följande exempel definieras ett Unity Catalog-schema med bidrag:

resources:
  schemas:
    my_schema:
      name: test-schema
      grants:
        - principal: users
          privileges:
            - SELECT
        - principal: my_team
          privileges:
            - MANAGE
      catalog_name: main

livscykel

Type: Map

Innehåller livscykelinställningarna för en resurs. Den styr resursens beteende när den distribueras eller förstörs.

Har lagts till i Databricks CLI version 0.268.0

Key Type Description
prevent_destroy Boolean Livscykelinställning för att förhindra att resursen förstörs.
Har lagts till i Databricks CLI version 0.268.0
started Boolean Livscykelinställning för att distribuera resursen i startläge. Stöds endast för appar, kluster och sql_warehouses i direkt distributionsläge.
Har lagts till i Databricks CLI version 0.297.0 (appar)
Har lagts till i Databricks CLI version 1.1.0 (kluster)
Har lagts till i Databricks CLI version 1.2.0 (sql_warehouses)