Gestire le dipendenze utilizzando ambienti

Important

Questa funzionalità è in versione beta. Gli amministratori dell'account possono controllare l'accesso a questa funzionalità dalla pagina Previews nella console dell'account utilizzando l'interruttore Environments for Standard Compute. Vedere Gestire le anteprime di Azure Databricks.

Nel calcolo tradizionale, la modalità di dipendenza Environments consente di gestire le dipendenze a livello di carico di lavoro utilizzando ambienti di base invece di installare librerie con ambito di calcolo. Questo è lo stesso modello usato dal calcolo serverless.

Le impostazioni dell'ambiente rimangono isolate dai cambiamenti a livello di calcolo, quindi i carichi di lavoro non si rompono quando il calcolo cambia sotto di esse. E poiché Azure Databricks memorizza in cache gli ambienti base, le dipendenze non si risolvono e non si installano all'avvio, quindi il calcolo inizia più velocemente ed evita fallimenti dovuti alla risoluzione dei pacchetti, alla disponibilità del repository o all'affidabilità della rete.

Dopo esserti connesso a un calcolo che utilizza la modalità dipendenza Ambienti , puoi selezionare un ambiente base e aggiungere dipendenze dal pannello laterale Ambiente del notebook. Vedi Usa gli ambienti in un quaderno.

Requirements

L'impostazione della modalità dipendenza è disponibile solo su calcolo che soddisfa i seguenti requisiti:

Per i dettagli del supporto, vedi Limitazioni.

Imposta la modalità di dipendenza

Per creare un compute che utilizza la modalità di dipendenza Environments:

  1. Nella barra laterale dello spazio di lavoro, clicca sull'icona di calcoloComputa e poi apri la scheda Calcolo Universale .

  2. Fare clic su Crea calcolo.

  3. Sotto Prestazioni, seleziona 19 Beta o superiore dal menu a tendina della versione Databricks Runtime.

  4. Espandi la sezione Avanzata , poi clicca su Dipendenze.

  5. Per la modalità Dipendenza, tieni selezionato Auto per permettere ad Azure Databricks di risolvere la modalità, oppure clicca su Manuale e seleziona Ambienti per impostarla tu stesso. Vedi opzioni per la modalità dipendenza.

    La scheda Dipendenze nella sezione Avanzata del modulo di creazione del calcolo, con la modalità Dipendenza impostata su Auto e con risoluzione su Ambienti.

  6. Configura il resto del calcolo, poi clicca su Crea.

Dopo che il calcolo è in esecuzione, si collega un notebook e configura il suo ambiente come descritto in Use environments in a notebook.

Opzioni della modalità di dipendenza

Il controllo della modalità Dipendenza ha due impostazioni che determinano come scegliere la modalità:

  • Auto: Azure Databricks risolve la modalità in base alla configurazione di calcolo. Auto viene risolto come Environments, a meno che la risorsa di calcolo non specifichi Docker, variabili di ambiente Spark o script di inizializzazione, nel qual caso viene risolto come Librerie del cluster.
  • Manuale: selezioni tu Ambienti o librerie del cluster.

Quando selezioni Manuale, scegli la modalità che si adatta alle tue esigenze:

  • Ambienti: Gestire le dipendenze a livello di carico di lavoro utilizzando ambienti base. Le librerie di cluster, Docker, le variabili di ambiente Spark e gli script di init sono disabilitati. Usa questa modalità per un'esperienza di dipendenza coerente e portatile che corrisponda al calcolo serverless.
  • Librerie di cluster: Il comportamento classico. Installa le dipendenze sul calcolo usando librerie di cluster, script init o Docker. Usa questa modalità se il tuo carico di lavoro richiede una di queste impostazioni.

Aggiorna un calcolo esistente

Se stai modificando le impostazioni per il calcolo esistente, il passaggio alla modalità Environments è bloccato se il calcolo ha impostazioni incompatibili, come script init, librerie di cluster o Docker. Se rimuovi prima le impostazioni incompatibili, puoi poi modificare la modalità di dipendenza.

Se passi dalla modalità librerie del cluster dalla modalità Ambienti, i notebook collegati mantengono le loro selezioni dell'ambiente, ma queste diventano inattive. Se torni a impostare il calcolo in modalità Ambienti , quelle selezioni tornano attive.

Usa gli ambienti in un quaderno

Per utilizzare gli ambienti in un notebook, collega il notebook a una risorsa di calcolo classica che usa la modalità di dipendenza Environments. Dopo aver collegato il notebook, puoi configurare le dipendenze del notebook dal riquadro laterale dall'ambienteEnvironment, allo stesso modo in cui fai con il calcolo serverless.

Configurare l'ambiente di un notebook dal pannello laterale Ambiente su calcolo classico che utilizza la modalità dipendenza Ambiente.

Seleziona un ambiente base

Un ambiente base determina le librerie preinstallate e la versione dell'ambiente disponibile per il tuo notebook. Il selettore dell'ambiente di base nel riquadro laterale Ambiente è la posizione in cui si sceglie l'ambiente. Databricks consiglia di usare la versione più recente per ottenere le funzionalità più up-to-date del notebook. Per vedere i dettagli su ogni versione dell'ambiente, vedi Versioni dell'ambiente.

Il selettore dell'ambiente di base include le opzioni seguenti:

  • Standard: ambiente di base predefinito con le librerie fornite da Databricks.
  • ML: un ambiente di base con i pacchetti di sistema e Python di Databricks Runtime per Machine Learning preinstallati.
  • Altre informazioni: Espande per visualizzare opzioni aggiuntive:
    • Versioni precedenti degli ambienti Standard e ML.
    • Personalizzato: specificare un ambiente personalizzato usando un file YAML.
  • Ambienti di workspace: Elenca tutti gli ambienti base compatibili configurati per il tuo workspace dagli amministratori dello spazio.

Aggiungere dipendenze al notebook

Azure Databricks memorizza nella cache l'ambiente virtuale del notebook, quindi le dipendenze non vengono reinstallate ogni volta che si riapre un notebook o si riprende dopo l'inattività.

Per installare singolarmente una dipendenza:

  1. Nella sezione Dipendenze , inserisci il percorso della dipendenza nel campo e poi clicca su +Aggiungi dipendenza. È possibile specificare una dipendenza in qualsiasi formato valido in un file di requirements.txt . I file wheel di Python o i progetti Python (ad esempio, la directory contenente pyproject.toml o setup.py) si trovano nei file dell'area di lavoro o nei volumi del catalogo Unity.

    • Se si usa un file dell'area di lavoro, il percorso deve essere assoluto e iniziare con /Workspace/.
    • Se si usa un file in un volume di Catalogo Unity, il percorso deve essere nel formato seguente: /Volumes/<catalog>/<schema>/<volume>/<path>.whl.
  2. Fare clic su Apply per installare le dipendenze e riavviare il processo di Python.

Important

Non installare PySpark o qualsiasi libreria che installi PySpark come dipendenza dai tuoi notebook. In questo modo la sessione verrà interrotta e verrà generato un errore. Se succede, rimuovi la libreria e resetta l'ambiente.

Per visualizzare le dipendenze installate, fai clic sulla scheda Installate nel pannello laterale Ambiente. Apri i log di installazione di pip per l'ambiente del notebook facendo clic su pip logs nella parte inferiore del riquadro.

Limitations

La modalità di dipendenza Environments supporta carichi di lavoro e dipendenze Python nei notebook interattivi. Si applicano le limitazioni seguenti:

  • I processi classici non usano la modalità di dipendenza Environments. Quando un processo viene eseguito nel calcolo classico per utilizzo generico che specifica la modalità Environments, l'impostazione viene ignorata e il processo viene invece eseguito in modalità Librerie del cluster.
  • %scala Il codice non è supportato e fallirà.
  • Si applicano tutte le limitazioni standard della modalità di accesso, incluso il non supporto per R. Vedi Requisiti e limitazioni standard di calcolo.
  • Attualmente non puoi imporre le impostazioni della modalità dipendenza usando politiche di calcolo.

Impostazioni incompatibili

Quando la modalità dipendenza Ambienti è abilitata, le seguenti impostazioni di calcolo vengono disabilitate:

  • Docker (Azure Databricks Container Services)
  • Variabili ambientali Spark
  • Gli script di inizializzazione
  • Librerie di cluster