Gérer les dépendances à l’aide d’environnements

Important

Cette fonctionnalité est en version bêta. Les administrateurs de compte peuvent contrôler l’accès à cette fonctionnalité depuis la page Aperçu de la console de compte en utilisant le bouton Environnements pour le calcul standard . Consultez Gérer les préversions d’Azure Databricks.

Sur le calcul classique, le mode dépendance Environnements permet de gérer les dépendances au niveau de la charge de travail en utilisant des environnements de base au lieu d’installer des bibliothèques à portée de calcul. C’est le même modèle utilisé par le calcul sans serveur.

La configuration de l’environnement reste isolée des modifications apportées aux ressources de calcul, de sorte que les charges de travail ne sont pas interrompues lorsque l’infrastructure de calcul sous-jacente change. Et comme Azure Databricks met en cache les environnements de base, les dépendances ne se résolvent pas et ne s'installent pas au démarrage, donc le calcul démarre plus rapidement et évite les défaillances liées à la résolution des paquets, à la disponibilité des dépôts ou à la fiabilité du réseau.

Après vous être connecté à un calcul utilisant le mode dépendance Environnements , vous pouvez sélectionner un environnement de base et ajouter des dépendances depuis le volet latéral Environnement du carnet. Voir Utiliser des environnements dans un carnet.

Exigences

Le réglage du mode dépendance n’est disponible que pour un calcul qui répond aux exigences suivantes :

  • Databricks Runtime 19 (Bêta) ou supérieur
  • Mode d’accès standard
  • Calcul polyvalent exécuté dans des notebooks interactifs

Pour plus de détails sur le support, voir Limitations.

Définir le mode de dépendance

Pour créer un compute qui utilise le mode de dépendance Environments :

  1. Dans la barre latérale de l’espace de travail, cliquez sur l’icône de calculCalculer puis ouvrez l’onglet Calcul polyvalent .

  2. Cliquez sur Créer un calcul.

  3. Dans la section Performances, sélectionnez 19 Bêta ou plus dans le menu déroulant de la version d’exécution Databricks.

  4. Développez la section Avancé , puis cliquez sur Dépendances.

  5. Pour le mode Dépendance, gardez Auto sélectionné pour permettre à Azure Databricks de résoudre le mode, ou cliquez sur Manuel et sélectionnez Environnements pour le définir vous-même. Voir Options du mode dépendance.

    L’onglet Dépendances dans la section Avancé du formulaire de création de calcul, avec le mode Dépendance réglé sur Auto et la résolution sur Environnements.

  6. Configurez le reste du calcul, puis cliquez sur Créer.

Après l’exécution du calcul, attachez un carnet et configurez son environnement comme décrit dans Environnements d’utilisation dans un carnet.

Options du mode de dépendance

Le contrôle du mode Dépendance possède deux réglages qui déterminent le choix du mode :

  • Auto : Azure Databricks résout le mode en fonction de la configuration de calcul. Auto correspond à Environnements, sauf si la ressource de calcul spécifie Docker, des variables d’environnement Spark ou des scripts d’initialisation, auquel cas il correspond à Bibliothèques de cluster.
  • Manuel : Vous sélectionnez vous-même Environnements ou bibliothèques de cluster.

Lorsque vous sélectionnez Manuel, choisissez le mode qui correspond à vos besoins :

  • Environnements : Gérer les dépendances au niveau de la charge de travail en utilisant des environnements de base. Les bibliothèques de cluster, Docker, les variables d’environnement Spark et les scripts d’init sont désactivés. Utilisez ce mode pour une expérience de dépendance cohérente et portable qui correspond au calcul sans serveur.
  • Bibliothèques de cluster : Le comportement classique. Installez les dépendances sur le calcul en utilisant des bibliothèques de cluster, des scripts d’init ou Docker. Utilisez ce mode si votre charge de travail nécessite l’un de ces réglages.

Mettre à jour un calcul existant

Si vous modifiez les paramètres du calcul existant, le passage en mode Environnements est bloqué si le calcul a des paramètres incompatibles, tels que des scripts d’init, des bibliothèques de cluster ou Docker. Si vous supprimez d’abord les paramètres incompatibles, vous pouvez ensuite modifier le mode dépendance.

Si vous passez du mode Environnements au mode Bibliothèques de cluster, les notebooks attachés conservent leurs sélections d’environnement, mais ces sélections deviennent inactives. Si vous remettez le calcul en mode Environnements , ces sélections redeviennent actives.

Utiliser des environnements dans un notebook

Pour utiliser des environnements dans un notebook, associez le notebook à une ressource de calcul classique qui utilise le mode de dépendance Environments. Après avoir attaché le notebook, vous pouvez configurer les dépendances du notebook depuis le volet latéral environmentl’environnementEnvironnement, de la même manière que pour le calcul sans serveur.

Configurer l’environnement d’un notebook depuis le volet côté Environnement sur le calcul classique utilisant le mode dépendance Environnements.

Sélectionnez un environnement de base

Un environnement de base détermine les bibliothèques préinstallées et la version de l’environnement disponibles pour votre ordinateur portable. Le sélecteur d’environnement de base dans le volet latéral Environnement est l’emplacement où vous choisissez votre environnement. Databricks recommande d’utiliser la dernière version pour obtenir les fonctionnalités de notebook les plus up-to-date. Pour voir les détails de chaque version d’environnement, voir Versions d’environnement.

Le sélecteur d’environnement de base inclut les options suivantes :

  • Standard : environnement de base par défaut avec des bibliothèques fournies par Databricks.
  • ML : un environnement de base incluant les packages Python et système de Databricks Runtime for Machine Learning préinstallés.
  • Plus : Développe pour afficher des options supplémentaires :
    • Versions précédentes des environnements Standard et ML.
    • Personnalisé : spécifiez un environnement personnalisé à l’aide d’un fichier YAML.
  • Environnements de travail : Liste tous les environnements de base compatibles configurés pour votre espace de travail par les administrateurs de l’espace de travail.

Ajouter des dépendances au notebook

Azure Databricks met en cache l'environnement virtuel de votre bloc-notes. Par conséquent, les dépendances ne se réinstallent pas chaque fois que vous rouvrez un bloc-notes ou reprendre après l'inactivité.

Pour installer individuellement une dépendance :

  1. Dans la section Dépendances, entrez le chemin de la dépendance dans le champ puis cliquez sur +Ajouter dépendance. Vous pouvez spécifier une dépendance dans n’importe quel format valide dans un fichier requirements.txt. Les fichiers de roue Python ou les projets Python (par exemple, le répertoire contenant un pyproject.toml ou un setup.py) peuvent se trouver dans des fichiers d’espace de travail ou des volumes catalogue Unity.

    • Si vous utilisez un fichier d’espace de travail, le chemin d’accès doit être absolu et commencer par /Workspace/.
    • Si vous utilisez un fichier dans un volume de catalogue Unity, le chemin d’accès doit être au format suivant : /Volumes/<catalog>/<schema>/<volume>/<path>.whl.
  2. Cliquez sur Apply pour installer les dépendances et redémarrer le processus de Python.

Important

N’installez pas PySpark ni aucune bibliothèque qui installe PySpark comme dépendance à vos ordinateurs portables. Si vous l’effectuez, votre session stoppera et entraînera une erreur. Si cela se produit, supprimez la bibliothèque et réinitialisez votre environnement.

Pour voir les dépendances installées, cliquez sur l’onglet Installé dans le volet latéral Environnement . Ouvrez les journaux d’installation de pip pour l’environnement du notebook en cliquant sur pip logs en bas du volet.

Limitations

Le mode de dépendance Environnements prend en charge les charges de travail et les dépendances Python dans des notebooks interactifs. Les limites suivantes s'appliquent :

  • Les jobs classiques n’utilisent pas le mode dépendance Environments . Lorsqu’un travail fonctionne sur le calcul polyvalent classique qui spécifie le mode Environnements , le paramètre est ignoré et le travail s’exécute en mode bibliothèques de cluster à la place.
  • %scala Le code n’est pas pris en charge et échouera.
  • Toutes les limitations du mode d’accès standard s’appliquent, y compris l’absence de prise en charge de R. Voir Exigences et limitations de calcul standard.

Paramètres incompatibles

Lorsque le mode dépendance Environnements est activé, les paramètres de calcul suivants sont désactivés :

  • Docker (Azure Databricks Container Services)
  • Variables d’environnement Spark
  • Scripts d’initialisation
  • Bibliothèques de cluster