Gérer les dépendances à l’aide d’environnements

Important

Cette fonctionnalité est en version bêta. Les administrateurs de compte peuvent contrôler l’accès à cette fonctionnalité depuis la page Aperçu de la console de compte en utilisant le bouton Environnements pour le calcul standard . Consultez Gérer les préversions d’Azure Databricks.

Sur une ressource de calcul classique utilisant le mode dépendance Environments , vous gérez les dépendances au niveau de la charge de travail en utilisant des environnements de base au lieu d’installer des bibliothèques à portée de calcul.

La configuration de l’environnement reste isolée des modifications apportées aux ressources de calcul, de sorte que les charges de travail ne sont pas interrompues lorsque l’infrastructure de calcul sous-jacente change. Et comme Azure Databricks met en cache les environnements de base, les dépendances ne se résolvent pas et ne s'installent pas au démarrage, donc le calcul démarre plus rapidement et évite les défaillances liées à la résolution des paquets, à la disponibilité des dépôts ou à la fiabilité du réseau.

Dans un notebook attaché à une ressource de calcul classique utilisant le mode dépendance Environments , sélectionnez un environnement de base et ajoutez des dépendances depuis le panneau latéral Environnement du notebook. Pour les tâches de travail, configurez les dépendances avec une spécification d’environnement de travail.

Exigences

Le réglage du mode dépendance n’est disponible que pour un calcul qui répond aux exigences suivantes :

Pour plus de détails sur le support, voir Limitations.

Définir le mode de dépendance

Pour créer une ressource de calcul classique utilisant le mode dépendance Environnements :

  1. Dans la barre latérale de l’espace de travail, cliquez sur l’icône de calculCalculer puis ouvrez l’onglet Calcul polyvalent .

  2. Cliquez sur Créer un calcul.

  3. Dans la section Performances, sélectionnez 19 Bêta ou plus dans le menu déroulant de la version d’exécution Databricks.

  4. Développez la section Avancé , puis cliquez sur Dépendances.

  5. Pour le mode Dépendance, gardez Auto sélectionné pour permettre à Azure Databricks de résoudre le mode, ou cliquez sur Manuel et sélectionnez Environnements pour le définir vous-même. Voir Options du mode dépendance.

    L’onglet Dépendances dans la section Avancé du formulaire de création de calcul, avec le mode Dépendance réglé sur Auto et la résolution sur Environnements.

  6. Configurez le reste du calcul, puis cliquez sur Créer.

Après l’exécution du calcul, attachez un carnet et configurez son environnement comme décrit dans Environnements d’utilisation dans un carnet.

Options du mode de dépendance

Le contrôle du mode Dépendance possède deux réglages qui déterminent le choix du mode :

  • Auto : Azure Databricks résout le mode en fonction de la configuration de calcul. Auto correspond à Environnements, sauf si la ressource de calcul spécifie Docker, des variables d’environnement Spark ou des scripts d’initialisation, auquel cas il correspond à Bibliothèques de cluster.
  • Manuel : Vous sélectionnez vous-même Environnements ou bibliothèques de cluster.

Lorsque vous sélectionnez Manuel, choisissez le mode qui correspond à vos besoins :

  • Environnements : Gérer les dépendances au niveau de la charge de travail en utilisant des environnements de base. Les bibliothèques de cluster, Docker, les variables d’environnement Spark et les scripts d’init sont désactivés. Utilisez ce mode pour isoler les dépendances pour chaque charge de travail.
  • Bibliothèques de cluster : Le comportement classique. Installez les dépendances sur le calcul en utilisant des bibliothèques de cluster, des scripts d’init ou Docker. Utilisez ce mode si votre charge de travail nécessite l’un de ces réglages.

Mettre à jour un calcul existant

Si vous modifiez les paramètres du calcul existant, le passage en mode Environnements est bloqué si le calcul a des paramètres incompatibles, tels que des scripts d’init, des bibliothèques de cluster ou Docker. Si vous supprimez d’abord les paramètres incompatibles, vous pouvez ensuite modifier le mode dépendance.

Si vous passez du mode Environnements au mode Bibliothèques de cluster, les notebooks attachés conservent leurs sélections d’environnement, mais ces sélections deviennent inactives. Si vous remettez le calcul en mode Environnements , ces sélections redeviennent actives.

Utiliser des environnements dans un notebook

Pour utiliser des environnements dans un notebook, associez le notebook à une ressource de calcul classique qui utilise le mode de dépendance Environments. Après avoir attaché le notebook, configurez les dépendances du notebook dans le volet latéral l’environnementEnvironment.

Configurer l’environnement d’un notebook depuis le volet côté Environnement sur une ressource de calcul classique utilisant le mode dépendance Environnements.

Sélectionnez un environnement de base

Un environnement de base détermine les bibliothèques préinstallées et la version de l’environnement disponibles pour votre ordinateur portable. Le sélecteur d’environnement de base dans le volet latéral Environnement est l’emplacement où vous choisissez votre environnement. Databricks recommande d’utiliser la dernière version pour obtenir les fonctionnalités de notebook les plus up-to-date. Pour voir les détails de chaque version d’environnement, voir Versions d’environnement.

Le sélecteur d’environnement de base inclut les options suivantes :

  • Standard : environnement de base par défaut avec des bibliothèques fournies par Databricks.
  • ML : un environnement de base incluant les packages Python et système de Databricks Runtime for Machine Learning préinstallés.
  • Plus : Développe pour afficher des options supplémentaires :
    • Versions précédentes des environnements Standard et ML.
    • Personnalisé : spécifiez un environnement personnalisé à l’aide d’un fichier YAML.
  • Environnements de travail : Liste tous les environnements de base compatibles configurés pour votre espace de travail par les administrateurs de l’espace de travail.

Ajouter des dépendances au notebook

Azure Databricks met en cache l'environnement virtuel de votre bloc-notes. Par conséquent, les dépendances ne se réinstallent pas chaque fois que vous rouvrez un bloc-notes ou reprendre après l'inactivité.

Pour installer individuellement une dépendance :

  1. Dans la section Dépendances, entrez le chemin de la dépendance dans le champ puis cliquez sur +Ajouter dépendance. Vous pouvez spécifier une dépendance dans n’importe quel format valide dans un fichier requirements.txt. Les fichiers de roue Python ou les projets Python (par exemple, le répertoire contenant un pyproject.toml ou un setup.py) peuvent se trouver dans des fichiers d’espace de travail ou des volumes catalogue Unity.

    • Si vous utilisez un fichier d’espace de travail, le chemin d’accès doit être absolu et commencer par /Workspace/.
    • Si vous utilisez un fichier dans un volume de catalogue Unity, le chemin d’accès doit être au format suivant : /Volumes/<catalog>/<schema>/<volume>/<path>.whl.
  2. Cliquez sur Apply pour installer les dépendances et redémarrer le processus de Python.

Important

N’installez pas PySpark ni aucune bibliothèque qui installe PySpark comme dépendance à vos ordinateurs portables. Si vous l’effectuez, votre session stoppera et entraînera une erreur. Si cela se produit, supprimez la bibliothèque et réinitialisez votre environnement.

Pour voir les dépendances installées, cliquez sur l’onglet Installé dans le volet latéral Environnement . Ouvrez les journaux d’installation de pip pour l’environnement du notebook en cliquant sur pip logs en bas du volet.

Utiliser des environnements dans une tâche

Pour les tâches de travail qui s’exécutent sur une ressource de calcul classique utilisant le mode dépendance Environnements , configurez les dépendances avec une spécification d’environnement de travail. Un environnement de poste spécifie un environnement de base et toute dépendance supplémentaire qu’une ou plusieurs tâches peuvent consulter.

Pour configurer un environnement pour une tâche de travail, suivez les étapes suivantes :

  1. Créez ou modifiez une tâche dans un poste.
  2. Dans Calculer, sélectionnez une ressource de calcul classique existante qui utilise le mode dépendance Environnements, ou ajoutez les tâches classiques de calcul.
  3. Si vous ajoutez le calcul des jobs classiques, développez Advanced.
  4. Cliquez sur Dépendances.
  5. Pour le mode Dépendance, sélectionnez Manuel et Environnements, ou gardez Auto si cela se résout en Environnements.
  6. Dans la section Environnement et Bibliothèques , dans la configuration de la tâche, configurez un environnement pour la tâche. Consultez Configurer l’environnement pour les tâches d’un travail pour connaître les options disponibles pour chaque type de tâche.

Les tâches qui s’exécutent sur une ressource de calcul classique utilisant le mode dépendance Environnements ne prennent pas en charge le paramètre de tâche des bibliothèques dépendantes . Ajoutez plutôt des dépendances à l’environnement.

Limitations

Le mode de dépendance Environments prend en charge les charges de travail Python et les dépendances dans les notebooks interactifs et les tâches de job. Les limites suivantes s'appliquent :

  • Les tâches JAR de Spark ne sont pas prises en charge sur une ressource de calcul classique utilisant le mode dépendance Environments .
  • L’exécution du code %scala échoue.
  • Toutes les limitations du mode d’accès standard s’appliquent, y compris l’absence de prise en charge de R. Voir Exigences et limitations de calcul standard.

Paramètres incompatibles

Lorsque le mode dépendance Environnements est activé, les paramètres de calcul suivants sont désactivés :

  • Docker (Azure Databricks Container Services)
  • Variables d’environnement Spark
  • Scripts d’initialisation
  • Bibliothèques de cluster