Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Important
Cette fonctionnalité est en version bêta. Les administrateurs de compte peuvent contrôler l’accès à cette fonctionnalité depuis la page Aperçu de la console de compte en utilisant le bouton Environnements pour le calcul standard . Consultez Gérer les préversions d’Azure Databricks.
Sur une ressource de calcul classique utilisant le mode dépendance Environments , vous gérez les dépendances au niveau de la charge de travail en utilisant des environnements de base au lieu d’installer des bibliothèques à portée de calcul.
La configuration de l’environnement reste isolée des modifications apportées aux ressources de calcul, de sorte que les charges de travail ne sont pas interrompues lorsque l’infrastructure de calcul sous-jacente change. Et comme Azure Databricks met en cache les environnements de base, les dépendances ne se résolvent pas et ne s'installent pas au démarrage, donc le calcul démarre plus rapidement et évite les défaillances liées à la résolution des paquets, à la disponibilité des dépôts ou à la fiabilité du réseau.
Dans un notebook attaché à une ressource de calcul classique utilisant le mode dépendance Environments , sélectionnez un environnement de base et ajoutez des dépendances depuis le panneau latéral Environnement du notebook. Pour les tâches de travail, configurez les dépendances avec une spécification d’environnement de travail.
Exigences
Le réglage du mode dépendance n’est disponible que pour un calcul qui répond aux exigences suivantes :
- Databricks Runtime 19 (Bêta) ou supérieur
- Mode d’accès standard
- Calcul à usage général ou calcul classique
Pour plus de détails sur le support, voir Limitations.
Définir le mode de dépendance
Pour créer une ressource de calcul classique utilisant le mode dépendance Environnements :
Dans la barre latérale de l’espace de travail, cliquez
Calculer puis ouvrez l’onglet Calcul polyvalent .Cliquez sur Créer un calcul.
Dans la section Performances, sélectionnez 19 Bêta ou plus dans le menu déroulant de la version d’exécution Databricks.
Développez la section Avancé , puis cliquez sur Dépendances.
Pour le mode Dépendance, gardez Auto sélectionné pour permettre à Azure Databricks de résoudre le mode, ou cliquez sur Manuel et sélectionnez Environnements pour le définir vous-même. Voir Options du mode dépendance.
Configurez le reste du calcul, puis cliquez sur Créer.
Après l’exécution du calcul, attachez un carnet et configurez son environnement comme décrit dans Environnements d’utilisation dans un carnet.
Options du mode de dépendance
Le contrôle du mode Dépendance possède deux réglages qui déterminent le choix du mode :
- Auto : Azure Databricks résout le mode en fonction de la configuration de calcul. Auto correspond à Environnements, sauf si la ressource de calcul spécifie Docker, des variables d’environnement Spark ou des scripts d’initialisation, auquel cas il correspond à Bibliothèques de cluster.
- Manuel : Vous sélectionnez vous-même Environnements ou bibliothèques de cluster.
Lorsque vous sélectionnez Manuel, choisissez le mode qui correspond à vos besoins :
- Environnements : Gérer les dépendances au niveau de la charge de travail en utilisant des environnements de base. Les bibliothèques de cluster, Docker, les variables d’environnement Spark et les scripts d’init sont désactivés. Utilisez ce mode pour isoler les dépendances pour chaque charge de travail.
- Bibliothèques de cluster : Le comportement classique. Installez les dépendances sur le calcul en utilisant des bibliothèques de cluster, des scripts d’init ou Docker. Utilisez ce mode si votre charge de travail nécessite l’un de ces réglages.
Mettre à jour un calcul existant
Si vous modifiez les paramètres du calcul existant, le passage en mode Environnements est bloqué si le calcul a des paramètres incompatibles, tels que des scripts d’init, des bibliothèques de cluster ou Docker. Si vous supprimez d’abord les paramètres incompatibles, vous pouvez ensuite modifier le mode dépendance.
Si vous passez du mode Environnements au mode Bibliothèques de cluster, les notebooks attachés conservent leurs sélections d’environnement, mais ces sélections deviennent inactives. Si vous remettez le calcul en mode Environnements , ces sélections redeviennent actives.
Utiliser des environnements dans un notebook
Pour utiliser des environnements dans un notebook, associez le notebook à une ressource de calcul classique qui utilise le mode de dépendance Environments. Après avoir attaché le notebook, configurez les dépendances du notebook dans le volet latéral
Environment.
Sélectionnez un environnement de base
Un environnement de base détermine les bibliothèques préinstallées et la version de l’environnement disponibles pour votre ordinateur portable. Le sélecteur d’environnement de base dans le volet latéral Environnement est l’emplacement où vous choisissez votre environnement. Databricks recommande d’utiliser la dernière version pour obtenir les fonctionnalités de notebook les plus up-to-date. Pour voir les détails de chaque version d’environnement, voir Versions d’environnement.
Le sélecteur d’environnement de base inclut les options suivantes :
- Standard : environnement de base par défaut avec des bibliothèques fournies par Databricks.
- ML : un environnement de base incluant les packages Python et système de Databricks Runtime for Machine Learning préinstallés.
-
Plus : Développe pour afficher des options supplémentaires :
- Versions précédentes des environnements Standard et ML.
- Personnalisé : spécifiez un environnement personnalisé à l’aide d’un fichier YAML.
- Environnements de travail : Liste tous les environnements de base compatibles configurés pour votre espace de travail par les administrateurs de l’espace de travail.
Ajouter des dépendances au notebook
Azure Databricks met en cache l'environnement virtuel de votre bloc-notes. Par conséquent, les dépendances ne se réinstallent pas chaque fois que vous rouvrez un bloc-notes ou reprendre après l'inactivité.
Pour installer individuellement une dépendance :
Dans la section Dépendances, entrez le chemin de la dépendance dans le champ puis cliquez sur +Ajouter dépendance. Vous pouvez spécifier une dépendance dans n’importe quel format valide dans un fichier requirements.txt. Les fichiers de roue Python ou les projets Python (par exemple, le répertoire contenant un
pyproject.tomlou unsetup.py) peuvent se trouver dans des fichiers d’espace de travail ou des volumes catalogue Unity.- Si vous utilisez un fichier d’espace de travail, le chemin d’accès doit être absolu et commencer par
/Workspace/. - Si vous utilisez un fichier dans un volume de catalogue Unity, le chemin d’accès doit être au format suivant :
/Volumes/<catalog>/<schema>/<volume>/<path>.whl.
- Si vous utilisez un fichier d’espace de travail, le chemin d’accès doit être absolu et commencer par
Cliquez sur Apply pour installer les dépendances et redémarrer le processus de Python.
Important
N’installez pas PySpark ni aucune bibliothèque qui installe PySpark comme dépendance à vos ordinateurs portables. Si vous l’effectuez, votre session stoppera et entraînera une erreur. Si cela se produit, supprimez la bibliothèque et réinitialisez votre environnement.
Pour voir les dépendances installées, cliquez sur l’onglet Installé dans le volet latéral Environnement . Ouvrez les journaux d’installation de pip pour l’environnement du notebook en cliquant sur pip logs en bas du volet.
Utiliser des environnements dans une tâche
Pour les tâches de travail qui s’exécutent sur une ressource de calcul classique utilisant le mode dépendance Environnements , configurez les dépendances avec une spécification d’environnement de travail. Un environnement de poste spécifie un environnement de base et toute dépendance supplémentaire qu’une ou plusieurs tâches peuvent consulter.
Pour configurer un environnement pour une tâche de travail, suivez les étapes suivantes :
- Créez ou modifiez une tâche dans un poste.
- Dans Calculer, sélectionnez une ressource de calcul classique existante qui utilise le mode dépendance Environnements, ou ajoutez les tâches classiques de calcul.
- Si vous ajoutez le calcul des jobs classiques, développez Advanced.
- Cliquez sur Dépendances.
- Pour le mode Dépendance, sélectionnez Manuel et Environnements, ou gardez Auto si cela se résout en Environnements.
- Dans la section Environnement et Bibliothèques , dans la configuration de la tâche, configurez un environnement pour la tâche. Consultez Configurer l’environnement pour les tâches d’un travail pour connaître les options disponibles pour chaque type de tâche.
Les tâches qui s’exécutent sur une ressource de calcul classique utilisant le mode dépendance Environnements ne prennent pas en charge le paramètre de tâche des bibliothèques dépendantes . Ajoutez plutôt des dépendances à l’environnement.
Limitations
Le mode de dépendance Environments prend en charge les charges de travail Python et les dépendances dans les notebooks interactifs et les tâches de job. Les limites suivantes s'appliquent :
- Les tâches JAR de Spark ne sont pas prises en charge sur une ressource de calcul classique utilisant le mode dépendance Environments .
- L’exécution du code
%scalaéchoue. - Toutes les limitations du mode d’accès standard s’appliquent, y compris l’absence de prise en charge de R. Voir Exigences et limitations de calcul standard.
Paramètres incompatibles
Lorsque le mode dépendance Environnements est activé, les paramètres de calcul suivants sont désactivés :
- Docker (Azure Databricks Container Services)
- Variables d’environnement Spark
- Scripts d’initialisation
- Bibliothèques de cluster