Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Important
Cette fonctionnalité est en version bêta. Les administrateurs de compte peuvent contrôler l’accès à cette fonctionnalité depuis la page Aperçu de la console de compte en utilisant le bouton Environnements pour le calcul standard . Consultez Gérer les préversions d’Azure Databricks.
Sur le calcul classique, le mode dépendance Environnements permet de gérer les dépendances au niveau de la charge de travail en utilisant des environnements de base au lieu d’installer des bibliothèques à portée de calcul. C’est le même modèle utilisé par le calcul sans serveur.
La configuration de l’environnement reste isolée des modifications apportées aux ressources de calcul, de sorte que les charges de travail ne sont pas interrompues lorsque l’infrastructure de calcul sous-jacente change. Et comme Azure Databricks met en cache les environnements de base, les dépendances ne se résolvent pas et ne s'installent pas au démarrage, donc le calcul démarre plus rapidement et évite les défaillances liées à la résolution des paquets, à la disponibilité des dépôts ou à la fiabilité du réseau.
Après vous être connecté à un calcul utilisant le mode dépendance Environnements , vous pouvez sélectionner un environnement de base et ajouter des dépendances depuis le volet latéral Environnement du carnet. Voir Utiliser des environnements dans un carnet.
Exigences
Le réglage du mode dépendance n’est disponible que pour un calcul qui répond aux exigences suivantes :
- Databricks Runtime 19 (Bêta) ou supérieur
- Mode d’accès standard
- Calcul polyvalent exécuté dans des notebooks interactifs
Pour plus de détails sur le support, voir Limitations.
Définir le mode de dépendance
Pour créer un compute qui utilise le mode de dépendance Environments :
Dans la barre latérale de l’espace de travail, cliquez
Calculer puis ouvrez l’onglet Calcul polyvalent .Cliquez sur Créer un calcul.
Dans la section Performances, sélectionnez 19 Bêta ou plus dans le menu déroulant de la version d’exécution Databricks.
Développez la section Avancé , puis cliquez sur Dépendances.
Pour le mode Dépendance, gardez Auto sélectionné pour permettre à Azure Databricks de résoudre le mode, ou cliquez sur Manuel et sélectionnez Environnements pour le définir vous-même. Voir Options du mode dépendance.
Configurez le reste du calcul, puis cliquez sur Créer.
Après l’exécution du calcul, attachez un carnet et configurez son environnement comme décrit dans Environnements d’utilisation dans un carnet.
Options du mode de dépendance
Le contrôle du mode Dépendance possède deux réglages qui déterminent le choix du mode :
- Auto : Azure Databricks résout le mode en fonction de la configuration de calcul. Auto correspond à Environnements, sauf si la ressource de calcul spécifie Docker, des variables d’environnement Spark ou des scripts d’initialisation, auquel cas il correspond à Bibliothèques de cluster.
- Manuel : Vous sélectionnez vous-même Environnements ou bibliothèques de cluster.
Lorsque vous sélectionnez Manuel, choisissez le mode qui correspond à vos besoins :
- Environnements : Gérer les dépendances au niveau de la charge de travail en utilisant des environnements de base. Les bibliothèques de cluster, Docker, les variables d’environnement Spark et les scripts d’init sont désactivés. Utilisez ce mode pour une expérience de dépendance cohérente et portable qui correspond au calcul sans serveur.
- Bibliothèques de cluster : Le comportement classique. Installez les dépendances sur le calcul en utilisant des bibliothèques de cluster, des scripts d’init ou Docker. Utilisez ce mode si votre charge de travail nécessite l’un de ces réglages.
Mettre à jour un calcul existant
Si vous modifiez les paramètres du calcul existant, le passage en mode Environnements est bloqué si le calcul a des paramètres incompatibles, tels que des scripts d’init, des bibliothèques de cluster ou Docker. Si vous supprimez d’abord les paramètres incompatibles, vous pouvez ensuite modifier le mode dépendance.
Si vous passez du mode Environnements au mode Bibliothèques de cluster, les notebooks attachés conservent leurs sélections d’environnement, mais ces sélections deviennent inactives. Si vous remettez le calcul en mode Environnements , ces sélections redeviennent actives.
Utiliser des environnements dans un notebook
Pour utiliser des environnements dans un notebook, associez le notebook à une ressource de calcul classique qui utilise le mode de dépendance Environments. Après avoir attaché le notebook, vous pouvez configurer les dépendances du notebook depuis le volet latéral
l’environnementEnvironnement, de la même manière que pour le calcul sans serveur.
Sélectionnez un environnement de base
Un environnement de base détermine les bibliothèques préinstallées et la version de l’environnement disponibles pour votre ordinateur portable. Le sélecteur d’environnement de base dans le volet latéral Environnement est l’emplacement où vous choisissez votre environnement. Databricks recommande d’utiliser la dernière version pour obtenir les fonctionnalités de notebook les plus up-to-date. Pour voir les détails de chaque version d’environnement, voir Versions d’environnement.
Le sélecteur d’environnement de base inclut les options suivantes :
- Standard : environnement de base par défaut avec des bibliothèques fournies par Databricks.
- ML : un environnement de base incluant les packages Python et système de Databricks Runtime for Machine Learning préinstallés.
-
Plus : Développe pour afficher des options supplémentaires :
- Versions précédentes des environnements Standard et ML.
- Personnalisé : spécifiez un environnement personnalisé à l’aide d’un fichier YAML.
- Environnements de travail : Liste tous les environnements de base compatibles configurés pour votre espace de travail par les administrateurs de l’espace de travail.
Ajouter des dépendances au notebook
Azure Databricks met en cache l'environnement virtuel de votre bloc-notes. Par conséquent, les dépendances ne se réinstallent pas chaque fois que vous rouvrez un bloc-notes ou reprendre après l'inactivité.
Pour installer individuellement une dépendance :
Dans la section Dépendances, entrez le chemin de la dépendance dans le champ puis cliquez sur +Ajouter dépendance. Vous pouvez spécifier une dépendance dans n’importe quel format valide dans un fichier requirements.txt. Les fichiers de roue Python ou les projets Python (par exemple, le répertoire contenant un
pyproject.tomlou unsetup.py) peuvent se trouver dans des fichiers d’espace de travail ou des volumes catalogue Unity.- Si vous utilisez un fichier d’espace de travail, le chemin d’accès doit être absolu et commencer par
/Workspace/. - Si vous utilisez un fichier dans un volume de catalogue Unity, le chemin d’accès doit être au format suivant :
/Volumes/<catalog>/<schema>/<volume>/<path>.whl.
- Si vous utilisez un fichier d’espace de travail, le chemin d’accès doit être absolu et commencer par
Cliquez sur Apply pour installer les dépendances et redémarrer le processus de Python.
Important
N’installez pas PySpark ni aucune bibliothèque qui installe PySpark comme dépendance à vos ordinateurs portables. Si vous l’effectuez, votre session stoppera et entraînera une erreur. Si cela se produit, supprimez la bibliothèque et réinitialisez votre environnement.
Pour voir les dépendances installées, cliquez sur l’onglet Installé dans le volet latéral Environnement . Ouvrez les journaux d’installation de pip pour l’environnement du notebook en cliquant sur pip logs en bas du volet.
Limitations
Le mode de dépendance Environnements prend en charge les charges de travail et les dépendances Python dans des notebooks interactifs. Les limites suivantes s'appliquent :
- Les jobs classiques n’utilisent pas le mode dépendance Environments . Lorsqu’un travail fonctionne sur le calcul polyvalent classique qui spécifie le mode Environnements , le paramètre est ignoré et le travail s’exécute en mode bibliothèques de cluster à la place.
-
%scalaLe code n’est pas pris en charge et échouera. - Toutes les limitations du mode d’accès standard s’appliquent, y compris l’absence de prise en charge de R. Voir Exigences et limitations de calcul standard.
Paramètres incompatibles
Lorsque le mode dépendance Environnements est activé, les paramètres de calcul suivants sont désactivés :
- Docker (Azure Databricks Container Services)
- Variables d’environnement Spark
- Scripts d’initialisation
- Bibliothèques de cluster