Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Les pipelines Lakeflow prennent en charge les dépendances externes dans vos pipelines. Databricks recommande d’utiliser l’un des deux modèles pour installer des packages Python :
- Utilisez les paramètres d’environnement pour ajouter des packages à l’environnement de pipeline pour tous les fichiers sources d’un pipeline.
- Importez des modules ou des bibliothèques à partir du code source stocké dans des fichiers d’espace de travail. Consultez Importer des modules Python à partir de dossiers Git ou de fichiers d’espace de travail.
Les pipelines qui utilisent le calcul classique prennent également en charge les scripts init étendus au cluster. Les pipelines Lakeflow serverless ne prennent pas en charge les scripts d’initialisation. Dans tous les cas, Databricks recommande d’utiliser les paramètres d’environnement plutôt que les scripts init, car les dépendances externes, en particulier les scripts init, augmentent le risque de problèmes liés aux mises à niveau d’exécution. Si votre traitement nécessite des scripts init, automatisez les tests de votre pipeline pour détecter les problèmes précoces, et Databricks recommande d’augmenter la fréquence de test.
Important
Étant donné que les bibliothèques JVM ne sont pas prises en charge dans les pipelines, n’utilisez pas de script init pour installer des bibliothèques JVM. Toutefois, vous pouvez installer d’autres types de bibliothèques, tels que Python bibliothèques, avec un script init.
Bibliothèques Python
Pour spécifier des bibliothèques Python externes, modifiez l’environnement de votre pipeline.
- Dans l’éditeur de pipeline, cliquez sur Paramètres.
- Sous Environnement de pipeline, sélectionnez
Modifier l’environnement.
- Cliquez sur
Ajouter une dépendance.
- Tapez le nom de la dépendance. Databricks recommande de verrouiller la version de la bibliothèque. Par exemple, pour ajouter une dépendance à la
simplejsonversion 3.19, tapezsimplejson==3.19.*.
Vous pouvez également installer un package de roue Python à partir d’un volume de catalogue Unity, en spécifiant son chemin, tel que /Volumes/my_catalog/my_schema/my_ldp_volume/ldpfns-1.0-py3-none-any.whl.
Note
Les pipelines ne prennent pas en charge le redémarrage manuel du processus Python avec dbutils.library.restartPython(). Déclarez toutes les dépendances Python via les paramètres d’environnement au lieu de les installer ou de les recharger au moment de l’exécution. L’utilisation des paramètres d’environnement permet également aux pipelines de réutiliser les bibliothèques mises en cache entre les exécutions au lieu de les réinstaller sur chaque exécution.
Version de l’environnement
Par défaut, la version du langage Python et le jeu de bibliothèques préinstallés disponibles pour votre pipeline proviennent de la version actuelle du canal Databricks Runtime. Consultez les notes de publication des pipelines Lakeflow et le processus de mise à niveau de version pour connaître les versions actuelles et les listes de packages pour chaque runtime.
Important
Cette fonctionnalité est en version bêta. Les administrateurs d’espace de travail peuvent contrôler l’accès à cette fonctionnalité à partir de la page Aperçus . Consultez Gérer les préversions d’Azure Databricks.
Pour fixer la version du langage Python et l’ensemble des bibliothèques préinstallées indépendamment des mises à niveau de Databricks Runtime, configurez une version d’environnement pour le pipeline. Bien qu'une version d'environnement soit définie, les mises à niveau de Databricks Runtime ne modifient pas votre version de langage Python ou les versions de bibliothèque préinstallées, et toutes les dépendances externes que vous ajoutez via les paramètres Environment sont superposés sur cette base. Consultez Configurer les versions d’environnement pour les pipelines.
Prise en charge de la bibliothèque Scala et Java
Non, les pipelines prennent uniquement en charge SQL et Python. Vous ne pouvez pas utiliser les bibliothèques JVM dans un pipeline. L’installation des bibliothèques JVM provoque un comportement imprévisible et peut s’interrompre avec les futures versions de pipelines Lakeflow. Si votre pipeline utilise un script init, vous devez également vous assurer que les bibliothèques JVM ne sont pas installées par le script.