Développer du code de pipeline dans votre environnement de développement local

Vous pouvez créer Python code source de pipeline dans votre environnement de développement intégré (IDE) préféré, l’exécuter localement pour les tests, puis valider, déployer et exécuter des mises à jour dans votre espace de travail Azure Databricks sans quitter votre environnement local.

Les pipelines Lakeflow sont un super-ensemble de pipelines déclaratifs Apache Spark™. Le code qui utilise uniquement les API Apache Spark Declarative Pipelines fonctionne à la fois en local et sur Azure Databricks, mais le code qui utilise des fonctionnalités propres aux pipelines Lakeflow, comme AUTO CDC et les attentes, fonctionne uniquement sur Azure Databricks. Pour connaître les différences de fonctionnalités, consultez la référence du langage Python pour les pipelines Lakeflow.

Pour le développement et les tests interactifs dans l’espace de travail Azure Databricks, utilisez l’éditeur de pipelines Lakeflow. Consultez Développer et déboguer des pipelines ETL avec l’éditeur de pipelines Lakeflow.

Écrivez du code de pipeline avec la prise en charge de l’IDE

Écrivez du code de pipeline à l’aide du module pyspark.pipelines, importé sous le nom dp :

from pyspark import pipelines as dp

Étant donné que le module fait partie d’Apache Spark, votre IDE fournit la vérification de la syntaxe, la saisie semi-automatique et la vérification de type lors de l’écriture. Le code de pipelines déclaratifs Apache Spark s’exécute généralement sans modification sur Azure Databricks. L’exécution de la même commande d’importation dans un pipeline Lakeflow importe la version Azure Databricks de pipelines. Pour consulter la référence complète de Lakeflow pipelines pour Python, voir la référence du langage Python de Lakeflow pipelines.

Exécuter des pipelines localement à des fins de test

Vous pouvez également exécuter des pipelines localement pour développer et tester votre code avant de l’exécuter sur Azure Databricks. Utilisez l’interface de spark-pipelines ligne de commande pour initialiser, valider et exécuter un pipeline avec Apache Spark local. Consultez le Guide de programmation des pipelines déclaratifs Spark dans la documentation Apache Spark.

Vous ne pouvez pas exécuter ou tester des fonctionnalités spécifiques aux pipelines Lakeflow localement. Cela comprend les attentes et AUTO CDC fonctions.

Exécuter des pipelines dans Azure Databricks à partir de votre environnement local

Utilisez le databricks pipelines groupe de commandes pour valider, déployer et exécuter des mises à jour de pipeline dans votre espace de travail, directement à partir de votre terminal :

databricks pipelines init      # scaffold a pipeline project
databricks pipelines dry-run   # validate the pipeline graph without publishing data
databricks pipelines deploy    # deploy the project to your workspace
databricks pipelines run       # run an update

Les mises à jour de pipeline s’exécutent dans votre espace de travail Azure Databricks, et non sur votre ordinateur local, à l’aide du calcul configuré pour le pipeline. Ces commandes sont interopérables avec les commandes Declarative Automation Bundles bundle, ce qui vous permet de commencer avec un projet simple et d’adopter des pratiques de configuration des bundles et d’intégration et de déploiement continus (CI/CD) à mesure qu’il se développe. Pour installer et configurer l’interface CLI, consultez Installer ou mettre à jour l’interface CLI Databricks. Pour obtenir la référence complète des commandes, consultez pipelines le groupe de commandes. Pour suivre une procédure pas à pas, consultez Développer des pipelines avec des bundles d’automatisation déclaratifs.

Synchroniser le code de pipeline de votre IDE vers un espace de travail

Le tableau suivant récapitule les options de synchronisation du code source du pipeline entre votre IDE local et un espace de travail Azure Databricks :

Outil ou modèle Détails
Databricks CLI (pipelines groupe de commandes) Utilisez les databricks pipelines commandes pour déployer et exécuter un projet de pipeline à partir de votre environnement local. Voir pipelines le groupe de commandes.
Paquets d'Automatisation déclarative Utilisez des bundles Automation déclaratifs pour déployer des ressources de pipeline allant d’un fichier de code source unique à des configurations pour plusieurs pipelines, travaux et fichiers de code source. Consultez Convertir un pipeline en projet groupé.
Extension Databricks pour Visual Studio Code Azure Databricks fournit une intégration avec Visual Studio Code qui inclut une synchronisation facile entre votre IDE local et vos fichiers d’espace de travail. Cette extension fournit également des outils pour utiliser des Bundles d'Automatisation Déclarative afin de déployer des actifs de pipeline. Consultez l’extension Databricks pour Visual Studio Code.
Fichiers d’espace de travail Vous pouvez utiliser les fichiers d’espace de travail Databricks pour charger le code source de votre pipeline dans votre espace de travail Databricks, puis importer ce code dans un pipeline. Consultez l’article Que sont les fichiers d’espace de travail ?.
Dossiers Git Les dossiers Git vous permettent de synchroniser le code entre votre environnement local et l’espace de travail Azure Databricks à l’aide d’un référentiel Git en tant qu’intermédiaire. Consultez les répertoires Git d’Azure Databricks.