Pipelines déclaratifs de Spark

Apache Spark™ Declarative Pipelines est une infrastructure déclarative permettant de créer des pipelines de données par lots et de diffusion en continu dans SQL et Python. Les pipelines Lakeflow s’étendent et sont interopérables avec des pipelines déclaratifs Spark, tout en s’exécutant sur le runtime Databricks optimisé pour les performances. Les cas d’usage courants pour les pipelines incluent l’ingestion de données à partir de sources telles que le stockage cloud (comme Amazon S3, Azure ADLS Gen2 et Google Cloud Storage) et les bus de messages (comme Apache Kafka, Amazon Brokers, Google Pub/Sub, Azure EventHub et Apache Pulsar), ainsi que les transformations de traitement par lots et de diffusion en continu incrémentielles.

Note

Les pipelines Lakeflow nécessitent le plan Premium. Pour plus d’informations, contactez votre équipe de compte Databricks.

Cette section fournit des informations détaillées sur l’utilisation de pipelines. Les rubriques suivantes vous aident à commencer.

Sujet Descriptif
Concepts du pipeline Découvrez les concepts de haut niveau des pipelines, notamment les flux, les tables de streaming et les vues matérialisées.
Tutoriels Suivez les didacticiels pour vous offrir une expérience pratique sur l’utilisation de pipelines.
Développer des pipelines Découvrez comment développer et tester des pipelines qui créent des flux pour l’ingestion et la transformation de données.
Configurer les pipelines Découvrez comment planifier et configurer des pipelines.
Superviser les pipelines Découvrez comment surveiller vos pipelines et résoudre les problèmes de requêtes de pipeline.
Développeurs Découvrez comment utiliser Python et SQL lors du développement de pipelines.
Pipelines autonomes Découvrez comment créer des tables de streaming autonomes et des vues matérialisées dans Databricks SQL ou Python.
Bonnes pratiques Découvrez les modèles recommandés pour créer des pipelines fiables, efficaces et gérables.

Ressources additionnelles