Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Le dlt-meta projet de Databricks Labs fournit des outils pour générer des pipelines à partir de métadonnées que vous gérez.
Note
Le projet dlt-meta open source, comme tous les projets du compte GitHub databrickslabs, existe uniquement à des fins d’exploration. Azure Databricks ne le prend pas en charge ni ne fournit pas de contrats de niveau de service (SLA) pour celui-ci. N’envoyez pas de tickets de support Azure Databricks pour les problèmes liés à ce projet. À la place, créez une GitHub issue, qui sera examinée lorsque le temps le permet.
Qu’est-ce que dlt-meta ?
Les pipelines Lakeflow vous permettent de spécifier de manière déclarative une table et de générer un flux dans un pipeline qui crée la table et la conserve à jour à mesure que les données sources changent. Toutefois, si votre organisation a des centaines de tables, la génération et la gestion de ces pipelines prend du temps et peut entraîner des pratiques incohérentes.
Le projet dlt-meta est un framework de métagrammage piloté par les métadonnées conçu pour fonctionner avec des pipelines Lakeflow. Cette infrastructure permet l’automatisation des pipelines de données bronze et argent en tirant parti des métadonnées enregistrées dans un ensemble de fichiers JSON et YAML. Le moteur dlt-meta utilise du code Python pour générer dynamiquement du code de pipeline pour les flux décrits dans vos métadonnées. Vous générez les métadonnées relatives à vos pipelines, et dlt-meta génère vos pipelines.
Avec votre logique centralisée à un seul endroit (les métadonnées), votre système est plus rapide, réutilisable et plus facile à gérer.
Note
Le projet dlt-meta a été nommé pour l’ancienne fonctionnalité Delta Live Tables dans Azure Databricks. Delta Live Tables a été remplacé par des pipelines Lakeflow et dlt-meta fonctionne avec des pipelines Lakeflow.
Avantages de dlt-meta
Il existe deux cas d’usage principaux pour dlt-meta :
- Ingérez et nettoyez facilement un grand nombre de tables.
- Appliquer des normes d’ingénierie des données sur plusieurs pipelines et utilisateurs.
Les avantages de l’utilisation d’une approche basée sur les métadonnées sont les suivants :
- La gestion des métadonnées peut être effectuée sans connaissance du code Python ou SQL.
- La gestion des métadonnées, plutôt que le code, nécessite moins de surcharge et réduit les erreurs.
- Le code est généré par dlt-meta. Il reste donc cohérent et a moins de code personnalisé entre les pipelines et les tables publiées.
- Vous pouvez facilement regrouper des tables dans des pipelines au sein des métadonnées, ce qui génère le nombre de pipelines nécessaires pour mettre à jour vos données de manière plus efficace.
Fonctionnement de dlt-meta
L’image suivante montre une vue d’ensemble du système dlt-meta :
- Vous créez les fichiers de métadonnées comme entrée dans dlt-meta, pour spécifier vos fichiers sources et sorties, règles de qualité et traitement requis.
- Le moteur dlt-meta compile les fichiers d’onboarding pour générer une spécification de flux de données, appelée DataflowSpec, et l’enregistre afin de l’utiliser ultérieurement.
- Le moteur dlt-meta utilise le DataflowSpec pour créer des pipelines qui génèrent vos tables Bronze. Cela utilise vos fichiers de métadonnées pour lire les données sources et appliquer les attentes correctes en matière de données pour correspondre à vos règles de qualité.
- Le moteur dlt-meta utilise ensuite la spécification DataflowSpec pour créer des pipelines supplémentaires qui génèrent vos tables Silver. Cela utilise vos fichiers de métadonnées pour appliquer les transformations appropriées et d’autres traitements pour votre système.
Vous exécutez les pipelines générés par dlt-meta pour conserver la sortie actuelle à mesure que vos données sources sont mises à jour.
Get started
Pour utiliser dlt-meta, vous devez :
- Déployez et configurez la solution dlt-meta.
- Préparez les métadonnées pour les tables des couches bronze et argent.
- Créez un travail pour intégrer les métadonnées.
- Utilisez les métadonnées pour créer des pipelines pour vos tables.
La documentation dlt-meta sur GitHub a un tutoriel pour vous aider à commencer ce processus. Pour plus d’informations, consultez prise en main de dlt-meta sur GitHub.