Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Le sdp-meta projet de Databricks Labs fournit des outils pour générer des pipelines à partir de métadonnées que vous gérez.
Note
Le projet open source sdp-meta, comme tous les projets du compte GitHub de databrickslabs, existe uniquement à des fins d’exploration. Azure Databricks ne le prend pas en charge ni ne fournit pas de contrats de niveau de service (SLA) pour celui-ci. N’envoyez pas de tickets de support Azure Databricks pour les problèmes liés à ce projet. À la place, créez une GitHub issue, qui sera examinée lorsque le temps le permet.
Qu’est-ce que SDP-méta ?
Les pipelines Lakeflow vous permettent de spécifier de manière déclarative une table et de générer un flux dans un pipeline qui crée la table et la conserve à jour à mesure que les données sources changent. Toutefois, si votre organisation a des centaines de tables, la génération et la gestion de ces pipelines prend du temps et peut entraîner des pratiques incohérentes.
Le projet sdp-meta est un cadre de métaprogrammation piloté par les métadonnées conçu pour fonctionner avec les pipelines Lakeflow. Cette infrastructure permet l’automatisation des pipelines de données bronze et argent en tirant parti des métadonnées enregistrées dans un ensemble de fichiers JSON et YAML. À l’exécution, les pipelines génériques lisent vos métadonnées et construisent dynamiquement les flows décrits dans celles-ci. Le traitement du bronze et de l’argent peut fonctionner dans des pipelines séparés ou ensemble dans un pipeline combiné. Vous générez les métadonnées sur vos pipelines, et sdp-meta génère vos pipelines.
Avec votre logique centralisée à un seul endroit (les métadonnées), votre système est plus rapide, réutilisable et plus facile à gérer.
Note
Le projet sdp-meta portait auparavant le nom dlt-metade , d’après l’ancienne fonctionnalité Delta Live Tables dans Azure Databricks.
Delta Live Tables a été remplacé par des pipelines Lakeflow, et sdp-meta travaille avec des pipelines Lakeflow. Si vous mettez à jour une installation existante dlt-meta , consultez le guide de migration dans la documentation sdp-meta.
Avantages du sdp-meta
Il existe deux cas d’usage principaux pour sdp-meta :
- Ingérez et nettoyez facilement un grand nombre de tables.
- Appliquer des normes d’ingénierie des données sur plusieurs pipelines et utilisateurs.
Les avantages de l’utilisation d’une approche basée sur les métadonnées sont les suivants :
- La gestion des métadonnées peut être effectuée sans connaissance du code Python ou SQL.
- La gestion des métadonnées, plutôt que le code, nécessite moins de surcharge et réduit les erreurs.
- Le code est généré par sdp-meta, donc il reste cohérent et comporte moins de code personnalisé entre pipelines et tables publiées.
- Vous pouvez facilement regrouper des tables dans des pipelines au sein des métadonnées, ce qui génère le nombre de pipelines nécessaires pour mettre à jour vos données de manière plus efficace.
Comment fonctionne la méta du sdp
L’image suivante présente un aperçu du système sdp-méta :
- Vous créez les fichiers de métadonnées en entrée pour sdp-meta, afin de spécifier vos fichiers sources et sorties, les règles de qualité et le traitement requis. Ces fichiers d’intégration peuvent être écrits en JSON ou YAML.
- Tu exécutes la tâche d’intégration sdp-meta. Le moteur compile les fichiers d’intégration en une spécification de flux de données, appelée DataflowSpec, et les stocke dans des tables Delta (
bronze_dataflowspecetsilver_dataflowspec) pour une utilisation ultérieure. - À l’exécution, un pipeline générique lit le DataflowSpec et construit dynamiquement le graphique bronze de traitement. Il lit vos données sources (fichiers, flux ou CDC) et applique les contrôles de qualité des données appropriés conformément à vos règles de qualité, afin de générer vos tables Bronze et de placer en quarantaine les enregistrements qui ne respectent pas ces règles.
- Le traitement Silver peut s’exécuter dans un pipeline générique séparé, ce qui est le défaut pour les bundles d’automatisation déclarative, ou dans le même pipeline lorsque vous utilisez le mode combiné. Le pipeline utilise le DataflowSpec pour appliquer les transformations appropriées et d’autres traitements, générant des tables silver nettoyées, enrichies et prêtes pour l’analyse.
Vous exécutez les pipelines générés par sdp-meta pour garder la sortie à jour au fur et à mesure que vos données sources sont mises à jour.
Get started
Pour utiliser sdp-meta, vous devez :
- Déployez et configurez la solution sdp-meta.
- Préparez les métadonnées pour les tables des couches bronze et argent.
- Créez un travail pour intégrer les métadonnées.
- Utilisez les métadonnées pour créer des pipelines pour vos tables.
Le projet sdp-meta prend en charge plusieurs interfaces de déploiement : bundles (recommandé), une interface interactive, une application Databricks avec interface graphique basée sur navigateur, un serveur MCP pour une configuration assistée par IA, et une compétence Agent portable pour les agents IA sensibles aux compétences.
La documentation sdp-meta sur GitHub propose un tutoriel pour vous aider à démarrer ce processus. Pour plus d’informations, voir Démarrer avec SDP-Meta sur GitHub.