Vytvořte pipeline pomocí sdp-meta

Projekt sdp-meta z Databricks Labs poskytuje nástroje pro generování kanálů z metadat, která spravujete.

Note

open source sdp-meta projekt, stejně jako všechny projekty v GitHub účtu databrickslabs, existuje pouze pro účely průzkumu. Azure Databricks ji nepodporuje ani neposkytuje smlouvy o úrovni služeb (SLA). Nevytvářejte žádosti o podporu Azure Databricks pro problémy související s tímto projektem. Místo toho vytvořte issue na GitHubu, kterému se budeme věnovat, jakmile to čas dovolí.

Co je to sdp-meta?

Kanály Lakeflow umožňují deklarativní určení tabulky a vygenerování toku v kanálu, který vytvoří tabulku a udržuje ji v aktualizovaném stavu při změnách zdrojových dat. Pokud má vaše organizace stovky tabulek, generování a správu těchto kanálů je časově náročné a může vést k nekonzistentním postupům.

Projekt sdp-meta je metaprogramovací framework řízený metadaty navržený pro práci s potrubími Lakeflow. Tato architektura umožňuje automatizaci bronzových a stříbrných datových kanálů s využitím metadat zaznamenaných v sadě souborů JSON a YAML. Za běhu běžných procesů generické pipeline čtou vaše metadata a dynamicky vytvářejí v nich popsané toky. Zpracování bronzu a stříbra může probíhat v oddělených potrubích nebo společně v kombinovaném potrubí. Vy generujete metadata o svých pipelinech a SDP-meta generuje vaše pipeline.

Díky centralizované logice na jednom místě (metadata) je váš systém rychlejší, opakovaně použitelný a snadněji udržovatelný.

Note

Projekt sdp-meta byl dříve pojmenován dlt-metapodle starší funkce Delta Live Tables v Azure Databricks. Delta Live Tables byl nahrazen službou Lakeflow pipelines a sdp-meta funguje s Lakeflow pipelines. Pokud upgraduujete existující dlt-meta instalaci, podívejte se na migrační průvodce v dokumentaci sdp-meta.

Výhody sdp-meta

Existují dva hlavní případy využití sdp-meta:

  • Snadno načítejte a čistěte velké množství tabulek.
  • Vynucujte standardy přípravy dat napříč několika kanály a uživateli.

Mezi výhody používání přístupu řízeného metadaty patří:

  • Údržbu metadat je možné provádět bez znalosti kódu Pythonu nebo SQL.
  • Údržba metadat, nikoli kódu, vyžaduje menší režii a snižuje chyby.
  • Kód je generován pomocí sdp-meta, takže zůstává konzistentní a obsahuje méně vlastního kódu napříč pipeline a publikovanými tabulkami.
  • Tabulky můžete snadno seskupit do kanálů v rámci metadat a generovat počet kanálů potřebných k co nejefektivnější aktualizaci dat.

Jak funguje sdp-meta

Následující obrázek ukazuje přehled systému sdp-meta:

Přehled SDP-Meta

  1. Vytváříte metadata soubory jako vstup do sdp-meta, abyste specifikovali zdrojové soubory a výstupy, pravidla kvality a požadované zpracování. Tyto onboardingové soubory lze psát v JSON nebo YAML.
  2. Spouštíte onboardingovou úlohu sdp-meta. Engine kompiluje onboardingové soubory do specifikace datového toku nazvané DataflowSpec a ukládá je do tabulek Delta (bronze_dataflowspec a silver_dataflowspec) pro pozdější použití.
  3. Za běhu generický pipeline čte DataflowSpec a dynamicky vytváří bronzový zpracovatelský graf. Čte vaše zdrojová data (soubory, datové proudy nebo CDC) a uplatňuje odpovídající očekávání kvality dat tak, aby odpovídala vašim pravidlům kvality, vytváří vaše bronzové tabulky a přesouvá do karantény záznamy, které tato pravidla nesplňují.
  4. Zpracování stříbra může běžet v samostatném generickém potrubí, což je výchozí u Declarative Automation Bundles, nebo ve stejném potrubí, pokud používáte kombinovaný režim. Pipeline využívá DataflowSpec k aplikaci vhodných transformací a dalšího zpracování, čímž generuje stříbrné tabulky, které jsou vyčištěné, obohacené a připravené pro analytiku.

Spouštíte pipeline vygenerované nástrojem sdp-meta, abyste udržovali výstup aktuální při aktualizaci zdrojových dat.

Začínáme

Pro použití sdp-meta musíte:

  • Nasazujte a konfigurujte řešení sdp-meta.
  • Připravte metadata pro tabulky ve vrstvách bronze a silver.
  • Vytvořte úlohu pro načtení metadat.
  • Pomocí metadat můžete vytvářet kanály pro tabulky.

Projekt sdp-meta podporuje několik rozhraní pro nasazení: balíčky (doporučené), interaktivní CLI, aplikaci Databricks s prohlížečovým rozhraním, MCP server pro AI-asistované nastavení a přenosný Agent Skill pro AI agenty s vědomím dovedností.

Dokumentace sdp-meta na GitHub obsahuje tutoriál, který vám pomůže začít s tímto procesem. Pro více informací viz Jak začít se sdp-meta na GitHub.

Dodatečné zdroje