Tworzenie potoków za pomocą biblioteki dlt-meta

Projekt dlt-meta z usługi Databricks Labs udostępnia narzędzia do generowania potoków z zarządzanych metadanych.

Uwaga / Notatka

Projekt dlt-meta typu open source, podobnie jak wszystkie projekty na koncie usługi GitHub usługi Databrickslabs, istnieje tylko do celów eksploracji. Usługa Azure Databricks nie obsługuje jej ani nie zapewnia umów dotyczących poziomu usług (SLA). Nie zgłaszaj do pomocy technicznej Azure Databricks problemów dotyczących tego projektu. Zamiast tego zgłoś zgłoszenie w serwisie GitHub, które zostanie przejrzane, gdy czas na to pozwoli.

Co to jest dlt-meta?

Potoki Lakeflow umożliwiają deklaratywne definiowanie tabeli oraz tworzenie przepływu w ramach potoku, który zarówno tworzy tę tabelę, jak i utrzymuje ją na bieżąco w miarę zmian danych źródłowych. Jeśli jednak organizacja ma setki tabel, generowanie tych potoków i zarządzanie nimi jest czasochłonne i może prowadzić do niespójnych praktyk.

Projekt dlt-meta to oparty na metadanych framework metaprogramowania zaprojektowany do współpracy z pipeline'ami Lakeflow. Ta struktura umożliwia automatyzację potoków danych z brązu i srebra dzięki wykorzystaniu metadanych zarejestrowanych w zestawie plików JSON i YAML. Silnik dlt-meta używa kodu w języku Python do dynamicznego generowania kodu potoku dla przepływów opisanych w metadanych. Generujesz metadane o swoich potokach, a dlt-meta generuje Twoje potoki.

Dzięki scentralizowanej logice w jednym miejscu (metadanych) system jest szybszy, wielokrotnego użytku i łatwiejszy w obsłudze.

Uwaga / Notatka

Projekt dlt-meta został nazwany dla starszej funkcji Delta Live Tables w usłudze Azure Databricks. Delta Live Tables zostało zastąpione przez Lakeflow pipelines, a dlt-meta działa z Lakeflow pipelines.

Zalety dlt-meta

Istnieją dwa główne przypadki użycia dlt-meta:

  • Z łatwością importuj i oczyszczaj dużą liczbę tabel.
  • Wymuszaj standardy inżynierii danych we wszystkich potokach i u wszystkich użytkowników.

Zalety korzystania z podejścia opartego na metadanych obejmują:

  • Utrzymywanie metadanych można wykonywać bez znajomości języka Python lub SQL.
  • Utrzymywanie metadanych, a nie kodu, wymaga mniejszego nakładu pracy i zmniejsza błędy.
  • Kod jest generowany przez dlt-meta, dzięki czemu pozostaje spójny i zawiera mniej niestandardowego kodu w ramach potoków oraz opublikowanych tabel.
  • Tabele można łatwo grupować w pipeline’y w ramach metadanych, tworząc tyle pipeline’ów, ile potrzeba, aby jak najwydajniej aktualizować dane.

Jak działa dlt-meta

Na poniższej ilustracji przedstawiono przegląd systemu dlt-meta:

omówienie biblioteki dlt-meta

  1. Pliki metadanych są tworzone jako dane wejściowe dlt-meta, aby określić pliki źródłowe i dane wyjściowe, reguły jakości i wymagane przetwarzanie.
  2. Silnik dlt-meta kompiluje pliki wdrożeniowe do postaci specyfikacji przepływu danych o nazwie DataflowSpec i przechowuje ją do późniejszego użycia.
  3. Aparat dlt-meta używa obiektu DataflowSpec do tworzenia potoków, które generują tabele z brązu. Używa to plików metadanych do odczytywania danych źródłowych i stosowania prawidłowych oczekiwań dotyczących danych w celu dopasowania ich do reguł jakości.
  4. Następnie silnik dlt-meta używa DataflowSpec do tworzenia dodatkowych potoków danych, które generują tabele srebrne. Używa to plików metadanych do zastosowania odpowiednich przekształceń i innego przetwarzania dla systemu.

Uruchamiasz potoki generowane przez dlt-meta, aby utrzymać dane wyjściowe w aktualnym stanie w miarę aktualizowania danych źródłowych.

Wprowadzenie

Aby użyć biblioteki dlt-meta, musisz:

  • Wdrażanie i konfigurowanie rozwiązania dlt-meta.
  • Przygotuj metadane dla tabel warstw bronze i silver.
  • Utwórz zadanie dołączania metadanych.
  • Użyj metadanych, aby utworzyć pipeline’y dla swoich tabel.

Dokumentacja dlt-meta w usłudze GitHub zawiera samouczek ułatwiający rozpoczęcie pracy z tym procesem. Aby uzyskać więcej informacji, zobacz wprowadzenie do biblioteki dlt-meta w witrynie GitHub.

Dodatkowe zasoby