Transformace dat v delta lake pomocí mapování toků dat

VZTAHUJE SE NA: Azure Data Factory Azure Synapse Analytics

Návod

Data Factory v Microsoft Fabric je nová generace Azure Data Factory s jednodušší architekturou, integrovanou AI a novými funkcemi. Pokud s integrací dat začínáte, začněte Fabric Data Factory. Stávající úlohy ADF lze upgradovat na Fabric pro přístup k novým funkcím v oblastech datové vědy, analýz v reálném čase a vytváření sestav.

Pokud s Azure Data Factory začínáte, přečtěte si téma Introduction Azure Data Factory.

V tomto kurzu použijete plátno toku dat k vytvoření toků dat, které umožňují analyzovat a transformovat data v Azure Data Lake Storage (ADLS) Gen2 a ukládat je v Delta Lake.

Požadavky

  • Azure předplatné. Pokud nemáte předplatné Azure, vytvořte si účet free Azure než začnete.
  • Azure účet pro ukládání. Úložiště ADLS používáte jako zdrojové úložiště a cílové úložiště. Pokud účet úložiště nemáte, přečtěte si článek Vytvoření účtu úložiště Azure postup jeho vytvoření.

Soubor, který transformujeme v tomto kurzu, je MoviesDB.csv, který najdete tady. Pokud chcete soubor načíst z GitHub, zkopírujte obsah do textového editoru podle vašeho výběru a uložte ho místně jako soubor .csv. Pokud chcete nahrát soubor do účtu úložiště, viz Upload objektů blob pomocí portálu Azure. Příklady odkazují na kontejner s názvem sample-data.

Vytvoření datové továrny

V tomto kroku vytvoříte datovou továrnu a otevřete uživatelské rozhraní Data Factory k vytvoření pipeline v datové továrně.

  1. Otevřete Microsoft Edge nebo Google Chrome. V současné době se uživatelské rozhraní služby Data Factory podporuje jenom ve webových prohlížečích Microsoft Edge a Google Chrome.

  2. V levé nabídce vyberte Vytvořit zdroj>Integrace>Data Factory

  3. Na stránce Nová datová továrna v části Název zadejte ADFTutorialDataFactory.

  4. Vyberte Azure předplatné, ve kterém chcete vytvořit službu Data Factory.

  5. U položky Skupina prostředků proveďte jeden z následujících kroků:

    a. Vyberte Použít existující a z rozevíracího seznamu vyberte existující skupinu prostředků.

    b) Vyberte Vytvořit novou a zadejte název skupiny prostředků.

    Další informace o skupinách prostředků najdete v tématu Užití skupin prostředků ke správě prostředků Azure.

  6. Jako Verzi vyberte V2.

  7. V části Umístění vyberte umístění datové továrny. V rozevíracím seznamu se zobrazí pouze podporovaná umístění. Úložiště dat (například Azure Storage a SQL Database) a výpočty (například Azure HDInsight) používané datovnou mohou být v jiných oblastech.

  8. Vyberte Vytvořit.

  9. Po vytvoření se v Centru oznámení zobrazí oznámení. Výběrem možnosti Přejít k prostředku přejděte na stránku Datové továrny.

  10. Vyberte Autor & Monitor pro spuštění uživatelského rozhraní služby Data Factory na samostatné kartě.

Vytvořte potrubí s aktivitou toku dat

V tomto kroku vytvoříte kanál, který obsahuje aktivitu toku dat.

  1. Na domovské stránce vyberte Orchestrate.

    Snímek obrazovky znázorňující domovskou stránku ADF

  2. Na kartě Obecné pro kanál zadejte DeltaLake pro název kanálu.

  3. V podokně Aktivity rozbalte sekci Přesunout a transformovat. Přetáhněte aktivitu Tok dat z panelu na pracovní plochu kanálu.

    Screenshot znázorňující plátno kanálu, kde můžete vypustit Tok dat activity.

  4. Na horním panelu plátna prokanalizačních procesů přepněte posuvník ladění toku dat do polohy zapnuto. Režim ladění umožňuje interaktivní testování logiky transformace na živém clusteru Spark. Klastrům Tok dat trvá 5 až 7 minut, než se zahřejí, a uživatelům se doporučuje nejprve zapnout ladicí režim, pokud plánují vyvíjet s Tok dat. Další informace viz Režim ladění.

    Snímek obrazovky, který ukazuje, kde se nachází posuvník ladění toku dat.

Vytvoření logiky transformace na plátně toku dat

V tomto kurzu vygenerujete dva toky dat. První tok dat je jednoduchý zdroj pro jímku pro vygenerování nového Delta Lake ze souboru CSV s filmy. Nakonec vytvoříte návrh toku, který následuje za účelem aktualizace dat v Delta Lake.

Konečný tok

Cíle kurzu

  1. Použijte zdroj datové sady MoviesCSV z předpokladů a vytvořte z ní nový Delta Lake.
  2. Vytvořte logiku pro aktualizovaná hodnocení filmů z roku 1988 na 1.
  3. Odstraňte všechny filmy z roku 1950.
  4. Vložte nové filmy pro 2021 duplikováním filmů z roku 1960.

Začněte s prázdným plátnem pro tok dat

  1. Vyberte zdrojovou transformaci v horní části okna editoru toku dat a pak v okně Nastavení zdroje vyberte + Nový vedle vlastnosti Datová sada:

    Snímek obrazovky znázorňující, kde přidat novou zdrojovou datovou sadu do toku dat

  2. V zobrazeném okně Azure Data Lake Storage Gen2 vyberte Nová datová sada a pak vyberte Continue.

    Snímek obrazovky ukazující, kde vybrat Azure Data Lake Storage Gen2 z okna Nová datová sada.

  3. Jako typ datové sady zvolte Oddělený text a znovu vyberte Pokračovat.

    Snímek obrazovky znázorňující, kde vybrat formát datové sady

  4. Pojmenujte datovou sadu MoviesCSV a v části Propojená služba vyberte + Nový a vytvořte novou propojenou službu se souborem.

  5. Zadejte podrobnosti o účtu úložiště vytvořeném dříve v části Požadavky a vyhledejte a vyberte soubor MoviesCSV, který jste tam nahráli.

  6. Po přidání propojené služby zaškrtněte políčko První řádek jako záhlaví a pak vyberte OK a přidejte zdroj.

  7. Přejděte na kartu Projekce v okně nastavení toku dat a pak vyberte Zjistit datové typy.

  8. Teď vyberte + za zdrojem v okně editoru toku dat a posuňte se dolů a vyberte jímku v části Cíl a přidejte do toku dat novou jímku.

    Snímek obrazovky znázorňující, kam přidat cíl jímky pro tok dat

  9. Na kartě Jímka pro nastavení jímky, která se zobrazí po přidání jímky, vyberte Vložený jako typ jímky a potom Delta jako typ vložené datové sady. Pak vyberte Azure Data Lake Storage Gen2 pro službu Linked.

    Snímek obrazovky znázorňující podrobnosti jímky pro vloženou rozdílovou datovou sadu

  10. V kontejneru úložiště zvolte název složky, ve které chcete, aby služba vytvořila Delta Lake.

  11. Nakonec se vraťte zpět do návrháře kanálu a vyberte Ladit, aby se kanál spustil v režimu ladění pouze s touto aktivitou toku dat na plátně. Tím se vygeneruje vaše nové Delta Lake v Azure Data Lake Storage Gen2.

  12. Nyní v nabídce Prostředky továrny na levé straně obrazovky vyberte + pro přidání nového prostředku, a pak vyberte Datový tok.

    Snímek obrazovky znázorňující, kde vytvořit nový tok dat v datové továrně

  13. Stejně jako dříve vyberte znovu soubor MoviesCSV jako zdroj a pak na kartě Projekce znovu vyberte Zjistit datové typy.

  14. Tentokrát po vytvoření zdroje vyberte + v okně editoru toku dat a do zdroje přidejte transformaci filtru.

    Snímek obrazovky znázorňující, kde přidat podmínku filtru do toku dat

  15. V okně Nastavení filtru přidejte podmínku Filtru, která umožňuje pouze řádky videa odpovídající 1950, 1960 a 1988.

    Snímek obrazovky znázorňující, kde přidat filtr ve sloupci Year pro datovou sadu

  16. Teď přidejte transformaci odvozeného sloupce , která aktualizuje hodnocení pro každý film z roku 1988 na 1.

    Snímek obrazovky znázorňující, kde zadat výraz pro odvozený sloupec

  17. Update, insert, delete, and upsert zásady se vytvářejí v transformaci alter Row. Za odvozený sloupec přidejte změnu transformace řádku.

  18. Zásady změn řádků by měly vypadat takto.

    Změna řádku

  19. Teď, když jste nastavili správné politiky pro každý typ změněného řádku, zkontrolujte, jestli byla v cílové transformaci nastavená správná pravidla aktualizace.

    Jímka

  20. Tady používáme jímku Delta Lake k vašemu Azure Data Lake Storage Gen2 datovému jezeře a umožňujeme vkládání, aktualizace a odstraňování.

  21. Všimněte si, že klíčové sloupce jsou složený klíč tvořený sloupcem primárního klíče Movie a sloupcem roku. Je to proto, že jsme vytvořili falešné filmy z roku 2021 tím, že jsme duplikovali řádky z roku 1960. Tím se zabrání kolizím při vyhledávání existujících řádků poskytnutím jedinečnosti.

Stažení dokončené ukázky

Tady je ukázkové řešení pro kanál Delta s tokem dat pro aktualizace nebo odstranění řádků v jezeře.

Přečtěte si další informace o jazyce výrazů toku dat.