Zabezpečená transformace dat pomocí mapování toku dat

VZTAHUJE SE NA: Azure Data Factory Azure Synapse Analytics

Tip

Data Factory v Microsoft Fabric je nová generace Azure Data Factory s jednodušší architekturou, integrovanou AI a novými funkcemi. Pokud s integrací dat začínáte, začněte Fabric Data Factory. Stávající úlohy ADF lze upgradovat na Fabric pro přístup k novým funkcím v oblastech datové vědy, analýz v reálném čase a vytváření sestav.

Pokud s Azure Data Factory začínáte, přečtěte si téma Introduction Azure Data Factory.

V tomto kurzu použijete uživatelské rozhraní služby Data Factory k vytvoření kanálu, který kopíruje a transformuje data z zdroje Azure Data Lake Storage Gen2 do jímky Data Lake Storage Gen2 (umožňuje přístup pouze k vybraným sítím) pomocí mapování toku dat ve spravované službě Data Factory. Virtual Network. Vzor konfigurace v tomto kurzu můžete rozšířit při transformaci dat pomocí mapování toku dat.

V tomto kurzu provedete následující kroky:

  • Vytvoření datové továrny
  • Vytvořte potrubí s aktivitou toku dat.
  • Sestavte mapovací tok dat se čtyřmi transformacemi.
  • Testovací spuštění kanálu
  • Monitorujte aktivitu toku dat.

Požadavky

  • Azure předplatné. Pokud nemáte předplatné Azure, vytvořte si účet free Azure než začnete.
  • Azure účet pro ukládání. Používáte Data Lake Storage jako source a sink úložiště dat. Pokud účet úložiště nemáte, přečtěte si článek Vytvoření účtu úložiště Azure postup jeho vytvoření. Ujistěte se, že účet úložiště umožňuje přístup jenom z vybraných sítí.

Soubor, který v tomto kurzu transformujeme, je moviesDB.csv, který najdete na tomto webu obsahu GitHub. Pokud chcete načíst soubor z GitHub, zkopírujte obsah do textového editoru podle vašeho výběru a uložte ho místně jako soubor .csv. Pokud chcete nahrát soubor do účtu úložiště, viz Upload objektů blob pomocí portálu Azure. Příklady budou odkazovat na kontejner s názvem sample-data.

Vytvoření datové továrny

V tomto kroku vytvoříte datovou továrnu a otevřete uživatelské rozhraní služby Data Factory, abyste vytvořili kanál v datové továrně.

  1. Otevřete Microsoft Edge nebo Google Chrome. V současné době uživatelské rozhraní služby Data Factory podporují pouze webové prohlížeče Microsoft Edge a Google Chrome.

  2. V nabídce vlevo vyberte Vytvořit prostředek>Analýza>Datová továrna.

  3. Na stránce Nová datová továrna v části Název zadejte ADFTutorialDataFactory.

    Název datové továrny musí být globálně jedinečný. Pokud se zobrazí chybová zpráva o hodnotě názvu, zkuste zadat jiný název datové továrny (například vášnázevADFTutorialDataFactory). Pravidla pro pojmenovávání artefaktů služby Data Factory najdete v tématu Data Factory – pravidla pojmenování.

  4. Vyberte Azure předplatné, ve kterém chcete vytvořit službu Data Factory.

  5. U položky Skupina prostředků proveďte jeden z následujících kroků:

    • Vyberte Použít existující a z rozevíracího seznamu vyberte existující skupinu prostředků.
    • Vyberte Vytvořit novou a zadejte název skupiny prostředků.

    Další informace o skupinách prostředků najdete v tématu Užití skupin prostředků ke správě prostředků Azure.

  6. Jako Verzi vyberte V2.

  7. V části Umístění vyberte umístění datové továrny. V rozevíracím seznamu se zobrazují pouze podporovaná umístění. Úložiště dat (například Azure Storage a Azure SQL Database) a výpočty (například Azure HDInsight) používané objektem pro vytváření dat můžou být v jiných oblastech.

  8. Vyberte Vytvořit.

  9. Po vytvoření se v Centru oznámení zobrazí oznámení. Výběrem možnosti Přejít k prostředku otevřete stránku Data Factory.

  10. Vyberte Open Azure Data Factory Studio a spusťte uživatelské rozhraní služby Data Factory na samostatné kartě.

Vytvoření Azure IR ve spravovaném Virtual Network služby Data Factory

V tomto kroku vytvoříte prostředí AZURE IR a povolíte spravované Virtual Network služby Data Factory.

  1. Na portálu Data Factory přejděte na Manage a vyberte New a vytvořte nové prostředí IR Azure.

    Screenshot, který ukazuje vytvoření nového Azure IR.

  2. Na stránce nastavení prostředí Integration Runtime zvolte, jaké prostředí Integration Runtime se má vytvořit na základě požadovaných možností. V tomto kurzu vyberte Azure, Self-Hosted a potom klikněte na Continue.

  3. Vyberte Azure a potom kliknutím na Continue vytvořte Azure Integration Runtime.

    Snímek obrazovky, který zobrazuje nový Azure IR.

  4. V části Konfigurace virtuální sítě (Preview) vyberte Povolit.

    Snímek obrazovky, která zobrazuje aktivaci nového Azure IR.

  5. Vyberte Vytvořit.

Vytvořit potrubí s aktivitou toku dat

V tomto kroku vytvoříte kanál, který obsahuje aktivitu toku dat.

  1. Na domovské stránce Azure Data Factory vyberte Orchestrate.

    Snímek obrazovky znázorňující domovskou stránku datové továrny se zvýrazněným tlačítkem Orchestrate

  2. V podokně vlastností kanálu zadejte transformMovies pro název kanálu.

  3. V podokně Aktivity rozbalte položku Přesunout a transformovat. Přetáhněte aktivitu Tok dat z podokna na plátno datového kanálu.

  4. V místní nabídce Přidání datového toku vyberte Vytvořit nový datový tok a poté zvolte Mapování datového toku. Až budete hotovi, vyberte OK .

    Screenshot zobrazující mapování Tok dat.

  5. Pojmenujte svůj tok dat TransformMovies v podokně vlastností.

  6. Na horním panelu plátna prokanalizačních procesů přepněte posuvník ladění toku dat do polohy zapnuto. Režim ladění umožňuje interaktivní testování logiky transformace na živém clusteru Spark. Klastrům Tok dat trvá 5 až 7 minut, než se zahřejí, a uživatelům se doporučuje nejprve zapnout ladicí režim, pokud plánují vyvíjet s Tok dat. Další informace naleznete v tématu Režim ladění.

    Snímek obrazovky znázorňující posuvník ladění toku dat

Vytvořte logiku transformace na plátně toku dat

Po vytvoření toku dat budeš automaticky přesměrován na plátno toku dat. V tomto kroku vytvoříte tok dat, který vezme moviesDB.csv soubor v Data Lake Storage a agreguje průměrné hodnocení comedies z roku 1910 do roku 2000. Tento soubor pak napíšete zpět do Data Lake Storage.

Přidání zdrojové transformace

V tomto kroku nastavíte Data Lake Storage Gen2 jako zdroj.

  1. Na plátně toku dat přidejte zdroj výběrem pole Přidat zdroj .

  2. Pojmenujte zdroj MoviesDB. Výběrem možnosti Nový vytvoříte novou zdrojovou datovou sadu.

  3. Vyberte Azure Data Lake Storage Gen2 a pak vyberte Continue.

  4. Vyberte Text s oddělovači a pak vyberte Pokračovat.

  5. Pojmenujte datovou sadu MoviesDB. V rozevíracím seznamu propojené služby vyberte Nový.

  6. Na obrazovce vytvoření propojené služby pojmenujte propojenou službu Data Lake Storage Gen2 ADLSGen2 a zadejte metodu ověřování. Pak zadejte přihlašovací údaje pro připojení. V tomto kurzu používáme klíč účtu Account key pro připojení k našemu účtu úložiště.

  7. Ujistěte se, že jste povolili interaktivní vytváření. Povolení může chvíli trvat.

    Snímek obrazovky znázorňující interaktivní vytváření

  8. Vyberte Test připojení. Měl by selhat, protože účet úložiště k němu neumožňuje přístup bez vytvoření a schválení privátního koncového bodu. V chybové zprávě by se měl zobrazit odkaz na vytvoření privátního koncového bodu, podle kterého můžete vytvořit spravovaný privátní koncový bod. Alternativou je přejít přímo na kartu Správa a podle pokynů v této části vytvořit spravovaný privátní koncový bod.

  9. Nechte dialogové okno otevřené a přejděte do svého účtu úložiště.

  10. Podle pokynů v této části schvalte privátní propojení.

  11. Vraťte se do dialogového okna. Znovu vyberte Test připojení a výběrem možnosti Vytvořit nasaďte propojenou službu.

  12. Na obrazovce pro vytvoření datové sady zadejte, kde se soubor nachází v poli Cesta k souboru. V tomto kurzu se soubor moviesDB.csv nachází v ukázkových datech kontejneru. Protože soubor obsahuje záhlaví, zaškrtněte políčko První řádek jako záhlaví . Pokud chcete importovat schéma hlaviček přímo ze souboru v úložišti, vyberte z připojení nebo úložiště . Až budete hotovi, vyberte OK .

    Snímek obrazovky znázorňující cestu ke zdroji

  13. Pokud se váš ladicí cluster spustil, přejděte na kartu Náhled dat ve zdrojové transformaci a vyberte Aktualizovat , abyste získali snímek dat. Pomocí náhledu dat můžete ověřit, jestli je transformace správně nakonfigurovaná.

    Snímek obrazovky znázorňující kartu Náhled dat

Vytvoření spravovaného privátního koncového bodu

Pokud jste při otestování předchozího připojení nepoužíli hypertextový odkaz, postupujte podle cesty. Teď potřebujete vytvořit spravovaný privátní koncový bod, který připojíte ke službě, kterou jste propojili.

  1. Přejděte na kartu Spravovat .

    Poznámka:

    Karta Spravovat nemusí být k dispozici pro všechny instance služby Data Factory. Pokud ho nevidíte, můžete přistoupit ke privátním koncovým bodům výběrem Autor>Připojení>Privátní koncový bod.

  2. Přejděte na část Spravované privátní koncové body.

  3. V části Spravované privátní koncové body vyberte + Nový.

    Snímek obrazovky znázorňující tlačítko Nový spravovaný privátní koncový bod

  4. V seznamu vyberte dlaždici Azure Data Lake Storage Gen2 a vyberte Continue.

  5. Zadejte název účtu úložiště, který jste vytvořili.

  6. Vyberte Vytvořit.

  7. Po několika sekundách byste měli vidět, že privátní propojení vytvořené vyžaduje schválení.

  8. Vyberte privátní koncový bod, který jste vytvořili. Zobrazí se hypertextový odkaz, který vás povede ke schválení privátního koncového bodu na úrovni účtu úložiště.

    Snímek obrazovky znázorňující podokno pro správu soukromého koncového bodu

  1. V účtu úložiště přejděte do části Nastavení na Připojení privátního koncového bodu.

  2. Zaškrtněte políčko u privátního koncového bodu, který jste vytvořili, a vyberte Schválit.

    Snímek obrazovky znázorňující tlačítko Schválit privátní koncový bod

  3. Přidejte popis a vyberte ano.

  4. Vraťte se do části Spravované soukromé koncové body na kartě Správa ve službě Data Factory.

  5. Přibližně za minutu by se mělo zobrazit schválení vašeho privátního koncového bodu.

Přidejte transformaci filtru

  1. Vedle zdrojového uzlu na plátně toku dat vyberte ikonu plus a přidejte novou transformaci. První přidanou transformací je filtr.

    Snímek obrazovky znázorňující přidání filtru

  2. Pojmenujte transformační filtr FilterYears. Vyberte okénko výrazu vedle Filtr a otevřete tvůrce výrazů. Tady zadáte podmínku filtrování.

    Snímek obrazovky, který ukazuje FilterYears.

  3. Tvůrce výrazů toku dat umožňuje interaktivně vytvářet výrazy pro použití v různých transformacích. Výrazy můžou zahrnovat předdefinované funkce, sloupce ze vstupního schématu a uživatelem definované parametry. Další informace o vytváření výrazů najdete v tématu Tvůrce výrazů toku dat.

    • V tomto kurzu chcete filtrovat filmy v žánru comedy, které vyšly mezi roky 1910 a 2000. Vzhledem k tomu, že rok je aktuálně řetězec, musíte pomocí funkce toInteger() ho převést na celé číslo. K porovnání s literálními hodnotami roků 1910 a 2000 použijte operátory větší nebo rovno (>=) a menší nebo rovno (<=). Spojte tyto výrazy pomocí operátoru &&. Výraz vychází takto:

      toInteger(year) >= 1910 && toInteger(year) <= 2000

    • Pokud chcete zjistit, které filmy jsou komiky, můžete pomocí rlike() funkce najít vzor "Comedy" ve sloupcových žánrech. Sjednocujte rlike výraz s porovnáním roku, abyste získali:

      toInteger(year) >= 1910 && toInteger(year) <= 2000 && rlike(genres, 'Comedy')

    • Pokud máte aktivní ladicí cluster, můžete ověřit logiku vybráním Aktualizovat, abyste zobrazili výstup výrazu ve srovnání s použitými vstupy. Existuje více než jedna správná odpověď na to, jak tuto logiku dosáhnout pomocí jazyka výrazů toku dat.

      Snímek obrazovky znázorňující výraz filtru

    • Po dokončení výrazu vyberte Uložit a dokončit .

  4. Ověřte, že filtr funguje správně tím, že načtete náhled dat.

    Snímek obrazovky znázorňující filtrovaný náhled dat

Přidej agregační transformaci

  1. Další transformace, kterou přidáte, je agregační transformace v rámci modifikátoru schématu.

    Snímek obrazovky znázorňující přidání agregace

  2. Pojmenujte agregační transformaci AggregateComedyRating. Na kartě Seskupit podle vyberte rok z rozevíracího seznamu a seskupte agregace podle roku, ve které film přišel.

    Snímek obrazovky znázorňující agregační skupinu

  3. Přejděte na kartu Agregace . V levém textovém poli pojmenujte agregovaný sloupec AverageComedyRating. Výběrem pravého pole výrazu zadejte agregační výraz prostřednictvím tvůrce výrazů.

    Snímek obrazovky znázorňující název agregovaného sloupce

  4. Pokud chcete získat průměr sloupce Hodnocení, použijte avg() agregační funkci. Protože Rating je řetězec a avg() přebírá číselný vstup, musíme hodnotu převést na číslo prostřednictvím toInteger() funkce. Tento výraz vypadá takto:

    avg(toInteger(Rating))

  5. Po dokončení vyberte Uložit a dokončit .

    Snímek obrazovky znázorňující uložení agregace

  6. Přejděte na kartu Náhled dat a zobrazte výstup transformace. Všimněte si, že existují jenom dva sloupce, rok a AverageComedyRating.

Přidejte transformaci jímky

  1. Dále chcete pod část Destinace přidat transformaci Sink.

    Snímek obrazovky znázorňující přidání jímky

  2. Pojmenujte jímku. Vyberte Nový a vytvořte datovou sadu jímky.

    Snímek obrazovky znázorňující vytvoření jímky

  3. Na stránce Nová datová sada vyberte Azure Data Lake Storage Gen2 a pak vyberte Continue.

  4. Na stránce Vybrat formát vyberte DelimitedText a poté vyberte Pokračovat.

  5. Pojmenujte výstupní datovou sadu MoviesSink. Pro propojenou službu zvolte stejnou propojenou službu ADLSGen2 , kterou jste vytvořili pro transformaci zdroje. Zadejte výstupní složku pro zápis dat do. V tomto návodu zapisujeme do složky output v kontejneru sample-data. Složka nemusí předem existovat a je možné ji dynamicky vytvořit. Zaškrtněte políčko První řádek jako záhlaví a jako schéma importu vyberte Žádné. Vyberte OK.

    Snímek obrazovky znázorňující cestu jímky

Teď jste dokončili vytváření toku dat. Jste připraveni ho spustit ve svém kanálu.

Spuštění a monitorování toku dat

Můžete ladit pipeline, než ho publikujete. V tomto kroku spustíte debug datového toku. I když náhled dat nezapisuje data, spuštění ladění zapíše data do cílového umístění.

  1. Přejděte na plátno kanálu. Vyberte Ladit pro spuštění ladicího běhu.

  2. Ladění pipelinu aktivit toku dat využívá aktivní ladicí cluster, ale inicializace stále trvá alespoň minutu. Průběh můžete sledovat pomocí záložky Výstup. Po úspěšném spuštění vyberte ikonu brýlí pro zobrazení podrobností o spuštění.

  3. Na stránce podrobností můžete zobrazit počet řádků a čas strávený jednotlivými kroky transformace.

    Snímek obrazovky znázorňující spuštění monitorování

  4. Výběrem transformace získáte podrobné informace o sloupcích a dělení dat.

Pokud jste postupovali podle tohoto kurzu správně, měli byste do složky jímky napsat 83 řádků a 2 sloupce. Správnost dat můžete ověřit kontrolou vašeho úložiště blobů.

Shrnutí

V tomto kurzu jste pomocí uživatelského rozhraní služby Data Factory vytvořili datový tok, který kopíruje a transformuje data ze zdroje Data Lake Storage Gen2 do cílového úložiště Data Lake Storage Gen2, které umožňují přístup pouze vybraným sítím, pomocí mapování toku dat v Spravované virtuální síti služby Data Factory.