Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
VZTAHUJE SE NA:
Azure Data Factory
Azure Synapse Analytics
Návod
Data Factory v Microsoft Fabric je nová generace Azure Data Factory s jednodušší architekturou, integrovanou AI a novými funkcemi. Pokud s integrací dat začínáte, začněte Fabric Data Factory. Stávající úlohy ADF lze upgradovat na Fabric pro přístup k novým funkcím v oblastech datové vědy, analýz v reálném čase a vytváření sestav.
Pokud s Azure Data Factory začínáte, přečtěte si téma Introduction Azure Data Factory.
V tomto kurzu použijete plátno toku dat k vytvoření toků dat, které umožňují analyzovat a transformovat data v Azure Data Lake Storage (ADLS) Gen2 a ukládat je v Delta Lake.
Požadavky
- Azure předplatné. Pokud nemáte předplatné Azure, vytvořte si účet free Azure než začnete.
- Azure účet pro ukládání. Úložiště ADLS používáte jako zdrojové úložiště a cílové úložiště. Pokud účet úložiště nemáte, přečtěte si článek Vytvoření účtu úložiště Azure postup jeho vytvoření.
Soubor, který transformujeme v tomto kurzu, je MoviesDB.csv, který najdete tady. Pokud chcete soubor načíst z GitHub, zkopírujte obsah do textového editoru podle vašeho výběru a uložte ho místně jako soubor .csv. Pokud chcete nahrát soubor do účtu úložiště, viz Upload objektů blob pomocí portálu Azure. Příklady odkazují na kontejner s názvem sample-data.
Vytvoření datové továrny
V tomto kroku vytvoříte datovou továrnu a otevřete uživatelské rozhraní Data Factory k vytvoření pipeline v datové továrně.
Otevřete Microsoft Edge nebo Google Chrome. V současné době se uživatelské rozhraní služby Data Factory podporuje jenom ve webových prohlížečích Microsoft Edge a Google Chrome.
V levé nabídce vyberte Vytvořit zdroj>Integrace>Data Factory
Na stránce Nová datová továrna v části Název zadejte ADFTutorialDataFactory.
Vyberte Azure předplatné, ve kterém chcete vytvořit službu Data Factory.
U položky Skupina prostředků proveďte jeden z následujících kroků:
a. Vyberte Použít existující a z rozevíracího seznamu vyberte existující skupinu prostředků.
b) Vyberte Vytvořit novou a zadejte název skupiny prostředků.
Další informace o skupinách prostředků najdete v tématu Užití skupin prostředků ke správě prostředků Azure.
Jako Verzi vyberte V2.
V části Umístění vyberte umístění datové továrny. V rozevíracím seznamu se zobrazí pouze podporovaná umístění. Úložiště dat (například Azure Storage a SQL Database) a výpočty (například Azure HDInsight) používané datovnou mohou být v jiných oblastech.
Vyberte Vytvořit.
Po vytvoření se v Centru oznámení zobrazí oznámení. Výběrem možnosti Přejít k prostředku přejděte na stránku Datové továrny.
Vyberte
Autor & Monitor pro spuštění uživatelského rozhraní služby Data Factory na samostatné kartě.
Vytvořte potrubí s aktivitou toku dat
V tomto kroku vytvoříte kanál, který obsahuje aktivitu toku dat.
Na domovské stránce vyberte Orchestrate.
Na kartě Obecné pro kanál zadejte DeltaLake pro název kanálu.
V podokně Aktivity rozbalte sekci Přesunout a transformovat. Přetáhněte aktivitu Tok dat z panelu na pracovní plochu kanálu.
Na horním panelu plátna prokanalizačních procesů přepněte posuvník ladění toku dat do polohy zapnuto. Režim ladění umožňuje interaktivní testování logiky transformace na živém clusteru Spark. Klastrům Tok dat trvá 5 až 7 minut, než se zahřejí, a uživatelům se doporučuje nejprve zapnout ladicí režim, pokud plánují vyvíjet s Tok dat. Další informace viz Režim ladění.
Vytvoření logiky transformace na plátně toku dat
V tomto kurzu vygenerujete dva toky dat. První tok dat je jednoduchý zdroj pro jímku pro vygenerování nového Delta Lake ze souboru CSV s filmy. Nakonec vytvoříte návrh toku, který následuje za účelem aktualizace dat v Delta Lake.
Cíle kurzu
- Použijte zdroj datové sady MoviesCSV z předpokladů a vytvořte z ní nový Delta Lake.
- Vytvořte logiku pro aktualizovaná hodnocení filmů z roku 1988 na 1.
- Odstraňte všechny filmy z roku 1950.
- Vložte nové filmy pro 2021 duplikováním filmů z roku 1960.
Začněte s prázdným plátnem pro tok dat
Vyberte zdrojovou transformaci v horní části okna editoru toku dat a pak v okně Nastavení zdroje vyberte + Nový vedle vlastnosti Datová sada:
V zobrazeném okně Azure Data Lake Storage Gen2 vyberte Nová datová sada a pak vyberte Continue.
Jako typ datové sady zvolte Oddělený text a znovu vyberte Pokračovat.
Pojmenujte datovou sadu MoviesCSV a v části Propojená služba vyberte + Nový a vytvořte novou propojenou službu se souborem.
Zadejte podrobnosti o účtu úložiště vytvořeném dříve v části Požadavky a vyhledejte a vyberte soubor MoviesCSV, který jste tam nahráli.
Po přidání propojené služby zaškrtněte políčko První řádek jako záhlaví a pak vyberte OK a přidejte zdroj.
Přejděte na kartu Projekce v okně nastavení toku dat a pak vyberte Zjistit datové typy.
Teď vyberte + za zdrojem v okně editoru toku dat a posuňte se dolů a vyberte jímku v části Cíl a přidejte do toku dat novou jímku.
Na kartě Jímka pro nastavení jímky, která se zobrazí po přidání jímky, vyberte Vložený jako typ jímky a potom Delta jako typ vložené datové sady. Pak vyberte Azure Data Lake Storage Gen2 pro službu Linked.
V kontejneru úložiště zvolte název složky, ve které chcete, aby služba vytvořila Delta Lake.
Nakonec se vraťte zpět do návrháře kanálu a vyberte Ladit, aby se kanál spustil v režimu ladění pouze s touto aktivitou toku dat na plátně. Tím se vygeneruje vaše nové Delta Lake v Azure Data Lake Storage Gen2.
Nyní v nabídce Prostředky továrny na levé straně obrazovky vyberte + pro přidání nového prostředku, a pak vyberte Datový tok.
Stejně jako dříve vyberte znovu soubor MoviesCSV jako zdroj a pak na kartě Projekce znovu vyberte Zjistit datové typy.
Tentokrát po vytvoření zdroje vyberte + v okně editoru toku dat a do zdroje přidejte transformaci filtru.
V okně Nastavení filtru přidejte podmínku Filtru, která umožňuje pouze řádky videa odpovídající 1950, 1960 a 1988.
Teď přidejte transformaci odvozeného sloupce , která aktualizuje hodnocení pro každý film z roku 1988 na 1.
Update, insert, delete, and upsertzásady se vytvářejí v transformaci alter Row. Za odvozený sloupec přidejte změnu transformace řádku.Zásady změn řádků by měly vypadat takto.
Teď, když jste nastavili správné politiky pro každý typ změněného řádku, zkontrolujte, jestli byla v cílové transformaci nastavená správná pravidla aktualizace.
Tady používáme jímku Delta Lake k vašemu Azure Data Lake Storage Gen2 datovému jezeře a umožňujeme vkládání, aktualizace a odstraňování.
Všimněte si, že klíčové sloupce jsou složený klíč tvořený sloupcem primárního klíče Movie a sloupcem roku. Je to proto, že jsme vytvořili falešné filmy z roku 2021 tím, že jsme duplikovali řádky z roku 1960. Tím se zabrání kolizím při vyhledávání existujících řádků poskytnutím jedinečnosti.
Stažení dokončené ukázky
Tady je ukázkové řešení pro kanál Delta s tokem dat pro aktualizace nebo odstranění řádků v jezeře.
Související obsah
Přečtěte si další informace o jazyce výrazů toku dat.