Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
VZTAHUJE SE NA:
Azure Data Factory
Azure Synapse Analytics
Návod
Data Factory v Microsoft Fabric je nová generace Azure Data Factory s jednodušší architekturou, integrovanou AI a novými funkcemi. Pokud s integrací dat začínáte, začněte Fabric Data Factory. Stávající úlohy ADF lze upgradovat na Fabric pro přístup k novým funkcím v oblastech datové vědy, analýz v reálném čase a vytváření sestav.
Pokud s Azure Data Factory začínáte, přečtěte si téma Introduction Azure Data Factory.
V tomto kurzu se seznámíte s osvědčenými postupy, které se dají použít při zápisu souborů do ADLS Gen2 nebo Azure Blob Storage pomocí toků dat. Ke čtení souboru Parquet a následnému uložení výsledků do složek budete potřebovat přístup k účtu Azure Blob Storage účtu nebo účtu Azure Data Lake Store Gen2.
Požadavky
- Azure předplatné. Pokud nemáte předplatné Azure, vytvořte si účet free Azure než začnete.
- Azure účet pro ukládání. Úložiště ADLS používáte jako zdroj a cíl datových úložišť. Pokud účet úložiště nemáte, přečtěte si článek Vytvoření účtu úložiště Azure postup jeho vytvoření.
Kroky v tomto návodu předpokládají, že máte
Vytvoření datové továrny
V tomto kroku vytvoříte datovou továrnu a otevřete uživatelské rozhraní služby Data Factory, abyste vytvořili datový kanál v datové továrně.
Otevřete Microsoft Edge nebo Google Chrome. V současné době se uživatelské rozhraní služby Data Factory podporuje jenom ve webových prohlížečích Microsoft Edge a Google Chrome.
V nabídce vlevo vyberte Vytvořit prostředek>Integrace>Data Factory
Na stránce Nová datová továrna v části Název zadejte ADFTutorialDataFactory.
Vyberte Azure předplatné, ve kterém chcete vytvořit službu Data Factory.
U položky Skupina prostředků proveďte jeden z následujících kroků:
a. Vyberte Použít existující a z rozevíracího seznamu vyberte existující skupinu prostředků.
b) Vyberte Vytvořit novou a zadejte název skupiny prostředků. Další informace o skupinách prostředků najdete v tématu Užití skupin prostředků ke správě prostředků Azure.
Jako Verzi vyberte V2.
V části Umístění vyberte umístění datové továrny. V rozevíracím seznamu se zobrazí pouze podporovaná umístění. Úložiště dat (například Azure Storage a SQL Database) a výpočty (například Azure HDInsight) používané datovnou mohou být v jiných oblastech.
Vyberte Vytvořit.
Po vytvoření se v Centru oznámení zobrazí oznámení. Výběrem možnosti Přejít k prostředku přejděte na stránku Data Factory.
Vyberte
Autor & Monitor pro spuštění uživatelského rozhraní služby Data Factory na samostatné kartě.
Vytvořte potrubí s aktivitou toku dat
V tomto kroku vytvoříte kanál, který obsahuje aktivitu toku dat.
Na domovské stránce Azure Data Factory vyberte Orchestrate.
Na kartě Obecné pro kanál zadejte DeltaLake pro název kanálu.
Na horním panelu továrny zapněte posuvník Tok dat debug. Režim ladění umožňuje interaktivní testování logiky transformace na živém clusteru Spark. Klastrům Tok dat trvá 5 až 7 minut, než se zahřejí, a uživatelům se doporučuje nejprve zapnout ladicí režim, pokud plánují vyvíjet s Tok dat. Další informace naleznete v tématu Režim ladění.
V podokně Aktivity rozbalte sekci Přesunout a transformovat. Přetáhněte aktivitu Tok dat z panelu na pracovní plochu kanálu.
Vytvořte logiku transformace na ploše datového toku
Použijete všechna zdrojová data (v tomto kurzu použijeme zdroj souborů Parquet) a pomocí výstupní transformace uložíte data ve formátu Parquet pomocí nejúčinnějších mechanismů pro ETL v datovém jezeru.
Cíle kurzu
- Zvolte některou ze zdrojových datových sad v novém toku dat 1. Efektivní rozdělení datové sady jímky pomocí toků dat
- Umístěte svá dělená data do složek jezera ADLS Gen2
Začínáme z prázdného plátna toku dat
Nejprve nastavíme prostředí toku dat pro každý z níže popsaných mechanismů pro cílová data v ADLS Gen2.
- Klikněte na zdrojovou transformaci.
- Klikněte na nové tlačítko vedle datové sady v dolním panelu.
- Zvolte datovou sadu nebo vytvořte novou. Pro tuto ukázku použijeme datovou sadu Parquet s názvem Uživatelská data.
- Přidání transformace odvozeného sloupce Použijeme ho jako způsob dynamického nastavení požadovaných názvů složek.
- Přidejte transformaci jímky.
Výstup hierarchické složky
Je velmi běžné použít jedinečné hodnoty k vytvoření hierarchií složek a rozdělení dat v jezeře. Jedná se o velmi optimální způsob, jak uspořádat a zpracovávat data v jezeře a ve Sparku (výpočetní modul za toky dat). Nicméně, uspořádání výstupu tímto způsobem bude znamenat malý kompromis ve výkonu. Očekáváme, že se při použití tohoto mechanismu v jímce zobrazí malý pokles celkového výkonu kanálu.
- Vraťte se do návrháře toku dat a upravte tok dat, který vytvoříte výše. Klikněte na transformaci dřezu.
- Klikněte na Optimalizovat > Nastavit dělení > Klíč
- Vyberte sloupce, které chcete použít k nastavení struktury hierarchických složek.
- Všimněte si, že následující příklad používá jako sloupce pro pojmenování složek rok a měsíc. Výsledky budou složky formuláře
releaseyear=1990/month=8. - Při přístupu k datovým oddílům ve zdroji toku dat budete odkazovat pouze na složku nejvyšší úrovně výše
releaseyeara pro každou další složku použijete zástupný znak, například:**/**/*.parquet - Pokud chcete manipulovat s datovými hodnotami nebo i v případě, že potřebujete vygenerovat syntetické hodnoty pro názvy složek, vytvořte pomocí transformace Odvozený sloupec hodnoty, které chcete použít v názvech složek.
Název složky jako datové hodnoty
Mírně lepší technika ukládání dat do jezera s využitím ADLS Gen2, která nenabízí stejnou výhodu jako dělení na klíče a hodnoty, je Name folder as column data. Zatímco klíčový styl dělení hierarchické struktury vám umožní snadněji zpracovávat části dat, tato technika je plošší strukturou složek, která dokáže rychleji zapisovat data.
- Vraťte se do návrháře toku dat a upravte tok dat, který vytvoříte výše. Klikněte na transformaci dřezu.
- Klepněte na Optimalizovat > nastavit dělení > Použijte aktuální dělení.
- Klikněte na Nastavení > Pojmenujte složku jako údaje ve sloupci.
- Vyberte sloupec, který chcete použít ke generování názvů složek.
- Pokud chcete manipulovat s datovými hodnotami nebo i v případě, že potřebujete vygenerovat syntetické hodnoty pro názvy složek, vytvořte pomocí transformace Odvozený sloupec hodnoty, které chcete použít v názvech složek.
Pojmenujte soubor podle datových hodnot
Techniky uvedené v předchozích kurzech jsou vhodné případy použití pro vytváření kategorií složek ve vašem datovém jezeře. Výchozím schématem pojmenování souborů, které tyto techniky používají, je použití ID úlohy Exekutoru Sparku. Někdy můžete chtít nastavit název výstupního souboru v textové jímce toku dat. Tato technika se navrhuje jenom pro použití s malými soubory. Proces sloučení souborů oddílů do jednoho výstupního souboru je dlouhotrvající proces.
- Vraťte se do návrháře toku dat a upravte tok dat, který vytvoříte výše. Klikněte na transformaci dřezu.
- Klepněte na tlačítko Optimalizovat > nastavení dělení > Jeden oddíl. Jedná se o požadavek na jeden oddíl, který při slučování souborů vytváří kritický bod v procesu provádění. Tato možnost se doporučuje jenom pro malé soubory.
- Klikněte na Nastavení > Pojmenujte soubor jako data sloupce.
- Vyberte sloupec, který chcete použít ke generování názvů souborů.
- Pokud chcete manipulovat s datovými hodnotami, nebo i když potřebujete vygenerovat syntetické hodnoty pro názvy souborů, vytvořte pomocí transformace odvozeného sloupce hodnoty, které chcete použít v názvech souborů.
Související obsah
Přečtěte si další informace o jímkách toku dat.