Čo je Microsoft Fabric Data Engineering?

Microsoft Fabric Data Engineering umožňuje používateľom navrhovať, budovať a udržiavať infraštruktúry a systémy, ktoré umožňujú ich organizáciám zhromažďovať, ukladať, spracovávať a analyzovať veľké objemy dát.

Fabric poskytuje rôzne schopnosti dátového inžinierstva, aby zabezpečil, že vaše dáta budú ľahko dostupné, dobre usporiadané a kvalitné. Ak chcete získať prístup k domovskej stránke dátového inžiniera, na navigačnej table vyberte vyťaženia a potom vyberte dlaždicu Data Engineering. Z domovskej stránky dátového inžiniera môžete:

  • Vytvorenie a spravovanie údajov pomocou služby lakehouse

  • Navrhujte kanály na kopírovanie údajov do vášho jazera

  • Použitie definícií úloh spark na odoslanie úlohy dávkového/streamu do klastra Spark

  • Poznámkové bloky môžete použiť na písanie kódu na príjem, prípravu a transformáciu údajov

    Snímka obrazovky zobrazujúca objekty dátového inžinierstva.

Lakehouse

Služby Lakehouses sú údajové architektúry, ktoré umožňujú organizáciám ukladať a spravovať štruktúrované a neštruktúrované údaje na jednom mieste pomocou rôznych nástrojov a rámcov na spracovanie a analýzu týchto údajov. Tieto nástroje a rámce môžu zahŕňať dotazy a analýzy založené na SQL, ako aj strojové učenie a ďalšie techniky pokročilej analýzy.

Definícia úlohy v Apache Spark

Definície úloh spark sú množinou pokynov, ktoré definujú, ako vykonávať úlohu v klastri Spark. Obsahuje informácie, ako sú napríklad vstupné a výstupné zdroje údajov, transformácie a nastavenia konfigurácie pre aplikáciu Spark. Definícia úlohy spark umožňuje odoslať úlohu šarže/streamovania do klastra Spark, použiť inú logiku transformácie na údaje hosťované vo vašom úzovskom jazere spolu s mnohými ďalšími vecami.

Zápisník

Poznámkové bloky predstavujú interaktívne výpočtové prostredie, ktoré umožňuje používateľom vytvárať a zdieľať dokumenty obsahujúce dynamický kód, rovnice, vizualizácie a text rozprávania. Používateľom umožňujú písať a spúšťať kód v rôznych programovacích jazykoch vrátane jazyka Python, R a Scala. Poznámkové bloky môžete použiť na príjem údajov, prípravu, analýzu a iné úlohy súvisiace s údajmi.

Pipeline

Kanály sú sériou krokov, ktoré môžu zhromažďovať, spracovávať a transformovať údaje z ich nespracovanej formy do formátu, ktorý môžete použiť na analýzu a rozhodovanie. Sú dôležitou zložkou dátového inžinierstva, pretože poskytujú spôsob, ako spoľahlivo, škálovateľným a efektívnym spôsobom presúvať údaje zo zdroja do cieľa.

Data Engineering môžete používať zadarmo, keď sa prihlásite na skúšobnú verziu Fabric. Môžete si tiež kúpiť Fabric capacity alebo Fabric rezervovanú kapacitu

Začíname s dátovým inžinierstvom: