Možnosti příjmu dat pro lakehouse

Existuje několik způsobů, jak získat data do jezera, od jednoduchých nahrávání souborů až po škálovatelné kanály a streamování v reálném čase. Správný přístup závisí na zdroji dat, objemu, složitosti transformace a na tom, jestli potřebujete jednorázové nebo průběžné ingestování.

Způsoby načtení dat do jezera

Následující sekce popisují každý přístup — nahrávání souborů, zkratky, datový tok Gen2, datové pipeline, kód notebooku a eventstream — seřazený od nejjednodušší no-code možnosti až po pokročilejší programové a real-time metody.

Nahrání souborů

Pokud chcete do jezera načíst malé soubory bez jakékoli transformace, nahrajte je přímo z místního počítače prostřednictvím Průzkumníka Lakehouse.

Snímek obrazovky s dialogovým oknem pro nahrání souboru v Průzkumníku Lakehouse

Zkratky

Klávesové zkratky umožňují odkazovat na data v jiných umístěních úložiště, aniž byste je museli kopírovat. Zástupce se zobrazí jako složka ve vašem lakehouse, ale odkazuje na data uložená jinde – v jiném lakehouse, účtu Azure Data Lake Storage Gen2, Amazon S3 nebo jiných podporovaných zdrojích. Klávesové zkratky jsou užitečné, když chcete dotazovat nebo spojit data mezi zdroji, aniž byste je duplikoval. Další informace najdete v tématu Klávesové zkratky v jezeře.

Systém toku dat Gen2

Dataflow Gen2 je low-code nástroj pro transformaci dat s více než 200 konektory. Transformace definujete vizuálně v rozhraní Power Query a výstupem výsledků do tabulky lakehouse. Tok dat Gen2 je dobrou volbou pro menší datové sady nebo pokud potřebujete konektory, které nejsou dostupné v jiných nástrojích. Další informace najdete v tématu Vytvoření prvního toku dat pro získání a transformaci dat.

Datové kanály

Datové kanály poskytují škálovatelný nástroj pro kopírování pro přesun velkých objemů dat do jezera. Aktivita kopírování se připojuje k široké škále zdrojů dat a může načítat data v původním formátu nebo je převést na tabulku Delta. Můžete naplánovat procesy, aktivovat je na základě událostí a propojovat více aktivit. Další informace naleznete v tématu Jak kopírovat data pomocí kopírovací aktivity.

Kód poznámkového bloku

Poznámkové bloky Spark poskytují úplnou programovou kontrolu nad příjmem dat. Pomocí knihoven Sparku se připojte ke zdroji dat, načtěte data do datového rámce, použijte transformace a uložte výsledky do jezera. Tento přístup je nejflexibilnější a vyhovuje komplexní logikě transformace nebo zdrojům, které jiné nástroje nepodporují.

Poznámka:

Externí tabulky Delta vytvořené pomocí kódu Sparku nejsou viditelné pro koncový bod analýzy SQL. Pomocí klávesových zkratek v části Tabulky můžete zpřístupnit externí tabulky Delta pro koncový bod analýzy SQL. Další informace najdete v tématu Klávesové zkratky v jezeře.

Eventstream

Eventstream přijímá, zpracovává a směruje události ve velkém objemu v reálném čase z nejrůznějších zdrojů. Lakehouse můžete přidat jako cíl pro streamování dat přímo do tabulek Delta.

Screenshot přijímání dat do jezerního domu z eventstreamu.

Pro více informací viz Získejte data z eventstream v jezeře.

Pro scénáře časových řad nebo vysokorychlostních streamovacích scénářů můžete také streamovat události do eventhouse a povolit dostupnost OneLake. Tím se ve OneLake vytvoří tabulka Delta, ke které může dům u jezera přistupovat prostřednictvím zkratky. Pro více informací viz dostupnost eventhouse OneLake.

Volba přístupu

Následující tabulka shrnuje, kdy použít každý přístup k načítání dat do jezera.

Scénář Doporučený přístup
Malé soubory z místního počítače Nahrání souborů
Odkazování na data bez kopírování Zkratky
Malá až střední data s vizuálními transformacemi Systém toku dat Gen2
Přesun velkých objemů dat Datové kanály
Složité transformace nebo nepodporované zdroje Kód zápisníku
Příjem událostí v reálném čase Eventstream
Časové řady nebo streamování s vysokou propustností Z eventstreamu do eventhouse s dostupností OneLake