Deklarativní kanály Sparku

Apache Spark™ Declarative Pipelines je deklarativní framework pro vytváření dávkových a streamovacích datových pipeline v SQL a Pythonu. Kanály Lakeflow se rozšiřují a jsou interoperabilní s deklarativními kanály Sparku a běží na modulu Databricks Runtime optimalizovaném pro výkon. Mezi běžné případy použití kanálů patří příjem dat ze zdrojů, jako je cloudové úložiště (například Amazon S3, Azure ADLS Gen2 a Google Cloud Storage) a sběrnice zpráv (například Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub a Apache Pulsar) a inkrementální dávkové a streamovací transformace.

Poznámka:

Kanály Lakeflow vyžadují plán Premium. Další informace získáte od týmu účtu Databricks.

Tato část obsahuje podrobné informace o používání kanálů. Následující témata vám pomůžou začít.

Téma Description
Jak používat potrubí Lakeflow Začněte tady. Pochopte, jak používat kanály v průběhu jejich životního cyklu a proč je používat, včetně odkazů na úkoly v jednotlivých fázích.
Koncepty kanálů Seznamte se se základními koncepty pipeline, včetně toků, streamovacích tabulek a materializovaných zobrazení.

Pro podrobnější informace o potrubích viz:

Téma Description
Cvičení V kurzech získáte praktické zkušenosti s používáním kanálů.
Vývoj kanálů Naučte se vyvíjet a testovat kanály, které vytvářejí toky pro ingestování a transformaci dat.
Konfigurace potrubí Naučte se plánovat a konfigurovat kanály.
Monitorování kanálů Zjistěte, jak monitorovat pipeliny a řešit potíže s dotazy na pipeliny.
Vývojáři Naučte se používat Python a SQL při vývoji datových toků.
Samostatné kanály Seznamte se s vytvářením samostatných streamovaných tabulek a materializovaných zobrazení v Databricks SQL nebo Python.
Osvědčené postupy Seznamte se s doporučenými vzory pro vytváření spolehlivých, efektivních a udržovatelných kanálů.

Dodatečné zdroje