Deklarativní kanály Sparku

Apache Spark™ Declarative Pipelines je deklarativní framework pro vytváření dávkových a streamovacích datových pipeline v SQL a Pythonu. Kanály Lakeflow se rozšiřují a jsou interoperabilní s deklarativními kanály Sparku a běží na modulu Databricks Runtime optimalizovaném pro výkon. Mezi běžné případy použití kanálů patří příjem dat ze zdrojů, jako je cloudové úložiště (například Amazon S3, Azure ADLS Gen2 a Google Cloud Storage) a sběrnice zpráv (například Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub a Apache Pulsar) a inkrementální dávkové a streamovací transformace.

Poznámka:

Kanály Lakeflow vyžadují plán Premium. Další informace získáte od týmu účtu Databricks.

Tato část obsahuje podrobné informace o používání kanálů. Následující témata vám pomůžou začít.

Téma Description
Koncepty kanálů Seznamte se se základními koncepty pipeline, včetně toků, streamovacích tabulek a materializovaných zobrazení.
Cvičení V kurzech získáte praktické zkušenosti s používáním kanálů.
Vývoj kanálů Naučte se vyvíjet a testovat kanály, které vytvářejí toky pro ingestování a transformaci dat.
Konfigurace potrubí Naučte se plánovat a konfigurovat kanály.
Monitorování kanálů Zjistěte, jak monitorovat pipeliny a řešit potíže s dotazy na pipeliny.
Vývojáři Naučte se používat Python a SQL při vývoji datových toků.
Samostatné kanály Seznamte se s vytvářením samostatných streamovaných tabulek a materializovaných zobrazení v Databricks SQL nebo Python.
Osvědčené postupy Seznamte se s doporučenými vzory pro vytváření spolehlivých, efektivních a udržovatelných kanálů.

Dodatečné zdroje