Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Azure Databricks bietet zwei Möglichkeiten, materialisierte Ansichten und Streamingtabellen zu erstellen: eigenständige Pipelines oder Lakeflow-Pipelines. Beide werden auf demselben deklarativen Modul ausgeführt und erstellen verwaltete Tabellen im Unity-Katalog. Der Unterschied besteht darin, wie viel von der Pipeline Sie selbst erstellen und betreiben.
- Eine eigenständige materialisierte Ansicht oder Streamingtabelle ist ein einzelnes Dataset, das mit sql-Syntax definiert ist. Azure Databricks erstellt und verwaltet eine Pipeline hinter den Kulissen, um sie zu aktualisieren. Sie erstellen und aktualisieren eigenständige Datasets aus einem Databricks SQL Warehouse oder aus einem Notebook auf serverloser Allzweckrechenleistung mithilfe von
spark.sql(). Siehe eigenständige Pipelines. - Eine Lakeflow-Pipeline ist eine Pipeline, die Sie als Einheit erstellen und betreiben. Es kann zahlreiche Datensätze in SQL und Python enthalten und verfügt über Funktionen zur Koordination von Abhängigkeiten, zur Rückverfolgbarkeit sowie über pipelineweite Betriebsfunktionen. Siehe "Was sind Pipelines?".
Wenn Sie eine eigenständige materialisierte Ansicht oder Streaming-Tabelle erstellen, wird die verwaltete Pipeline auf der Seite Aufträge & Pipelines mit einem Pipelinetyp von MV/STangezeigt. Datasets, die in einer Lakeflow-Pipeline definiert sind, weisen einen Pipelinetyp auf ETL.
Wann eine eigenständige Pipeline verwendet werden soll
Verwenden Sie eigenständige materialisierte Ansichten und Streamingtabellen, wenn:
- Mit einer einzigen materialisierten Ansicht oder Streaming-Tabelle beschleunigen Sie Abfragen oder transformieren Daten.
- Sie arbeiten in einem Databricks SQL Warehouse, im SQL-Editor oder in einem Notebook mit serverloser Allzweckrechenleistung und planen Aktualisierungen mit
SCHEDULE,TRIGGER ON UPDATEoder einer SQL-Aufgabe in einem Job. - Sie benötigen keine Sinks, keine mehrstufige Orchestrierung und keine anderen Funktionen, die nur für Pipelines verfügbar sind.
Wann eine Lakeflow-Pipeline verwendet werden soll
Verwenden Sie eine Lakeflow-Pipeline, wenn:
- Sie erstellen eine mehrstufige Pipeline mit Zwischendatensätzen, in denen Azure Databricks Abhängigkeiten und Linien über die Datasets hinweg verwaltet. Zwischendatensätze können im Katalog veröffentlicht werden oder innerhalb der Pipeline privat bleiben.
- Sie erstellen Tabellen und Flüsse in Python.
- Sie schreiben mithilfe von Senken (
create_sink()oderforeach_batch_sink()) in externe Delta-Tabellen oder an Eventstreaming-Ziele. - Sie erfassen Änderungen aus einer Datenbank-Momentaufnahme mithilfe von
create_auto_cdc_from_snapshot_flow(). - Sie möchten eine triggergesteuerte oder kontinuierliche Ausführung in der gesamten Pipeline.
Vergleich
| Property | Eigenständige Streamingtabelle oder materialisierte Ansicht | Streaming-Tabelle der Pipeline oder die materialisierte Ansicht |
|---|---|---|
| Erstellungsschnittstelle | SQL-Syntax, in einem Databricks SQL-Warehouse oder mit spark.sql() in einem Notebook auf serverloser allgemeiner Compute-Umgebung |
SQL und Python |
| Scope | Ein Dataset in einer Pipeline, die Azure Databricks für Sie verwaltet | Viele Datasets in einer Pipeline mit Abhängigkeits-Orchestrierung und -herkunft |
| Ausführung | Ausgelöst mit SCHEDULE, TRIGGER ON UPDATE oder einer SQL-Aufgabe |
Ausgelöst oder fortlaufend |
| Nur in der Pipeline verfügbare Funktionen | Senken, create_auto_cdc_from_snapshot_flow(), private Datensätze |
|
| Pipelinetypbezeichnung | MV/ST |
ETL |
| Wechseln zwischen Pipelines | Nicht unterstützt; Erstellen Sie die Tabelle in der Zielpipeline neu. | Unterstützt |