Festlegen des Zielkatalogs und des Schemas

Der Standardstandort für Datenressourcen im UI der Pipelinekonfiguration legt den Standard-Katalog und das Schema für eine Pipeline fest. Dieser Standardkatalog und dieses Schema werden für alle Datasetdefinitionen und Tabellenlesevorgänge verwendet, es sei denn, sie werden innerhalb der Abfrage außer Kraft gesetzt.

Hinweis

Im Legacyveröffentlichungsmodus wird das virtuelle LIVE Schema verwendet, um ein ähnliches Verhalten zu erzielen. Im Standardveröffentlichungsmodus (verwendet von allen neuen Pipelines) wird das schlüsselwort LIVE ignoriert. Weitere Informationen finden Sie unter LIVE-Schema (Legacy).

Ein Ziel-Dataset in einem anderen Katalog oder Schema auswählen

Lakeflow-Pipelines unterstützen die Semantik der dreistufigen Bezeichnerauflösung. Databricks empfiehlt die Verwendung vollqualifizierter Bezeichner für Abfragen und Anweisungen, die auf andere Datasets als auf die in Ihrer Pipeline konfigurierten Standard-Datasets abzielen. Siehe Auflösung von Unity-Katalog-Identifikatoren. Um beispielsweise eine materialisierte Ansicht namens regional_sales im main-Katalog und im stores-Schema zu erstellen, die nicht Ihren Pipeline-Standardeinstellungen entsprechen, geben Sie den Namen vollständig als main.stores.regional_sales an:

Python

from pyspark import pipelines as dp

@dp.materialized_view(name="main.stores.regional_sales")
def func():
  return spark.read.table("partners");

SQL

CREATE OR REPLACE MATERIALIZED VIEW main.stores.regional_sales
  AS SELECT *
  FROM partners;

Pipelines unterstützen die SQL-Befehle USE CATALOG catalog_name und USE SCHEMA schema_name. Führen Sie diese Befehle aus, um den aktuellen Katalog und das Schema auf die Datei oder das Notizbuch einzuschränken, die die Befehle enthalten. Vorgänge, die diesen Befehlen in der Quellcodedatei folgen und nicht qualifizierte oder teilweise qualifizierte Bezeichner verwenden, werden in den aktuellen Katalog und das aktuelle Schema aufgelöst, anstatt in die in der Pipelinekonfiguration festgelegten Standardwerte. Siehe Was sind der aktuelle Katalog und das aktuelle Schema?.

Was geschieht, wenn kein Dataset vorhanden ist?

In der folgenden Tabelle wird das Verhalten beschrieben, wenn der Pipelinequellcode auf Datasets verweist, die nicht vorhanden sind:

Operation Ergebnis
Lesen Sie Wenn eine Tabelle, eine materialisierte Ansicht, eine Streamingtabelle oder eine Ansicht für den angegebenen Bezeichner nicht vorhanden ist, schlägt die Aktualisierung fehl.
Schreiben Wenn für die angegebene Kennung keine materialisierte Ansicht, keine Streaming-Tabelle, keine Ansicht oder kein Sink existiert, versucht die Aktualisierung, das Dataset zu erstellen. Bei Bedarf erstellt das Update auch das angegebene Schema.

Von Bedeutung

Möglicherweise wird eine Fehlermeldung angezeigt, die besagt, dass ein Dataset nicht vorhanden ist, wenn Sie nicht über ausreichende Berechtigungen zum Anzeigen des Datasets verfügen.

Sie müssen über ausreichende Berechtigungen verfügen, um Datasets mit Lakeflow-Pipelines zu lesen, zu schreiben und zu erstellen. Siehe Anforderungen.