Führe eine Datei auf einem Cluster oder eine Datei oder ein Notizbuch als Job in Azure Databricks mit der Databricks IDE-Erweiterung aus

Die IDE-Erweiterung Databricks ermöglicht es dir, deinen Python-Code auf einem Cluster oder in deinem Python-, R-, Scala- oder SQL-Code oder Notebook als Job in Azure Databricks auszuführen.

Diese Informationen gehen davon aus, dass Sie die IDE-Erweiterung Databricks bereits installiert und eingerichtet haben. Siehe Install the Databricks IDE-Erweiterung.

Hinweis

Verwenden Sie Databricks Connect zum Debuggen von Code oder Notebooks direkt in Visual Studio Code. Siehe Debug-Code mit Databricks Connect für die Databricks IDE-Erweiterung und Run and Debug Notebook Cells with Databricks Connect mit der Databricks IDE-Erweiterung.

Ausführen einer Python-Datei auf einem Cluster

Hinweis

Dieses Feature ist nicht verfügbar, wenn serverlose Berechnungen verwendet werden.

Um eine Python-Datei auf einem Azure Databricks-Cluster mit der Databricks-IDE-Erweiterung auszuführen, wobei die Erweiterung und dein Projekt geöffnet sind:

  1. Öffnen Sie die Python-Datei, die Sie im Cluster ausführen möchten.
  2. Führen Sie eines der folgenden Verfahren aus:
    • Klicken Sie in der Titelleiste des Datei-Editors auf das Symbol " Auf Databricks ausführen ", und klicken Sie dann auf "Datei hochladen" und "Datei ausführen".

      Hochladen und Ausführen einer Datei über das Symbol

    • Klicken Sie in der Ansicht Explorer (Ansicht > Explorer) mit der rechten Maustaste auf die Datei und wählen Sie dann im Kontextmenü Datei in Databricks ausführen>Datei hochladen und ausführen aus.

      Hochladen und Ausführen einer Datei über das Kontextmenü

Die Datei wird im Cluster ausgeführt, und die Ausgabe ist in der Debugging-Konsole (Ansicht > Debugging-Konsole) verfügbar.

Führen Sie eine Python-Datei als Aufgabe aus

Um eine Python-Datei als Azure Databricks-Job mit der Databricks-IDE-Erweiterung auszuführen, wobei die Erweiterung und dein Projekt geöffnet sind:

  1. Öffnen Sie die Python-Datei, die Sie als Auftrag ausführen möchten.
  2. Führen Sie eines der folgenden Verfahren aus:
    • Klicken Sie in der Titelleiste des Datei-Editors auf das Symbol Auf Databricks ausführen und dann auf „Datei als Workflow ausführen“.

      Ausführen einer Datei als Workflow über das Symbol

    • Klicken Sie in der Ansicht Explorer (Ansicht > Explorer) mit der rechten Maustaste auf die Datei und wählen Sie dann im Kontextmenü In Databricks ausführen>Datei als Workflow ausführen aus.

      Ausführen einer Datei als Workflow über das Kontextmenü

Eine neue Editor-Registerkarte mit dem Titel Databricks-Auftragsausführung wird angezeigt. Die Datei wird als Aufgabe im Arbeitsbereich ausgeführt, und jede Ausgabe wird im Ausgabe-Bereich der neuen Editorregisterkarte angezeigt.

Um Informationen zur Ausführung des Jobs anzuzeigen, klicken Sie auf den Link "Taskausführungs-ID" in der neuen Registerkarte "Databricks Jobausführungs-Editor". Ihr Arbeitsbereich wird geöffnet und die Details der Jobausführung werden im Arbeitsbereich angezeigt.

Ein Python-, R-, Scala- oder SQL-Notebook als Job ausführen

Um ein Notizbuch als Azure Databricks-Job mit der Databricks-IDE-Erweiterung auszuführen, wobei die Erweiterung und Ihr Projekt geöffnet sind:

  1. Öffnen Sie das Notebook, das Sie als Auftrag ausführen möchten.

    Tipp

    Um eine Python-, R-, Scala- oder SQL-Datei in ein Azure Databricks-Notebook umzuwandeln, fügen Sie den Kommentar # Databricks notebook source am Anfang der Datei und den Kommentar # COMMAND ---------- vor jeder Zelle hinzu. Weitere Informationen finden Sie unter Konvertieren einer Datei in ein Notizbuch.

    Eine als Databricks-Notebook formatierte Python-Codedatei1

  2. Führen Sie eines der folgenden Verfahren aus:

    • Klicken Sie in der Titelleiste des Notizbuchdatei-Editors auf das Symbol "Auf Databricks ausführen" und dann auf "Datei als Workflow ausführen".

      Hinweis

      Wenn In Databricks als Workflow ausführen nicht verfügbar ist, finden Sie weitere Informationen unter Erstellen einer benutzerdefinierten Ausführungskonfiguration.

    • Klicken Sie in der Ansicht Explorer (Ansicht > Explorer) mit der rechten Maustaste auf die Notebookdatei und wählen Sie dann im Kontextmenü In Databricks ausführen>Datei als Workflow ausführen aus.

Eine neue Editor-Registerkarte mit dem Titel Databricks-Auftragsausführung wird angezeigt. Das Notebook wird im Arbeitsbereich als Job ausgeführt. Das Notizbuch und seine Ausgabe werden im Ausgabebereich des neuen Editor-Tabs angezeigt.

Zum Anzeigen von Informationen zum Jobdurchlauf klicken Sie auf der Registerkarte Databricks-Auftragseditor auf den Link Task-Ausführungs-ID. Ihr Arbeitsbereich wird geöffnet, und die Details des Jobdurchlaufs werden im Arbeitsbereich angezeigt.

Erstellen einer benutzerdefinierten Ausführungskonfiguration

Eine benutzerdefinierte Run-Konfiguration für die IDE-Erweiterung Databricks erlaubt es, benutzerdefinierte Argumente an einen Job oder ein Notizbuch zu senden oder verschiedene Run-Einstellungen für verschiedene Dateien zu erstellen. Weitere Informationen finden Sie unter Starten von Konfigurationen in der Visual Studio Code-Dokumentation.

Klicken Sie zum Erstellen einer benutzerdefinierten Ausführungskonfiguration im Hauptmenü in Visual Studio Code auf Ausführen > Konfiguration hinzufügen. Wählen Sie dann Databricks für eine clusterbasierte Ausführungskonfiguration oder Databricks: Workflow für eine auftragsbasierte Ausführungskonfiguration aus.

Die folgende benutzerdefinierte Ausführungskonfiguration ändert z. B. den Startbefehl Datei als Workflow ausführen so, dass das Argument --prod an den Auftrag übergeben wird:

{
  "version": "0.2.0",
  "configurations": [
    {
      "type": "databricks-workflow",
      "request": "launch",
      "name": "Run on Databricks as Workflow",
      "program": "${file}",
      "parameters": {},
      "args": ["--prod"]
    }
  ]
}

Tipp

Fügen Sie "databricks": true Ihrer "type": "python" Konfiguration hinzu, wenn Sie die Python-Konfiguration verwenden möchten, und nutzen Sie die Databricks Connect-Authentifizierung, die Teil des Erweiterungssetups ist.