Tutorial: Führe Python auf einem Cluster und als Job mit der Databricks IDE-Erweiterung aus

Dieses Tutorial führt Sie durch die Einrichtung der Databricks-IDE-Erweiterung und führt Sie dann Python auf einem Azure Databricks-Cluster und als Azure Databricks-Job in Ihrem entfernten Arbeitsbereich aus. Siehe die IDE-Erweiterung Databricks.

Anforderungen

Für dieses Tutorial ist Folgendes erforderlich:

  • Sie haben die IDE-Erweiterung Databricks installiert. Siehe Install the Databricks IDE-Erweiterung.
  • Sie verfügen über einen Remote-Azure Databricks-Cluster zur Nutzung. Notieren Sie sich den Namen des Clusters. Klicken Sie zum Anzeigen der verfügbaren Cluster in der Azure Databricks Arbeitsbereich-Randleiste auf Compute. Siehe Compute.

Schritt 1: Erstellen eines neuen Databricks-Projekts

In diesem Schritt erstellen Sie ein neues Databricks-Projekt und konfigurieren die Verbindung mit Ihrem Remote-Azure Databricks Arbeitsbereich.

  1. Starten Sie Visual Studio Code, klicken Sie dann auf File > Open Folder und öffnen Sie einen leeren Ordner auf Ihrem lokalen Entwicklungscomputer.
  2. Klicken Sie in der Randleiste auf das Databricks-Logosymbol. Dadurch wird die Databricks-Erweiterung geöffnet.
  3. Klicken Sie in der Ansicht Konfiguration auf Konfiguration erstellen.
  4. Die Befehlspalette zum Konfigurieren des Databricks-Arbeitsbereichs wird geöffnet. Geben Sie für Databricks-Host Ihre arbeitsbereichsspezifische URL ein oder wählen Sie sie aus, z. B. https://adb-1234567890123456.7.azuredatabricks.net.
  5. Wählen Sie ein Authentifizierungsprofil für das Projekt aus. Siehe Einrichten der Autorisierung für die Databricks IDE-Erweiterung.

Schritt 2: Hinzufügen von Clusterinformationen zur Databricks-Erweiterung und Starten des Clusters

  1. Klicken Sie bei bereits geöffneter Ansicht Konfiguration auf Cluster auswählen oder auf das Zahnradsymbol (Cluster konfigurieren).

    Konfigurieren des Clusters

  2. Wählen Sie in der Befehlspalette den Namen des zuvor erstellten Clusters aus.

  3. Klicken Sie auf das Wiedergabesymbol (Cluster starten), wenn es noch nicht gestartet ist.

Schritt 3: Erstellen und Ausführen von Python Code

  1. Erstellen Sie eine lokale Python Codedatei: Klicken Sie auf der Randleiste auf das Ordnersymbol (Explorer).

  2. Klicken Sie im Hauptmenü auf Datei > Neue Datei und wählen Sie eine Python Datei aus. Benennen Sie die Datei demo.py , und speichern Sie sie im Stammverzeichnis des Projekts.

  3. Fügen Sie der Datei den folgenden Code hinzu, und speichern Sie sie. Dieser Code erstellt und zeigt den Inhalt eines einfachen PySpark-DataFrames an:

    from pyspark.sql import SparkSession
    from pyspark.sql.types import *
    
    spark = SparkSession.builder.getOrCreate()
    
    schema = StructType([
       StructField('CustomerID', IntegerType(), False),
       StructField('FirstName',  StringType(),  False),
       StructField('LastName',   StringType(),  False)
    ])
    
    data = [
       [ 1000, 'Mathijs', 'Oosterhout-Rijntjes' ],
       [ 1001, 'Joost',   'van Brunswijk' ],
       [ 1002, 'Stan',    'Bokenkamp' ]
    ]
    
    customers = spark.createDataFrame(data, schema)
    customers.show()
    
    # +----------+---------+-------------------+
    # |CustomerID|FirstName|           LastName|
    # +----------+---------+-------------------+
    # |      1000|  Mathijs|Oosterhout-Rijntjes|
    # |      1001|    Joost|      van Brunswijk|
    # |      1002|     Stan|          Bokenkamp|
    # +----------+---------+-------------------+
    
  4. Klicken Sie auf das Symbol In Databricks ausführen neben der Liste der Editor-Registerkarten und dann auf Datei hochladen und ausführen. Die Ausgabe wird in der Ansicht Debugging-Konsole angezeigt.

    Hochladen und Ausführen einer Datei über das Symbol

    Alternativ dazu können Sie in der Ansicht Explorer mit der rechten Maustaste auf die Datei demo.py und dann auf In Databricks ausführen>Datei hochladen und ausführen klicken.

    Hochladen und Ausführen einer Datei über das Kontextmenü

Schritt 4: Ausführen des Codes als Auftrag

Klicken Sie zum Ausführen von demo.py als Auftrag neben der Liste der Editorregisterkarten auf das Symbol In Databricks ausführen und dann auf Datei als Workflow ausführen. Die Ausgabe wird auf einer separaten Editor-Tab neben dem demo.py Dateieditor angezeigt.

Ausführen einer Datei als Workflow über das Symbol

Alternativ dazu können Sie mit der rechten Maustaste auf die Datei im demo.py-Bereich klicken und dann Auf Databricks ausführen> auswählen.

Ausführen einer Datei als Workflow über das Kontextmenü

Nächste Schritte

Nachdem Sie nun erfolgreich die IDE-Erweiterung Databricks genutzt haben, um eine lokale Python-Datei hochzuladen und aus der Ferne auszuführen, können Sie außerdem: