Databricks Connect

Feljegyzés

Ez a cikk a Databricks Runtime 13.3 LTS-hez készült Databricks Connectet ismerteti.

A Databricks Connect a Databricks Runtime ügyfélkönyvtára, amely lehetővé teszi, hogy csatlakozzon az Azure Databricks számítási erőforrásaihoz olyan fejlesztői környezetekből, mint a Visual Studio Code, a PyCharm és az IntelliJ IDEA, valamint notebookokból és bármely egyéni alkalmazásból, hogy új interaktív felhasználói élményeket biztosíthasson az Azure Databricks Lakehouse-on alapulva.

A Databricks Connect a következő nyelveken érhető el:

Mit csinálhatok a Databricks Connecttel?

A Databricks Connect használatával kódot írhat Spark API-kkal, és a helyi Spark-munkamenet helyett távolról futtathatja őket Azure Databricks számításon.

  • Interaktívan fejleszthet és hibakeresést végezhet bármely IDE-ből. A Databricks Connect lehetővé teszi a fejlesztők számára, hogy bármilyen IDE natív futtatási és hibakeresési funkcióival fejlesszék és javítsák a kódjukat a Databricks számítási teljesítményén. A Databricks Visual Studio Code bővítmény a Databricks Connect használatával biztosítja a felhasználói kód beépített hibakeresését a Databricksen.

  • Interaktív adatalkalmazások létrehozása. A JDBC-illesztőkhöz hasonlóan a Databricks Connect-kódtár bármely alkalmazásba beágyazható a Databricks használatához. A Databricks Connect a PySparkon keresztül biztosítja a Python teljes kifejezőképességét, kiküszöbölve az SQL programozási nyelv impedanciájának eltérését, és lehetővé teszi az összes adatátalakítás futtatását a Spark on Databricks kiszolgáló nélküli skálázható számítással.

Hogyan működik?

A Databricks Connect nyílt forráskódú Spark Connectre épül, amely egy leválasztott ügyfél-kiszolgáló architektúrával rendelkezik az Apache Sparkhoz, amely lehetővé teszi a Spark-fürtökhöz való távoli kapcsolatot a DataFrame API használatával. A mögöttes protokoll a Spark megoldatlan logikai terveit és az Apache Arrowt használja a gRPC fölé. Az ügyfél API úgy van tervezve, hogy vékony legyen, így mindenhol beágyazható: alkalmazáskiszolgálókba, fejlesztői környezetekbe, programozási jegyzetfüzetekbe és programozási nyelvekbe.

A Databricks Connect-kód futtatása

  • General-kód helyileg fut: a Python és a Scala-kód az ügyféloldalon fut, lehetővé téve az interaktív hibakeresést. Az összes kód helyileg lesz végrehajtva, míg az összes Spark-kód továbbra is fut a távoli fürtön.
  • A DataFrame API-k a Databricks-számításon lesznek végrehajtva. Az összes adatátalakítás Spark-tervekké alakul, és a Databricks-számításon fut a távoli Spark-munkameneten keresztül. Ezek a helyi kliensen valósulnak meg, amikor collect(), show() és toPandas() parancsokat használ.
  • Az UDF-kód a Databricks-számításon fut: a helyileg definiált UDF-ek szerializálva lesznek, és annak a fürtnek lesznek továbbítva, ahol fut. A Databricksen felhasználói kódot futtató API-k a következők: UDF-ek, foreachés foreachBatchtransformWithState.
  • Függőségek kezelése esetén:
    • Telepítse az alkalmazásfüggőségeket a helyi gépen. Ezek helyileg futnak, és a projekt részeként kell telepíteni, például a Python virtuális környezet részeként.
    • Telepítse az UDF-függőségeket a Databricksre. Lásd: UDF-függőségek kezelése.

A Spark Connect egy nyílt forráskódú gRPC-alapú protokoll az Apache Sparkban, amely lehetővé teszi a Spark-számítási feladatok távoli végrehajtását a DataFrame API használatával.

A Databricks Runtime 13.3 LTS-hez és újabb verziókhoz a Databricks Connect a Spark Connect bővítménye, amely kiegészítésekkel és módosításokkal támogatja a Databricks számítási módjainak és a Unity Catalognak a használatát.

További erőforrások

A Databricks Connect-megoldások gyors fejlesztésének megkezdéséhez tekintse meg az alábbi oktatóanyagokat:

A Databricks Connectet használó példaalkalmazások megtekintéséhez tekintse meg a GitHub példák adattárát, amely a következő példákat tartalmazza: