Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
Az Apache Spark az Azure Databricks Data + AI Platform középpontjában áll, és ez a technológia, amely a számítási klasztereket és SQL raktárakat működteti. Az Azure Databricks az Apache Sparkhoz optimalizált platform, amely hatékony és egyszerű platformot biztosít az Apache Spark számítási feladatainak futtatásához.
Mi az Apache Spark és az Azure Databricks kapcsolata?
A Databricks vállalatot az Apache Spark eredeti létrehozói alapították. Nyílt forráskódú szoftverprojektként az Apache Spark számos vezető vállalatból, köztük a Databricksből származó véglegesítőkkel rendelkezik.
A Databricks továbbra is fejleszt és bocsát ki funkciókat az Apache Sparkban. Az Azure Databrickset használó Databricks Runtime további optimalizálásokat és saját fejlesztésű funkciókat tartalmaz, amelyek az Apache Sparkra építenek és kiterjesztik azt, beleértve a Photont is, amely a Sparkkal együtt használható optimalizált végrehajtási réteg. A Databricks Photon az Apache Spark számítási feladatainak kezeléséhez és teljesítményének javításához készült. A Photon a lekérdezések és egyéb műveletek vektorizálásával javítja a Spark teljesítményét, lehetővé téve az SQL- és DataFrame API-műveletek gyorsabb végrehajtását.
Hogyan van optimalizálva a Databricks az Apache Sparkhoz?
Az Apache Sparkban minden művelet átalakításként vagy műveletként van definiálva.
- Átalakítások: adjon hozzá némi feldolgozási logikát a tervhez. Ilyenek például az adatok olvasása, az illesztések, az összesítések és a beírás.
- Műveletek: aktiválják a feldolgozási logikát az eredmény kiértékelésére és létrehozására. Ilyen például az írás, az eredmények megjelenítése vagy előnézete, a manuális gyorsítótárazás vagy a sorok számának lekérése.
Az Apache Spark egy lusta végrehajtási modellt használ, ami azt jelenti, hogy a műveletgyűjtemény által definiált logika egyikét sem értékeli ki a rendszer, amíg egy művelet el nem indul. A logika szükségtelen kiértékelésének elkerülése érdekében csak műveletekkel mentse az eredményeket egy céltáblába.
Mivel a műveletek feldolgozási szűk keresztmetszetet jelentenek a logika optimalizálásához, az Azure Databricks számos optimalizálással bővítette az Apache Sparkban már meglévőket az optimális logikai végrehajtás biztosítása érdekében. Ezek az optimalizálások egyszerre veszik figyelembe az adott művelet által aktivált összes átalakítást, és az adatok fizikai elrendezése alapján megtalálják az optimális tervet. Az adatok manuális gyorsítótárazása vagy az előzetes eredmények produkciós folyamatokban való használata megszakíthatja ezeket az optimalizálásokat, és növelheti a költségeket valamint a késést.
Hogyan működik az Apache Spark az Azure Databricksben?
Amikor számítási fürtöt vagy SQL Warehouse-t helyez üzembe az Azure Databricksben, az Apache Spark konfigurálva van és üzembe helyezve a virtuális gépeken. Nem kell Spark-környezetet vagy Spark-munkamenetet konfigurálnia vagy inicializálnia, mivel ezeket az Azure Databricks felügyeli.
Használhatom az Azure Databrickset az Apache Spark használata nélkül?
Igen. Az Azure Databricks számos számítási feladatot támogat, és nyílt forráskódú kódtárakat is tartalmaz a Databricks Runtime-ban. A Databricks SQL Photon technológiát használ a háttérben, de a végfelhasználók Spark SQL-szintaxissal hozhatnak létre és lekérhetnek adatbázis-objektumokat a Photon segítségével.
A Databricks Runtime for Machine Learning az ML számítási feladatokhoz van optimalizálva, és számos adattudós elsődleges nyílt forráskódú kódtárakat használ, például a TensorFlow-t és a SciKit Learn-t az Azure Databricks használata során. Feladatok használatával tetszőleges számítási feladatokat ütemezhet az Azure Databricks által üzembe helyezett és felügyelt számítási erőforrásokhoz.
Miért érdemes az Apache Sparkot használni az Azure Databricksben?
A Databricks platform biztonságos, együttműködésen alapuló környezetet biztosít a vállalatával skálázható vállalati megoldások fejlesztéséhez és üzembe helyezéséhez. A Databricks alkalmazottai közé tartoznak a világ legismeretesebb Apache Spark-karbantartói és felhasználói. A vállalat folyamatosan fejleszt és bocsát ki új optimalizálásokat, hogy a felhasználók elérhessék a leggyorsabb környezetet az Apache Spark futtatásához.
Hogyan tudhatok meg többet az Apache Spark Azure Databricksen való használatáról?
Kezdje el az Apache Spark az Azure Databricksben való használatát, és merüljön bele azonnal! Az Apache Spark DataFrames oktatóanyaga végigvezeti az adatok Pythonban, R-ben vagy Scalában történő betöltésén és átalakításán. Lásd az oktatóanyagot: Adatok betöltése és átalakítása Apache Spark DataFrame-ekkel. További információkért tekintse meg az Apache Sparkot az Azure Databricksben.
További információ a Python, az R és a Scala sparkos nyelvi támogatásáról: PySpark on Azure Databricks, Sparklyr és Azure Databricks for Scala developers, valamint reference for Apache Spark API-k.