Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
Ez az oktatóanyag bemutatja, hogy egy Azure Databricks-jegyzetfüzet használatával lekérdezheti a Unity Catalogban tárolt mintaadatokat az SQL, a Python, a Scala és az R használatával, majd megjelenítheti a lekérdezés eredményeit a jegyzetfüzetben.
Jótanács
Mondja meg a Genie Code-nak (ügynök módnak), hogy tegye ezt Önért:
Create a new notebook that queries @samples.nyctaxi.trips and displays a bar chart showing the average fare amount by trip distance, grouped by the pickup zip code.
Követelmények
A cikkben szereplő feladatok elvégzéséhez meg kell felelnie a következő követelményeknek:
- A munkaterületen engedélyezve kell lennie a Unity-katalógusnak . A Unity Catalog használatának első lépéseiről további információt a Unity Catalog használatának első lépéseit ismertető cikkben talál.
- Rendelkeznie kell engedéllyel egy meglévő számítási erőforrás használatához vagy egy új számítási erőforrás létrehozásához. Lásd a Compute-ot, vagy forduljon a Databricks rendszergazdájához.
1. lépés: Új jegyzetfüzet létrehozása
Ha jegyzetfüzetet szeretne létrehozni a munkaterületen, kattintson
az Oldalsáv Új gombjára, majd a Jegyzetfüzet elemre. Megnyílik egy üres jegyzetfüzet a munkaterületen.
A jegyzetfüzetek létrehozásáról és kezeléséről további információt a Databricks-jegyzetfüzetek kezelése című témakörben talál.
2. lépés: Tábla lekérdezése
samples.nyctaxi.trips A Unity Catalogban a kívánt nyelv használatával kérdezheti le a táblát. Ez a táblázat a katalógusban szereplő samples egyike.
Másolja és illessze be a következő kódot az új üres jegyzetfüzetcellába. Ez a kód megjeleníti a táblának a
samples.nyctaxi.tripsUnity Katalógusban való lekérdezéséből származó eredményeket.SQL
SELECT * FROM samples.nyctaxi.tripsPython
display(spark.read.table("samples.nyctaxi.trips"))Scala
display(spark.read.table("samples.nyctaxi.trips"))R
library(SparkR) display(sql("SELECT * FROM samples.nyctaxi.trips"))Nyomja le a
Shift+Entergombot a cella futtatásához, majd lépjen a következő cellára.A lekérdezés eredményei megjelennek a jegyzetfüzetben.
3. lépés: Az adatok megjelenítése
Jelenítse meg az átlagos viteldíj összegét az utazási távolság szerint, a felvétel irányítószáma alapján csoportosítva.
Kattintson a Táblázat lap mellett a +Vizualizáció elemre.
Megjelenik a vizualizációszerkesztő.
A Vizualizáció típusa legördülő listában ellenőrizze, hogy a sáv ki van-e jelölve.
Válassza ki
fare_amountaz X oszlopot.Válassza ki
trip_distanceaz Y oszlopot.Válassza ki
Averageaz összesítés típusát.Válassza ki
pickup_zipa Csoportosítás oszlop szerint lehetőséget.
Kattintson a Mentésre.
Következő lépések
- A CSV-fájlból a Unity Cataloghoz való adatok hozzáadásáról és az adatok vizualizációjáról a következő oktatóanyagban tájékozódhat: CSV-adatok importálása és vizualizációja jegyzetfüzetből.
- Ha tudni szeretné, hogyan tölthet be adatokat a Databricksbe az Apache Spark használatával, tekintse meg a következő oktatóanyagot: Adatok betöltése és átalakítása Apache Spark DataFrame-ekkel.
- Ha többet szeretne megtudni az adatok Databricksbe való betöltéséről, tekintse meg a Lakeflow Connect standard összekötőit.
- Ha többet szeretne megtudni az adatok Databricks-lel való lekérdezéséről, olvassa el az Adatok lekérdezése című témakört.
- A vizualizációkkal kapcsolatos további információkért tekintse meg a Databricks-jegyzetfüzetekben és az SQL-szerkesztőben található vizualizációkat.
- A feltáró adatelemzési (EDA-) technikákkal kapcsolatos további információkért lásd a Databricks-jegyzetfüzetekben lévő EDA-technikák oktatóanyagát.