GroupedData

Tarafından DataFrame.groupByoluşturulan bir DataFrame'de toplamalar için bir yöntem kümesi.

Spark Connect'i destekler

Sözdizimi

DataFrame.groupBy(*cols)

Methods

Yöntem Açıklama
agg(*exprs) İşlemler, sonucu toplar ve Bir DataFrame olarak döndürür. İşlev adlarını toplamak için sözlük eşleme sütun adlarını veya sütun ifadelerini toplama listesini kabul eder.
avg(*cols) Her grup için her sayısal sütun için ortalama değerleri hesaplar. mean diğer addır.
count() Her grup için kayıt sayısını sayar.
max(*cols) Her grup için her sayısal sütun için en yüksek değeri hesaplar.
mean(*cols) Her grup için her sayısal sütun için ortalama değerleri hesaplar. avg diğer addır.
min(*cols) Her grup için her sayısal sütunun en küçük değerini hesaplar.
pivot(pivot_col, values) Geçerli DataFrame sütununu özetler ve belirtilen toplamayı gerçekleştirir.
sum(*cols) Her grup için her sayısal sütunun toplamını hesaplar.

Örnekler

df = spark.createDataFrame(
    [(2, "Alice"), (3, "Alice"), (5, "Bob"), (10, "Bob")], ["age", "name"])
df.groupBy("name").count().sort("name").show()
+-----+-----+
| name|count|
+-----+-----+
|Alice|    2|
|  Bob|    2|
+-----+-----+
from pyspark.sql import functions as sf

df.groupBy("name").agg(sf.min("age")).sort("name").show()
+-----+--------+
| name|min(age)|
+-----+--------+
|Alice|       2|
|  Bob|       5|
+-----+--------+
df.groupBy("name").avg("age").sort("name").show()
+-----+--------+
| name|avg(age)|
+-----+--------+
|Alice|     2.5|
|  Bob|     7.5|
+-----+--------+
from pyspark.sql import Row

df1 = spark.createDataFrame([
    Row(course="dotNET", year=2012, earnings=10000),
    Row(course="Java", year=2012, earnings=20000),
    Row(course="dotNET", year=2013, earnings=48000),
    Row(course="Java", year=2013, earnings=30000),
])
df1.groupBy("year").pivot("course", ["dotNET", "Java"]).sum("earnings").sort("year").show()
+----+------+-----+
|year|dotNET| Java|
+----+------+-----+
|2012| 10000|20000|
|2013| 48000|30000|
+----+------+-----+