Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Набор методов для агрегирования в кадре данных, созданного с помощью DataFrame.groupBy.
Поддержка Spark Connect
Синтаксис
DataFrame.groupBy(*cols)
Методы
| Метод | Описание |
|---|---|
agg(*exprs) |
Вычисляет агрегаты и возвращает результат в виде кадра данных. Принимает имена столбцов сопоставления словаря с агрегированными именами функций или список статистических выражений столбцов. |
avg(*cols) |
Вычисляет средние значения для каждого числового столбца для каждой группы.
mean — это псевдоним. |
count() |
Подсчитывает количество записей для каждой группы. |
max(*cols) |
Вычисляет максимальное значение для каждого числового столбца для каждой группы. |
mean(*cols) |
Вычисляет средние значения для каждого числового столбца для каждой группы.
avg — это псевдоним. |
min(*cols) |
Вычисляет минимальное значение для каждого числового столбца для каждой группы. |
pivot(pivot_col, values) |
Сводка столбца текущего кадра данных и выполняет указанную агрегатную обработку. |
sum(*cols) |
Вычисляет сумму для каждого числового столбца для каждой группы. |
Примеры
df = spark.createDataFrame(
[(2, "Alice"), (3, "Alice"), (5, "Bob"), (10, "Bob")], ["age", "name"])
df.groupBy("name").count().sort("name").show()
+-----+-----+
| name|count|
+-----+-----+
|Alice| 2|
| Bob| 2|
+-----+-----+
from pyspark.sql import functions as sf
df.groupBy("name").agg(sf.min("age")).sort("name").show()
+-----+--------+
| name|min(age)|
+-----+--------+
|Alice| 2|
| Bob| 5|
+-----+--------+
df.groupBy("name").avg("age").sort("name").show()
+-----+--------+
| name|avg(age)|
+-----+--------+
|Alice| 2.5|
| Bob| 7.5|
+-----+--------+
from pyspark.sql import Row
df1 = spark.createDataFrame([
Row(course="dotNET", year=2012, earnings=10000),
Row(course="Java", year=2012, earnings=20000),
Row(course="dotNET", year=2013, earnings=48000),
Row(course="Java", year=2013, earnings=30000),
])
df1.groupBy("year").pivot("course", ["dotNET", "Java"]).sum("earnings").sort("year").show()
+----+------+-----+
|year|dotNET| Java|
+----+------+-----+
|2012| 10000|20000|
|2013| 48000|30000|
+----+------+-----+