mode

Gruptaki en sık kullanılan değeri döndürür.

Sözdizimi

from pyspark.sql import functions as sf

sf.mode(col, deterministic=False)

Parametreler

Parametre Türü Description
col pyspark.sql.Column veya sütun adı Hesap için hedef sütun.
deterministic bool, isteğe bağlı Eşit sıklıkta birden çok sonuç varsa en düşük değeri döndürür (varsayılan değer false'tur).

İade

pyspark.sql.Column: bir gruptaki en sık kullanılan değerdir.

Örnekler

from pyspark.sql import functions as sf
df = spark.createDataFrame([
    ("Java", 2012, 20000), ("dotNET", 2012, 5000),
    ("Java", 2012, 20000), ("dotNET", 2012, 5000),
    ("dotNET", 2013, 48000), ("Java", 2013, 30000)],
    schema=("course", "year", "earnings"))
df.groupby("course").agg(sf.mode("year")).sort("course").show()
+------+----------+
|course|mode(year)|
+------+----------+
|  Java|      2012|
|dotNET|      2012|
+------+----------+

Birden çok değer aynı en büyük frekansa sahip olduğunda, deterministik yanlışsa veya tanımlanmamışsa değerlerden herhangi biri döndürülür veya belirleyici doğruysa en düşük değer döndürülür.

from pyspark.sql import functions as sf
df = spark.createDataFrame([(-10,), (0,), (10,)], ["col"])
df.select(sf.mode("col", True)).show()
+---------------------------------------+
|mode() WITHIN GROUP (ORDER BY col DESC)|
+---------------------------------------+
|                                    -10|
+---------------------------------------+