max

Bir gruptaki ifadenin en büyük değerini döndürür. Hesaplama sırasında null değerler yoksayılır. NaN değerleri diğer sayısal değerlerden daha büyüktür.

Sözdizimi

from pyspark.sql import functions as sf

sf.max(col)

Parametreler

Parametre Türü Description
col pyspark.sql.Column veya sütun adı En yüksek değerin hesaplandığı hedef sütun.

İade

pyspark.sql.Column: Hesaplanan en yüksek değeri içeren sütun.

Örnekler

Örnek 1: Sayısal sütunun en yüksek değerini hesaplama

import pyspark.sql.functions as sf
df = spark.range(10)
df.select(sf.max(df.id)).show()
+-------+
|max(id)|
+-------+
|      9|
+-------+

Örnek 2: Dize sütununun en büyük değerini hesaplama

import pyspark.sql.functions as sf
df = spark.createDataFrame([("A",), ("B",), ("C",)], ["value"])
df.select(sf.max(df.value)).show()
+----------+
|max(value)|
+----------+
|         C|
+----------+

Örnek 3: Gruplandırılmış DataFrame'de bir sütunun en yüksek değerini hesaplama

import pyspark.sql.functions as sf
df = spark.createDataFrame([("A", 1), ("A", 2), ("B", 3), ("B", 4)], ["key", "value"])
df.groupBy("key").agg(sf.max(df.value)).show()
+---+----------+
|key|max(value)|
+---+----------+
|  A|         2|
|  B|         4|
+---+----------+

Örnek 4: Gruplandırılmış DataFrame'de birden çok sütunun maksimum değerini hesaplama

import pyspark.sql.functions as sf
df = spark.createDataFrame(
    [("A", 1, 2), ("A", 2, 3), ("B", 3, 4), ("B", 4, 5)], ["key", "value1", "value2"])
df.groupBy("key").agg(sf.max("value1"), sf.max("value2")).show()
+---+-----------+-----------+
|key|max(value1)|max(value2)|
+---+-----------+-----------+
|  A|          2|          3|
|  B|          4|          5|
+---+-----------+-----------+

Örnek 5: Null değerleri olan bir sütunun en yüksek değerini hesaplama

import pyspark.sql.functions as sf
df = spark.createDataFrame([(1,), (2,), (None,)], ["value"])
df.select(sf.max(df.value)).show()
+----------+
|max(value)|
+----------+
|         2|
+----------+

Örnek 6: "NaN" değerlerine sahip bir sütunun en büyük değerini hesaplama

import pyspark.sql.functions as sf
df = spark.createDataFrame([(1.1,), (float("nan"),), (3.3,)], ["value"])
df.select(sf.max(df.value)).show()
+----------+
|max(value)|
+----------+
|       NaN|
+----------+