sum_distinct

Toplama işlevi: ifadedeki ayrı değerlerin toplamını döndürür.

Sözdizimi

from pyspark.sql import functions as sf

sf.sum_distinct(col)

Parametreler

Parametre Türü Description
col pyspark.sql.Column veya str Hesap için hedef sütun.

İade

pyspark.sql.Column: hesaplanan sonuçlar için sütun.

Örnekler

Örnek 1: Sum_distinct işlevini tüm benzersiz değerlere sahip bir sütunda kullanma

from pyspark.sql import functions as sf
df = spark.createDataFrame([(1,), (2,), (3,), (4,)], ["numbers"])
df.select(sf.sum_distinct('numbers')).show()
+---------------------+
|sum(DISTINCT numbers)|
+---------------------+
|                   10|
+---------------------+

Örnek 2: Sum_distinct işlevini ayrı değer içermeyen bir sütunda kullanma

from pyspark.sql import functions as sf
df = spark.createDataFrame([(1,), (1,), (1,), (1,)], ["numbers"])
df.select(sf.sum_distinct('numbers')).show()
+---------------------+
|sum(DISTINCT numbers)|
+---------------------+
|                    1|
+---------------------+

Örnek 3: Null ve yinelenen değerler içeren bir sütunda sum_distinct işlevi kullanma

from pyspark.sql import functions as sf
df = spark.createDataFrame([(None,), (1,), (1,), (2,)], ["numbers"])
df.select(sf.sum_distinct('numbers')).show()
+---------------------+
|sum(DISTINCT numbers)|
+---------------------+
|                    3|
+---------------------+