count_distinct

Farklı sütun veya sütun sayısı için yeni bir Sütun döndürür.

Sözdizimi

from pyspark.sql import functions as sf

sf.count_distinct(col, *cols)

Parametreler

Parametre Türü Description
col pyspark.sql.Column veya sütun adı İşlem yapılacak ilk sütun.
cols pyspark.sql.Column veya sütun adı Üzerinde işlem yapılan diğer sütunlar.

İade

pyspark.sql.Column: bu iki sütun değerinin benzersiz değerleri.

Örnekler

Örnek 1: Tek bir sütunun ayrı değerlerini sayma

from pyspark.sql import functions as sf
df = spark.createDataFrame([(1,), (1,), (3,)], ["value"])
df.select(sf.count_distinct(df.value)).show()
+---------------------+
|count(DISTINCT value)|
+---------------------+
|                    2|
+---------------------+

Örnek 2: Birden çok sütunun ayrı değerlerini sayma

from pyspark.sql import functions as sf
df = spark.createDataFrame([(1, 1), (1, 2)], ["value1", "value2"])
df.select(sf.count_distinct(df.value1, df.value2)).show()
+------------------------------+
|count(DISTINCT value1, value2)|
+------------------------------+
|                             2|
+------------------------------+

Örnek 3: Sütun adlarıyla ayrı değerleri dize olarak sayma

from pyspark.sql import functions as sf
df = spark.createDataFrame([(1, 1), (1, 2)], ["value1", "value2"])
df.select(sf.count_distinct("value1", "value2")).show()
+------------------------------+
|count(DISTINCT value1, value2)|
+------------------------------+
|                             2|
+------------------------------+