histogram_numeric

Nb bölmelerini kullanarak sayısal 'sütun' üzerindeki histogramı hesaplar. Dönüş değeri, histogramın bölmelerinin merkezlerini temsil eden bir (x,y) çift dizisidir. 'nb' değeri arttıkça histogram yaklaşık değeri daha ayrıntılı hale gelir, ancak aykırı değerler çevresinde yapıtlar üretebilir. Uygulamada, 20-40 histogram bölmeleri düzgün çalışıyor gibi görünür ve çarpık veya daha küçük veri kümeleri için daha fazla bölme gerekir. Bu işlevin tekdüzen olmayan bölme genişliklerine sahip bir histogram oluşturduğunu unutmayın. Histogramın ortalama kare hatası açısından hiçbir garanti vermese de pratikte R/S-Plus istatistiksel bilgi işlem paketleri tarafından üretilen histogramlarla karşılaştırılabilir. Not: Dönüş değerindeki 'x' alanının çıkış türü, toplama işlevinde kullanılan giriş değerinden yayılır.

Sözdizimi

from pyspark.sql import functions as sf

sf.histogram_numeric(col, nBins)

Parametreler

Parametre Türü Description
col pyspark.sql.Column veya str Üzerinde çalışacak hedef sütun.
nBins pyspark.sql.Column Histogram sütunlarının sayısı.

İade

pyspark.sql.Column: nb bins kullanan sayısal 'sütun' üzerindeki histogram.

Örnekler

Örnek 1: 5 bölmeli işlem histogramı

from pyspark.sql import functions as sf
df = spark.range(100, numPartitions=1)
df.select(sf.histogram_numeric('id', sf.lit(5))).show(truncate=False)
+-----------------------------------------------------------+
|histogram_numeric(id, 5)                                   |
+-----------------------------------------------------------+
|[{11, 25.0}, {36, 24.0}, {59, 23.0}, {84, 25.0}, {98, 3.0}]|
+-----------------------------------------------------------+