Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Nb bölmelerini kullanarak sayısal 'sütun' üzerindeki histogramı hesaplar. Dönüş değeri, histogramın bölmelerinin merkezlerini temsil eden bir (x,y) çift dizisidir. 'nb' değeri arttıkça histogram yaklaşık değeri daha ayrıntılı hale gelir, ancak aykırı değerler çevresinde yapıtlar üretebilir. Uygulamada, 20-40 histogram bölmeleri düzgün çalışıyor gibi görünür ve çarpık veya daha küçük veri kümeleri için daha fazla bölme gerekir. Bu işlevin tekdüzen olmayan bölme genişliklerine sahip bir histogram oluşturduğunu unutmayın. Histogramın ortalama kare hatası açısından hiçbir garanti vermese de pratikte R/S-Plus istatistiksel bilgi işlem paketleri tarafından üretilen histogramlarla karşılaştırılabilir. Not: Dönüş değerindeki 'x' alanının çıkış türü, toplama işlevinde kullanılan giriş değerinden yayılır.
Sözdizimi
from pyspark.sql import functions as sf
sf.histogram_numeric(col, nBins)
Parametreler
| Parametre | Türü | Description |
|---|---|---|
col |
pyspark.sql.Column veya str |
Üzerinde çalışacak hedef sütun. |
nBins |
pyspark.sql.Column |
Histogram sütunlarının sayısı. |
İade
pyspark.sql.Column: nb bins kullanan sayısal 'sütun' üzerindeki histogram.
Örnekler
Örnek 1: 5 bölmeli işlem histogramı
from pyspark.sql import functions as sf
df = spark.range(100, numPartitions=1)
df.select(sf.histogram_numeric('id', sf.lit(5))).show(truncate=False)
+-----------------------------------------------------------+
|histogram_numeric(id, 5) |
+-----------------------------------------------------------+
|[{11, 25.0}, {36, 24.0}, {59, 23.0}, {84, 25.0}, {98, 3.0}]|
+-----------------------------------------------------------+