Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Çıkışı verilen sütunlara göre kümeler. Kümeleme sütunlarında benzer değerlere sahip kayıtlar aynı dosyada birlikte gruplandırılır. Kümeleme, kümeleme sütunlarında koşula sahip sorguların gereksiz verileri atlamasına izin vererek sorgu verimliliğini artırır. Bölümlemeden farklı olarak, kümeleme yüksek kardinaliteli sütunlarda kullanılabilir.
Sözdizimi
clusterBy(*cols)
Parametreler
| Parametre | Türü | Açıklama |
|---|---|---|
*cols |
str veya list | Kümelenecek sütunların adları. |
İadeler
DataStreamWriter
Örnekler
df = spark.readStream.format("rate").load()
df.writeStream.clusterBy("value")
# <...streaming.readwriter.DataStreamWriter object ...>
Zaman damgasına göre Bir Hız kaynağı akışı kümeleyin ve Parquet'e yazın:
import tempfile
import time
with tempfile.TemporaryDirectory(prefix="clusterBy1") as d:
with tempfile.TemporaryDirectory(prefix="clusterBy2") as cp:
df = spark.readStream.format("rate").option("rowsPerSecond", 10).load()
q = df.writeStream.clusterBy(
"timestamp").format("parquet").option("checkpointLocation", cp).start(d)
time.sleep(5)
q.stop()
spark.read.schema(df.schema).parquet(d).show()