clusterBy (DataStreamWriter)

Çıkışı verilen sütunlara göre kümeler. Kümeleme sütunlarında benzer değerlere sahip kayıtlar aynı dosyada birlikte gruplandırılır. Kümeleme, kümeleme sütunlarında koşula sahip sorguların gereksiz verileri atlamasına izin vererek sorgu verimliliğini artırır. Bölümlemeden farklı olarak, kümeleme yüksek kardinaliteli sütunlarda kullanılabilir.

Sözdizimi

clusterBy(*cols)

Parametreler

Parametre Türü Açıklama
*cols str veya list Kümelenecek sütunların adları.

İadeler

DataStreamWriter

Örnekler

df = spark.readStream.format("rate").load()
df.writeStream.clusterBy("value")
# <...streaming.readwriter.DataStreamWriter object ...>

Zaman damgasına göre Bir Hız kaynağı akışı kümeleyin ve Parquet'e yazın:

import tempfile
import time
with tempfile.TemporaryDirectory(prefix="clusterBy1") as d:
    with tempfile.TemporaryDirectory(prefix="clusterBy2") as cp:
        df = spark.readStream.format("rate").option("rowsPerSecond", 10).load()
        q = df.writeStream.clusterBy(
            "timestamp").format("parquet").option("checkpointLocation", cp).start(d)
        time.sleep(5)
        q.stop()
        spark.read.schema(df.schema).parquet(d).show()