karıştırmak

Verilen dizi için rastgele permütasyon oluşturur. Karıştırma işlevi belirlenemez, yani çıkış dizisinin sırası her yürütme için farklı olabilir.

Sözdizimi

from pyspark.sql import functions as sf

sf.shuffle(col, seed=None)

Parametreler

Parametre Türü Description
col pyspark.sql.Column veya str Karıştırılacak sütunun veya ifadenin adı.
seed pyspark.sql.Column veya int, isteğe bağlı Rastgele oluşturucu için tohum değeri. Databricks Runtime 16.1'e eklendi

İade

pyspark.sql.Column: Rastgele sırada bir öğe dizisi içeren yeni bir sütun.

Örnekler

Örnek 1: Basit bir diziyi karıştırma

import pyspark.sql.functions as sf
df = spark.sql("SELECT ARRAY(1, 20, 3, 5) AS data")
df.select("*", sf.shuffle(df.data, sf.lit(123))).show()
+-------------+-------------+
|         data|shuffle(data)|
+-------------+-------------+
|[1, 20, 3, 5]|[5, 1, 20, 3]|
+-------------+-------------+

Örnek 2: Bir diziyi null değerlerle karıştırma

import pyspark.sql.functions as sf
df = spark.sql("SELECT ARRAY(1, 20, NULL, 5) AS data")
df.select("*", sf.shuffle(sf.col("data"), 234)).show()
+----------------+----------------+
|            data|   shuffle(data)|
+----------------+----------------+
|[1, 20, NULL, 5]|[NULL, 5, 20, 1]|
+----------------+----------------+

Örnek 3: Bir diziyi yinelenen değerlerle karıştırma

import pyspark.sql.functions as sf
df = spark.sql("SELECT ARRAY(1, 2, 2, 3, 3, 3) AS data")
df.select("*", sf.shuffle("data", 345)).show()
+------------------+------------------+
|              data|     shuffle(data)|
+------------------+------------------+
|[1, 2, 2, 3, 3, 3]|[2, 3, 3, 1, 2, 3]|
+------------------+------------------+