Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Vrátí nový datový rámec dělený danými výrazy dělení. Výsledný datový rámec je rozdělený podle identifikátoru sloupce.
Syntaxe
repartitionById(numPartitions: int, *cols: "ColumnOrName")
Parametry
| Parameter | Typ | Description |
|---|---|---|
numPartitions |
int (integer) | cílový počet oddílů. |
cols |
str nebo Column | dělení sloupců. |
Návraty
DataFrame: Repartitioned DataFrame.
Poznámky
Musí být zadán alespoň jeden výraz dělení podle oddílu. Podobá se rozdělení do rozdělení v rozdělení, ale zachovává pořadí řádků v rámci každého oddílu.
Toto je experimentální rozhraní API.
Příklady
from pyspark.sql import functions as sf
spark.createDataFrame(
[(14, "Tom"), (23, "Alice"), (16, "Bob"), (18, "Alice"), (21, "Alice")],
["age", "name"]
).repartitionById(2, "name").select(
"age", "name", sf.spark_partition_id()
).show()
# +---+-----+--------------------+
# |age| name|SPARK_PARTITION_ID()|
# +---+-----+--------------------+
# | 14| Tom| 0|
# | 23|Alice| 1|
# | 18|Alice| 1|
# | 21|Alice| 1|
# | 16| Bob| 0|
# +---+-----+--------------------+