Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
DataFrame Vytvoří ze RDDseznamu, seznamu, pandas.DataFramea numpy.ndarray, nebo pyarrow.Tablez .
Syntaxe
createDataFrame(data, schema=None, samplingRatio=None, verifySchema=True)
Parametry
| Parameter | Typ | Description |
|---|---|---|
data |
RdD nebo iterable | Sada RDD jakéhokoli druhu reprezentace dat SQL (, , , , atd.) nebo , Row, tupleintnebo .booldictlistpandas.DataFramenumpy.ndarraypyarrow.Table |
schema |
Datový typ, str nebo seznam, volitelné | A DataType, řetězec datového typu nebo seznam názvů sloupců. Pokud je zadán seznam názvů sloupců, typ každého sloupce je odvozen z data. Pokud Noneje schéma odvozeno z data (vyžaduje Row, namedtuplenebo dict). Pokud je zadaný řetězec datového DataType typu, musí se shodovat se skutečnými daty. |
samplingRatio |
float, volitelné | Poměr vzorků řádků používaných pro odvozování schématu, pokud data je argumentem RDD. Pokud Nonese použije prvních několik řádků. |
verifySchema |
bool, volitelné | Ověřte datové typy každého řádku ve schématu. Ve výchozím nastavení povolena. Nepodporuje se při převodu knihovny pandas se vstupem pyarrow.Table nebo povolenou šipkou. |
Návraty
DataFrame
Poznámky
Použití s spark.sql.execution.arrow.pyspark.enabled=True je experimentální.
Příklady
# Create a DataFrame from a list of tuples.
spark.createDataFrame([('Alice', 1)]).show()
# +-----+---+
# | _1| _2|
# +-----+---+
# |Alice| 1|
# +-----+---+
# Create a DataFrame from a list of dictionaries.
spark.createDataFrame([{'name': 'Alice', 'age': 1}]).show()
# +---+-----+
# |age| name|
# +---+-----+
# | 1|Alice|
# +---+-----+
# Create a DataFrame with column names specified.
spark.createDataFrame([('Alice', 1)], ['name', 'age']).show()
# +-----+---+
# | name|age|
# +-----+---+
# |Alice| 1|
# +-----+---+
# Create a DataFrame with an explicit schema.
from pyspark.sql.types import StructType, StructField, StringType, IntegerType
schema = StructType([
StructField("name", StringType(), True),
StructField("age", IntegerType(), True)])
spark.createDataFrame([('Alice', 1)], schema).show()
# +-----+---+
# | name|age|
# +-----+---+
# |Alice| 1|
# +-----+---+
# Create a DataFrame with a DDL-formatted schema string.
spark.createDataFrame([('Alice', 1)], "name: string, age: int").show()
# +-----+---+
# | name|age|
# +-----+---+
# |Alice| 1|
# +-----+---+
# Create an empty DataFrame (schema is required when data is empty).
spark.createDataFrame([], "name: string, age: int").show()
# +----+---+
# |name|age|
# +----+---+
# +----+---+
# Create a DataFrame from Row objects.
from pyspark.sql import Row
Person = Row('name', 'age')
spark.createDataFrame([Person("Alice", 1)]).show()
# +-----+---+
# | name|age|
# +-----+---+
# |Alice| 1|
# +-----+---+