createDataFrame

DataFrame Vytvoří ze RDDseznamu, seznamu, pandas.DataFramea numpy.ndarray, nebo pyarrow.Tablez .

Syntaxe

createDataFrame(data, schema=None, samplingRatio=None, verifySchema=True)

Parametry

Parameter Typ Description
data RdD nebo iterable Sada RDD jakéhokoli druhu reprezentace dat SQL (, , , , atd.) nebo , Row, tupleintnebo .booldictlistpandas.DataFramenumpy.ndarraypyarrow.Table
schema Datový typ, str nebo seznam, volitelné A DataType, řetězec datového typu nebo seznam názvů sloupců. Pokud je zadán seznam názvů sloupců, typ každého sloupce je odvozen z data. Pokud Noneje schéma odvozeno z data (vyžaduje Row, namedtuplenebo dict). Pokud je zadaný řetězec datového DataType typu, musí se shodovat se skutečnými daty.
samplingRatio float, volitelné Poměr vzorků řádků používaných pro odvozování schématu, pokud data je argumentem RDD. Pokud Nonese použije prvních několik řádků.
verifySchema bool, volitelné Ověřte datové typy každého řádku ve schématu. Ve výchozím nastavení povolena. Nepodporuje se při převodu knihovny pandas se vstupem pyarrow.Table nebo povolenou šipkou.

Návraty

DataFrame

Poznámky

Použití s spark.sql.execution.arrow.pyspark.enabled=True je experimentální.

Příklady

# Create a DataFrame from a list of tuples.
spark.createDataFrame([('Alice', 1)]).show()
# +-----+---+
# |   _1| _2|
# +-----+---+
# |Alice|  1|
# +-----+---+

# Create a DataFrame from a list of dictionaries.
spark.createDataFrame([{'name': 'Alice', 'age': 1}]).show()
# +---+-----+
# |age| name|
# +---+-----+
# |  1|Alice|
# +---+-----+

# Create a DataFrame with column names specified.
spark.createDataFrame([('Alice', 1)], ['name', 'age']).show()
# +-----+---+
# | name|age|
# +-----+---+
# |Alice|  1|
# +-----+---+

# Create a DataFrame with an explicit schema.
from pyspark.sql.types import StructType, StructField, StringType, IntegerType
schema = StructType([
    StructField("name", StringType(), True),
    StructField("age", IntegerType(), True)])
spark.createDataFrame([('Alice', 1)], schema).show()
# +-----+---+
# | name|age|
# +-----+---+
# |Alice|  1|
# +-----+---+

# Create a DataFrame with a DDL-formatted schema string.
spark.createDataFrame([('Alice', 1)], "name: string, age: int").show()
# +-----+---+
# | name|age|
# +-----+---+
# |Alice|  1|
# +-----+---+

# Create an empty DataFrame (schema is required when data is empty).
spark.createDataFrame([], "name: string, age: int").show()
# +----+---+
# |name|age|
# +----+---+
# +----+---+

# Create a DataFrame from Row objects.
from pyspark.sql import Row
Person = Row('name', 'age')
spark.createDataFrame([Person("Alice", 1)]).show()
# +-----+---+
# | name|age|
# +-----+---+
# |Alice|  1|
# +-----+---+