schema_of_csv

CSV dizesini ayrıştırıp şemasını DDL biçiminde çıkartır.

Sözdizimi

from pyspark.sql import functions as sf

sf.schema_of_csv(csv, options=None)

Parametreler

Parametre Türü Description
csv pyspark.sql.Column veya str CSV dizesi veya CSV dizesi içeren katlanabilir dize sütunu.
options dict, isteğe bağlı Ayrıştırma denetimi seçenekleri. CSV veri kaynağıyla aynı seçenekleri kabul eder.

İade

pyspark.sql.Column: Verilen CSV'den ayrıştırılan bir StructType dize gösterimi.

Örnekler

Örnek 1: Farklı veri türlerine sahip bir CSV dizesinin şemasını çıkarsama

from pyspark.sql import functions as sf
df = spark.range(1)
df.select(sf.schema_of_csv(sf.lit('1|a|true'), {'sep':'|'})).show(truncate=False)
+-------------------------------------------+
|schema_of_csv(1|a|true)                    |
+-------------------------------------------+
|STRUCT<_c0: INT, _c1: STRING, _c2: BOOLEAN>|
+-------------------------------------------+

Örnek 2: Eksik değerlere sahip bir CSV dizesinin şemasını çıkarsama

from pyspark.sql import functions as sf
df = spark.range(1)
df.select(sf.schema_of_csv(sf.lit('1||true'), {'sep':'|'})).show(truncate=False)
+-------------------------------------------+
|schema_of_csv(1||true)                     |
+-------------------------------------------+
|STRUCT<_c0: INT, _c1: STRING, _c2: BOOLEAN>|
+-------------------------------------------+

Örnek 3: Csv dizesinin şemasını farklı bir sınırlayıcıyla çıkarsama

from pyspark.sql import functions as sf
df = spark.range(1)
df.select(sf.schema_of_csv(sf.lit('1;a;true'), {'sep':';'})).show(truncate=False)
+-------------------------------------------+
|schema_of_csv(1;a;true)                    |
+-------------------------------------------+
|STRUCT<_c0: INT, _c1: STRING, _c2: BOOLEAN>|
+-------------------------------------------+

Örnek 4: Bir CSV dizesinin şemasını tırnak içine alınmış alanlarla çıkarsama

from pyspark.sql import functions as sf
df = spark.range(1)
df.select(sf.schema_of_csv(sf.lit('"1","a","true"'), {'sep':','})).show(truncate=False)
+-------------------------------------------+
|schema_of_csv("1","a","true")              |
+-------------------------------------------+
|STRUCT<_c0: INT, _c1: STRING, _c2: BOOLEAN>|
+-------------------------------------------+