语言

DataFrame 类

定义

组织为命名列的数据的分布式集合。

public sealed class DataFrame
type DataFrame = class
Public NotInheritable Class DataFrame
继承
DataFrame

属性

名称 说明
Item[String]

根据列名选择列。

方法

名称 说明
Agg(Column, Column[])

聚合整个 DataFrame 没有组。

Alias(String)

返回具有别名集的新 DataFrame 项。 与() 相同。

As(String)

返回具有别名集的新 DataFrame 项。

Cache()

将此 DataFrame 保留为默认存储级别MEMORY_AND_DISK。

Checkpoint(Boolean)

返回此 DataFrame检查点的版本。

Coalesce(Int32)

返回一个新的值,当请求的分区更少时,该新 DataFrame 分区正好 numPartitions 具有分区。 如果请求了更多分区,它将保持在当前分区数。

Col(String)

根据列名选择列。

Collect()

返回一个数组,其中包含此 DataFrame数组中的所有行。

ColRegex(String)

根据指定为正则表达式的列名称选择列。

Columns()

返回所有列名。

Count()

返回 . 中的 DataFrame行数。

CreateGlobalTempView(String)

使用给定的名称创建全局临时视图。 此临时视图的生存期绑定到此 Spark 应用程序。

CreateOrReplaceGlobalTempView(String)

使用给定的名称创建或替换全局临时视图。 此临时视图的生存期绑定到此 Spark 应用程序。

CreateOrReplaceTempView(String)

使用给定的名称创建或替换本地临时视图。 此临时视图的生存期与创建此 DataFrame视图的 SparkSession 相关联。

CreateTempView(String)

使用给定的名称创建本地临时视图。 此临时视图的生存期与创建此 DataFrame视图的 SparkSession 相关联。

CrossJoin(DataFrame)

显式笛卡尔与另一个 DataFrame联接。

Cube(Column[])

使用指定的列为当前 DataFrame 创建多维多维多维数据集。

Cube(String, String[])

使用指定的列为当前 DataFrame 创建多维多维多维数据集。

Describe(String[])

计算数值列和字符串列的基本统计信息,包括 count、mean、stddev、min 和 max。如果未提供任何列,此函数将计算所有数值列或字符串列的统计信息。

Distinct()

返回一个新的数据集,该数据集仅包含此 DataFrame数据库中的唯一行。 这是 DropDuplicates() 的别名。

Drop(Column)

返回删除列的新 DataFrame 值。 如果没有具有等效表达式的列, DataFrame 则这是一个 no-op。

Drop(String[])

返回已删除列的新 DataFrame 值。 如果架构不包含列名,则这是一个 no-op。

DropDuplicates()

返回仅包含此DataFrame行的唯一行的新DataFrame值。 这是 Distinct() 的别名。

DropDuplicates(String, String[])

返回删除了重复行的新 DataFrame 行,只考虑列的子集。

DTypes()

以元组的 IEnumerable 形式返回所有列名及其数据类型。

Except(DataFrame)

返回一个新的 DataFrame 包含此 DataFrame 行,但不在另一个 DataFrame行中。

ExceptAll(DataFrame)

返回一个新 DataFrame 包含行, DataFrame 但不在另一个 DataFrame 行中保留重复项。

Explain(Boolean)

将计划(逻辑和物理)打印到控制台以进行调试。

Explain(String)

使用给定解释模式指定的格式打印计划(逻辑和物理)。

Filter(Column)

使用给定条件筛选行。

Filter(String)

使用给定的 SQL 表达式筛选行。

First()

返回第一行。 阿里斯为头()。

GroupBy(Column[])

使用指定的列对数据帧进行分组,以便我们可以对其运行聚合。

GroupBy(String, String[])

使用指定的列对数据帧进行分组。

Head()

返回第一行。

Head(Int32)

返回第一 n 行。

Hint(String, Object[])

指定当前 DataFrame提示的一些提示。

Intersect(DataFrame)

仅返回此DataFrame行和另一行DataFrame中的新DataFrame行。

IntersectAll(DataFrame)

仅返回一个新DataFrame包含行,同时DataFrameDataFrame保留重复项。

IsEmpty()

如果此 DataFrame 为空,则返回 true。

IsLocal()

如果 Collect() 和 Take() 方法可以在本地运行且没有任何 Spark 执行程序,则返回 true。

IsStreaming()

如果它 DataFrame 包含一个或多个源,则返回 true,这些源在到达时会持续返回数据。

Join(DataFrame, Column, String)

使用给定联接表达式将另一个联接与另一个 DataFrame联接。

Join(DataFrame, IEnumerable<String>, String)

使用给定列与另一个 DataFrame 等同联接。 具有谓词的交叉联接被指定为内部联接。 如果要显式执行交叉联接,请使用该方法 crossJoin

Join(DataFrame, String)

使用给定列与另一个 DataFrame 内部等价联接。

Join(DataFrame)

与另一个 DataFrame联接。

Limit(Int32)

通过获取第一number行返回一个新DataFrame值。

LocalCheckpoint(Boolean)

返回此 DataFrame本地检查点版本。

Na()

返回一个 DataFrameNaFunctions 用于处理缺失数据。

Observe(String, Column, Column[])

定义要在数据集上观察的(已命名)指标。 此方法返回一个“观察”数据帧,该数据帧返回与输入相同的结果,并保证以下保证:

  1. 它将计算在该点流经数据集的所有数据的已定义聚合(指标)。
  2. 一旦到达完成点,它就会报告定义的聚合列的值。完成点是查询(批处理模式)的结束或流式处理纪元的结束。 聚合的值仅反映自上一个完成点以来处理的数据。

请注意,目前不支持连续执行。

OrderBy(Column[])

返回按给定表达式排序的新数据集。

OrderBy(String, String[])

返回按给定表达式排序的新数据集。

Persist()

将此 DataFrame 保留为默认存储级别MEMORY_AND_DISK。

Persist(StorageLevel)

使用给定的存储级别保留此值 DataFrame

PrintSchema()

以良好的树格式将架构打印到控制台。

PrintSchema(Int32)

以良好的树格式将架构打印到主机的给定级别。

RandomSplit(Double[], Nullable<Int64>)

使用提供的权重随机拆分此值 DataFrame

Repartition(Column[])

使用分区数返回由给定分区表达式spark.sql.shuffle.partitions分区的新DataFrame分区。

Repartition(Int32, Column[])

返回 DataFrame 由给定分区表达式划分的新 numPartitions分区。 生成的 DataFrame 哈希已分区。

Repartition(Int32)

返回一个完全numPartitions具有分区的新DataFrame项。

RepartitionByRange(Column[])

使用分区数返回由给定分区表达式spark.sql.shuffle.partitions分区的新DataFrame分区。 生成的数据集已分区。

RepartitionByRange(Int32, Column[])

返回 DataFrame 由给定分区表达式划分的新 numPartitions分区。 生成的 DataFrame 是分区范围。

Rollup(Column[])

使用指定的列为当前 DataFrame 创建多维汇总。

Rollup(String, String[])

使用指定的列为当前 DataFrame 创建多维汇总。

Sample(Double, Boolean, Nullable<Int64>)

通过使用用户提供的种子对行的一小部分(不替换)采样,返回一个新 DataFrame 值。

Schema()

返回与此 DataFrame关联的架构。

Select(Column[])

选择一组基于列的表达式。

Select(String, String[])

选择一组列。 这是 Select()的变体,只能使用列名(即无法构造表达式)选择现有列。

SelectExpr(String[])

选择一组 SQL 表达式。 这是接受 SQL 表达式的 Select() 变体。

Show(Int32, Int32, Boolean)

以表格形式显示行 DataFrame

Sort(Column[])

返回按给定表达式排序的新 DataFrame 结果。

Sort(String, String[])

以升序返回按指定列排序的新 DataFrame 列。

SortWithinPartitions(Column[])

返回一个新 DataFrame 分区,每个分区都按给定表达式排序。

SortWithinPartitions(String, String[])

返回一个新 DataFrame 分区,每个分区都按给定表达式排序。

Stat()

返回工作统计函数支持。DataFrameStatFunctions

StorageLevel()

DataFrame获取 's current StorageLevel().

Summary(String[])

计算数值列和字符串列的指定统计信息。

Tail(Int32)

返回中DataFrame最后n一行。

Take(Int32)

返回中DataFrame第一n行。

ToDF()

将此强类型的数据收集转换为泛型 DataFrame

ToDF(String[])

将此强类型数据集合转换为已重命名列的泛型 DataFrame

ToJSON()

以 JSON 字符串的数据帧的形式返回 DataFrame 的内容。

ToLocalIterator()

返回包含此 DataFrame行中的所有行的迭代器。 迭代器将消耗的内存量与其中 DataFrame最大的分区一样多。

ToLocalIterator(Boolean)

返回包含此 DataFrame行中的所有行的迭代器。 迭代器将消耗的内存量与其中 DataFrame最大的分区一样多。 使用预提取时,它最多可能会占用 2 个最大分区的内存。

Transform(Func<DataFrame,DataFrame>)

链接自定义转换的简洁语法。

Union(DataFrame)

返回一个新的包含此DataFrame行和另一DataFrameDataFrame的联合。

UnionByName(DataFrame)

返回一个新的包含此DataFrame行和另一DataFrameDataFrame行的并集,按名称解析列。

Unpersist(Boolean)

将数据集标记为非持久性,并从内存和磁盘中删除数据集的所有块。

Where(Column)

使用给定条件筛选行。 这是 Filter() 的别名。

Where(String)

使用给定的 SQL 表达式筛选行。 这是 Filter() 的别名。

WithColumn(String, Column)

通过添加列或替换具有相同名称的现有列来返回一个新 DataFrame 列。

WithColumnRenamed(String, String)

返回重命名了列的新数据集。 如果架构不包含 existingName,则这是一个 no-op。

WithWatermark(String, String)

定义此数据帧的事件时间水印。 水印跟踪一个时间点,在此之前,我们假设不会有更多延迟的数据到达。

Write()

用于将非流式处理数据集的内容保存到外部存储的接口。

WriteStream()

用于将流式处理数据集的内容保存到外部存储的接口。

WriteTo(String)

为 v2 源创建写入配置生成器。

适用于