Microsoft Fabric 中数据工厂的 Dataflow Gen2 定价

数据流 Gen2 可帮助你轻松调整和转换数据。 它提供低代码接口和 300 多个内置数据和 AI 转换,这些转换都由熟悉的Power Query体验提供支持,可在Excel、Power BI、Power Platform 和 Dynamics 365 中找到。 数据流 Gen2 还支持通过映射数据流(MDF)转换来执行 Spark 支持的转换,以用于本机和已迁移的工作负荷。

此定价适用于所有 Fabric 容量 SKU(F2 及以上)。 定价不适用于 Fabric 试用容量。 有关常见场景下实际 CU 消耗基准,请参见 Dataflow Gen2 成本和性能基准

发布数据流时,它会创建一个在刷新期间运行的定义。 数据流 Gen2 引擎使用该定义来规划和管理查询如何跨数据源、网关和计算引擎运行。 它在过渡存储中生成表或将它们发送到所选目标,因此无需繁重就能获得可靠的结果。

Dataflow Gen2 体系结构示意图。

该图显示了 Data Factory Dataflow Gen2 体系结构的组件,包括用于暂存引入的数据的 Lakehouse,以及用作计算引擎以更快地将结果写入暂存区或输出位置的 Warehouse 项目。 如果无法使用仓库计算,或者禁用查询暂存时,Mashup 引擎会提取、转换或将数据加载到过渡或数据目标。 若要详细了解数据流 Gen2 的工作原理,请参阅 数据工厂聚焦:数据流 Gen2

数据流 Gen2 可以使用 Mashup 引擎或 Spark 引擎执行工作负荷。 在数据流 Gen2 中使用 MDF 转换时,Spark 支持的计算用于转换执行和数据处理。

刷新或发布数据流 Gen2 项时,Fabric 容量单位将用于以下引擎:

  • 标准计算:费用根据您在 Mashup 引擎中运行的所有数据流查询的查询评估时间来确定。
  • 大规模数据流计算:启用暂存时,会根据 Lakehouse(暂存存储)以及 Warehouse(存储计算)SQL 引擎的使用持续时间进行收费。
  • 快速复制:在启用快速复制连接器时收费,可以根据复制作业持续时间在数据流中使用。 快速复制会在多个内核上并行运行,因此,此持续时间表示该复制作业在其使用的所有内核上累计耗费的总时间,而不是刷新操作的实际耗时。
  • Spark 计算:在管道运行期间执行 MDF 转换时,会根据 Spark 执行持续时间和 Spark 核心使用情况付费。 Dataflow Gen2 中的 MDF 转换工作负载目前通过 Fabric 管道中的“数据流”活动执行。

Dataflow Gen2 定价模型

如何确定定价率

数据流 Gen2 定价取决于每个查询使用计算的方式。 对于标准计算,查询在混合引擎上运行。 根据数据流是否为数据流 Gen2(CI/CD),评级会有所不同。

在数据流 Gen2(CI/CD)中,查询时长采用了两级费率:

  • 如果查询在10分钟内完成运行,则评定为12个计算单位(CU)
  • 如果运行时间更长,则每个额外秒的评级为 1.5 CU。

如果您的数据流 Gen2 不是 CI/CD,那么速率将为 16 CU,并应用于整个查询时长。

注释

使用 分区计算时,Dataflow Gen2 会将每个分区作为独立的工作单元来评估。 标准计算费用基于每个分区的处理时长之和。 并行运行分区可以缩短完成运行的总时间(墙时钟),而总CU消耗则反映所有分区的计算总和。

对于大规模场景,启用暂存后,查询将在 Lakehouse 或 Warehouse SQL 引擎上运行。 每秒计算时间使用 6 CU 秒,因此查询消耗的时间更长。

如果启用快速复制,则数据移动的速率为 1.5 CU,具体取决于活动运行时间。 快速复制会根据每种场景自动决定使用多少个核心,计费时长按所有这些核心累计消耗的总时间计算,而不是刷新历史记录中看到的实际经过时间。 将工作分散到更多核心可以缩短耗时时间,而计费时长则涵盖了复制作业使用的每个核心。

每次运行结束时,Dataflow Gen2 都会增加每个引擎的 CU 使用情况,并根据区域中的 Fabric 容量定价对其进行计费。

CU 费率表

Dataflow Gen2 引擎类型 消耗计量 Fabric CU 消耗率 消耗报告精细度
标准计算(“数据流 Gen2”(CI/CD)) 根据每个混合引擎查询执行持续时间(以秒为单位)。 标准计算有两层定价,具体取决于查询持续时间。 - 每秒12 CU,持续时间最多10分钟。
- 每超过 10 分钟的每一秒,1.5 CU
每个 Dataflow Gen2 项目
标准计算(非 CI/CD) 根据每个混合引擎查询执行持续时间(以秒为单位)。 16 CU 每个 Dataflow Gen2 项目
大规模数据流计算 基于 Lakehouse/Warehouse SQL 引擎在启用暂存时的执行持续时间(秒)。 6 CU 每个工作区
数据移动 基于 Fast Copy 的运行时长,以复制作业所使用的所有核心的核心时间总和(以秒计)来衡量。 数据流会自动平衡每个快速复制场景所需的核心数。 1.5 CU 每个 Dataflow Gen2 项目
映射数据流转换计算(预览) 基于在 Dataflow Gen2 中使用 Spark 支持的计算的 MDF 转换执行持续时间(以秒为单位)。 每个 Spark 核心小时 1.5 CU

示例:8 核 Spark 群集每小时使用 12 个 CU(8 × 1.5 CU)。
每个 Dataflow Gen2 项目

使用数据流 Gen2 的虚拟网络数据网关定价

虚拟网络 (VNET) 数据网关按附加基础设施费用收取,并与 Fabric 容量相关联。 这意味着它采用单独计量,并且除所有 Fabric 项运行的费用外,还会产生一笔统一的额外费用。

通过 虚拟网络 数据网关运行数据流 Gen2 的总费用计算为:数据流 Gen2 费用 + 虚拟网络数据网关费用。

虚拟网络数据网关费用与您的虚拟网络数据网关使用量成正比,其中,使用量按正常运行时间计算,也就是虚拟网络数据网关处于开启状态的任何时间。

虚拟网络数据网关 CU 消耗速率:4 CU

有关详细信息,请参阅虚拟网络数据网关定价和计费

对 Microsoft Fabric 工作负载消耗率的更改

消耗率可能会随时更改。 Microsoft 将尽合理努力通过电子邮件和产品内通知提供通知。 更改在发行说明Microsoft Fabric 博客中声明的日期生效。 如果对 Microsoft Fabric 工作负载消耗率的任何更改会显著增加使用特定工作负载所需的容量单位 (CU),客户可以使用适用于所选付款方式的取消选项。

使用Fabric指标应用和数据流刷新历史记录计算估计成本

Microsoft Fabric 容量指标应用提供了与容量相关的所有 Fabric 工作区的容量使用情况的可见性。 容量管理员可使用它来监视工作负载的性能及其与购买的容量相比较的使用情况。 使用指标应用是估算 Dataflow Gen2 刷新运行成本的最准确方法。 若要了解分层定价如何影响标准计算成本,还需要使用数据流刷新历史记录。

这些练习演示如何验证 CI/CD 和非 CI/CD 数据流的成本。 对于具有标准计算的 CI/CD 数据流,提供了一个工作示例,然后提供了所有其他方案的说明。

练习 1:CI/CD 数据流的标准计算

以下数据流包含两个涉及转换的查询,并且禁用暂存。

Dataflow Gen2 的屏幕截图,包含两个查询。

显示已禁用配置的Dataflow Gen2阶段的屏幕截图。

数据流 Gen2 仅使用标准计算。

对于每个查询,请从刷新历史记录访问查询持续时间,并应用以下公式来计算每个查询的 CU 消耗量。

对于第一个查询,持续时间为 2,131 秒。

显示查询 1 刷新历史记录的屏幕截图。

同样,对于第二个查询,持续时间为 913 秒

显示查询 2 刷新历史记录的屏幕截图。

StandardComputeCapacityConsumptionInCUSeconds = if(QueryDurationInSeconds < 600, QueryDurationInSeconds x 12, (QueryDurationInSeconds - 600) x 1.5 + 600 x 12)

对于查询 1,计算消耗量为 9497 CU 秒,对于查询 2,计算消耗为 7670 CU 秒。

聚合 CU 秒的容量消耗量,并在 Fabric 容量指标应用中验证消耗量。 在此方案中,指标应用将 17,180 CU 秒显示为标准计算使用情况,与计算消耗量 17,167 CU 秒进行比较。 任何不一致都可能是由于在定期使用情况报告中进行四舍五入而导致的。

Fabric 容量指标应用程序的屏幕截图,显示数据流消耗。

练习 2:非 CI/CD 数据流的标准计算

当数据流包含转换操作且禁用暂存时,Dataflow Gen2 仅使用标准计算资源。

对于每个查询,请从刷新历史记录访问查询持续时间,并应用以下公式来计算每个查询的 CU 消耗量。

StandardComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 16

聚合 CU 秒的容量消耗量,并在 Fabric 容量指标应用中验证消耗量。

练习 3:了解大规模计算消耗量(CI/CD 和非 CI/CD 数据流)

如果数据流使用暂存,若要了解使用的大规模计算量,请打开Fabric容量指标应用并按数据流的名称进行筛选。 右键单击该名称,在作列表中查找“大规模计算”,并检查持续时间。

HighScaleComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 6

练习 4:了解快速复制的计算资源消耗(CI/CD 和非 CI/CD 数据流)

如果数据流使用快速复制,若要了解所使用的数据移动计算量,请打开Fabric容量指标应用并按数据流的名称进行筛选。 右键单击名称,在操作列表中查找“数据移动”,并检查持续时间。

FastCopyComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 1.5