有时,需要执行从 Data Lake 或企业数据仓库(EDW)到 Fabric OneLake 的大规模数据迁移。 其他情况下,需要将来自不同源的大量数据引入到 oneLake Fabric,以便进行大数据分析。 在每个情况下,实现最佳性能和可伸缩性至关重要。
数据工厂管道提供了一种引入数据的机制,它具有以下优势:
- 处理大量数据
- 性能极高
- 具有成本效益
这些优势非常适合于想要构建高性能的可伸缩数据引入管道的数据工程师。
阅读本文后,可以回答以下问题:
- 将复制活动用于数据迁移和数据引入方案时,可以实现什么级别的性能和可扩展性?
- 应执行哪些步骤来优化复制活动的性能?
- 对于单次复制活动运行,可以采用哪些性能优化措施?
- 优化复制性能时需要考虑哪些其他外部因素?
通过 Data Factory 管道可实现的复制性能和可伸缩性
数据工厂管道提供无服务器体系结构,可以实现不同级别的并行性。
通过此体系结构,可开发能最大程度地提高环境数据移动吞吐量的管道。 这些管道充分利用以下资源:
- 源数据存储与目标数据存储之间的网络带宽
- 源或目标数据存储的每秒输入/输出操作数 (IOPS) 和带宽
这种充分利用意味着你可通过测量以下资源可用的最小吞吐量来估计总体吞吐量:
- 源数据存储
- 目标数据存储
- 源数据存储与目标数据存储之间的网络带宽
副本可在不同层级进行扩展:
- 控制流可以并行启动多个复制活动(例如,使用 For Each loop)。
- 单个复制活动可以利用可缩放的计算资源。
- 可以按无服务器方式为每个复制活动指定智能吞吐量优化为最大值。
- 单个复制活动使用多个线程并行读取和写入数据存储。
复制性能优化功能
此服务提供以下性能优化功能:
智能吞吐量优化
智能吞吐量优化通过将 CPU、内存和网络资源分配的因素与运行单个复制活动的预期成本相结合,支持服务以智能方式优化吞吐量。 允许用于支持复制活动以智能方式运行的选项包括:自动、标准、平衡、最大值。 还可以指定介于 4 和 256 之间的值。
下表列出了不同复制方案中的建议值:
| 值 | 说明 |
|---|---|
| 自动 | 允许服务根据源目标对和数据模式动态应用最佳吞吐量优化。 |
| 标准 | 允许服务根据您的源-目标对和数据模式,在标准计算资源下动态应用吞吐量优化。 |
| Balanced | 允许服务根据源目标和数据模式动态应用吞吐量优化,以平衡吞吐量和可用计算资源。 |
| 最大 | 允许服务根据源目标对和数据模式通过利用最大可用计算资源来动态应用吞吐量优化。 |
并行复制
可以在复制活动的“设置”选项卡中设置“复制并行度”设置,以指示希望复制活动使用的并行度。 将此属性视为复制活动中的最大线程数。 线程并行操作。 线程可从源读取,也可写入目标数据存储。
并行复制独立于智能吞吐量优化设置。 对于每次运行复制活动,服务默认会根据源和目标配对以及数据模式,动态应用最佳的并行复制设置。
要控制托管数据存储的计算机上的负载或优化复制性能,可以替代默认值,并指定复制并行度的值。 该值必须是大于或等于 1 的整数。 在运行时,为了获得最佳性能,复制活动会使用一个小于或等于你所设置值的值。