若要使用复制作业运行成功的数据分析项目,需要使用源代码管理、持续集成、持续部署和协作环境。
在 Microsoft Fabric 中,你将获得两个主要工具:Git 集成和部署管道。 这些资源允许你管理工作区资源,并根据需要更新它们。
借助 Git 集成和部署管道,可以在 Azure DevOps 或 GitHub 中连接自己的 Git 存储库,并使用 Fabric 的内置部署工具。 这样可以轻松设置流畅的 CI/CD 工作流,以便可以自信地生成、测试和部署数据项目。
此外,借助变量库支持,可以在复制作业中参数化连接。 此功能通过外部化连接值简化了 CI/CD,使你能够在多个环境中部署相同的复制作业,而变量库为每个阶段注入正确的连接。
复制作业的 Git 集成
按照以下步骤将数据工厂中的复制作业连接到 Git。 这有助于跟踪更改、与团队协作,并确保工作安全:
Git 集成的先决条件
- 需要 Power BI Premium 许可证 或 Fabric 容量。
- 确保启用这些管理员设置:
- 用户可以创建 Fabric 项目
- 用户可以将工作区项与其 Git 存储库同步
- (对于 GitHub 用户) 用户可以将工作区项与 GitHub 存储库同步
- 需要 Azure DevOps 组织或 GitHub 帐户。
- 对于 Azure DevOps:
- 如果没有帐户,请注册免费Azure帐户。
- 请确保你有权访问存储库。
- 对于 GitHub:
- 如果没有帐户,请注册免费GitHub帐户。
- 需要具有内容读取和写入权限的精细令牌,或者需要启用了存储库范围的 GitHub 经典令牌。
- 对于 Azure DevOps:
步骤 1:连接到 Git 存储库
若要在 Fabric 中使用 Git 与复制作业的集成,首先需要连接到 Git 存储库:
登录到 Fabric 并转到要连接到 Git 的工作区。
选择“工作区设置”。
选择 Git 集成。
选择 Git 提供程序—Azure DevOps 或 GitHub。 如果选择 GitHub,请选择 “添加帐户 ”以连接 GitHub 帐户。 登录后,选择 “连接” ,以便 Fabric 可以访问 GitHub 帐户。
步骤 2:连接到工作区
连接到 Git 存储库后,需要连接到工作区。
在下拉菜单中,填写要使用的工作区和分支的详细信息:
对于 Azure DevOps:
- 组织名称
- 项目名称
- 存储库名称
- 分支名称
- 文件夹名称
对于 GitHub:
- 存储库 URL
- 分支名称
- 文件夹名称
选择“连接并同步”。
连接后,选择 源代码管理 ,获取有关链接分支、每个项的状态以及上次同步时间的信息。
步骤 3:将更改提交至 Git
可以按照以下步骤将更改提交到 Git:
- 转到你的工作区。
- 选择“源代码管理”图标。 你会看到一个数字,显示哪些更改尚未提交。
- 在 “源控制面板 ”中,选择“ 更改 ”选项卡。可以看到已更改的所有内容的列表,以及状态图标。
- 选择要提交的项目。 要全选,请勾选顶部的框。
- (可选)添加有关更改的提交注释。
- 选择“提交”。
提交后,这些项会从列表中消失,工作区指向最新提交。
Git 的部署流水线
按照以下步骤将 Git 部署管道与 Fabric 工作区配合使用:
部署管道的先决条件
在开始之前,请务必设置以下先决条件:
- 有效的 Microsoft Fabric 订阅。
- Fabric 工作区上的管理员访问权限。
步骤 1:创建部署管道
- 在 “工作区” 菜单中,选择 “部署管道”。
- 打开 “创建部署管道 ”窗口时,输入管道的名称和说明,然后选择“ 下一步”。
- 选择您希望管道中包含的阶段数量。 默认情况下,会看到三个阶段:开发、测试和生产。
步骤 3:将工作区分配给部署管道
创建管道后,需要将想要管理的内容添加到管道。 向管道添加内容是通过将工作区分配到管道的任意阶段来实现的。
打开部署管道。
在要向其分配工作区的阶段中,展开标题为“将内容添加到此阶段”的下拉列表。
选择要分配到此阶段的工作区。
选择“分配”。
部署到空白阶段
准备好将内容从一个管道阶段移到下一个阶段时,可以使用以下选项之一部署它:
- 完整部署:选择此选项可将当前阶段的所有内容部署到下一阶段。
- 选择性部署:仅选择要部署的项。
- 向后部署:将内容从更高阶段移回早期阶段。 仅当目标阶段为空(未分配工作区)时,才能执行此作。
选择部署选项后,可以查看 详细信息,并记下有关部署的说明(如果需要)。
将内容从一个阶段部署到另一个阶段
当管道阶段中已有内容时,即使下一阶段的工作区中已有内容,也可以将其部署到下一阶段。 配对项将被覆盖。 可以在 “将内容部署到现有工作区 ”一文中了解有关此过程的详细信息
还可以查看部署历史记录,查看上次将内容部署到每个阶段的时间。 若要在部署之前检查两个管道之间的差异,请参阅比较不同部署阶段的内容。
复制作业的变量库的连接参数化
可以通过变量库执行以下操作,以参数化复制作业中的连接。 详细了解 变量库。
步骤 1:创建变量库
在 Fabric 中选择 “+ 新建项 ”以创建变量库。
“ 新建变量库 ”窗口打开时,输入变量库的名称,然后选择“ 创建”。
选择 “+ 新建变量 ”,为源连接和目标连接创建新变量。
将不同的连接 ID 作为值集添加到不同环境(例如开发、测试和生产)的变量。 可以从“设置”中查找连接的 ID |管理连接和网关。 单击连接名称旁边的 “设置” 即可找到连接的 ID。
步骤 2:在复制作业中使用变量库
打开复制任务。
导航到源和目标连接,并将其链接到创建的变量库。
步骤 3:在每个工作区中激活不同的连接值
将复制作业从开发工作区部署到测试或生产后,可以通过为每个工作区选择适当的值来激活不同的连接 ID。
转到目标工作区并打开变量库。
激活变量库中该工作区的相应连接 ID。
已知限制
下面是在 Microsoft Fabric 中的 Data Factory 中使用 CI/CD 进行复制任务时的一些当前限制:
- 工作区变量:CI/CD 当前不支持工作区变量。
- Git 集成有限支持:目前,Fabric 仅支持 Git 与 Azure DevOps 和 GitHub 的集成。 建议使用 Azure DevOps Git 集成,因为 GitHub Git 集成具有更多限制。