你当前正在访问 Microsoft Azure Global Edition 技术文档网站。 如果需要访问由世纪互联运营的 Microsoft Azure 中国技术文档网站,请访问 https://docs.azure.cn

什么是适用于 Slurm 的 Azure CycleCloud 工作区?

Slurm 是适用于 AI、HPC 和云计算的最常用且广泛使用的开源工作负载管理器之一。 借助 Slurm,可以跨一组计算节点运行大规模并行和分布式应用程序。 它提供作业计划、资源管理、容错和电源管理等功能。 世界上许多顶级超级计算机、研究机构、大学和企业都使用斯卢姆。

但是,在云上设置和管理 Slurm 群集可能具有挑战性且耗时,尤其是在不熟悉云环境或 Slurm 配置的情况下。 需要处理预配和缩放计算节点、安装和更新 Slurm 软件、配置网络和存储、监视群集运行状况和性能以及排查问题等任务。 这些任务可能会分散你对核心研究或业务目标的注意力,并减少 AI 和 HPC 工作负载的工作效率和效率。

适用于 Slurm 的 Azure CycleCloud 工作区是一个 Azure 市场解决方案模板,可用于在 Azure 上使用 CycleCloud 创建、配置和部署预定义的 Slurm 群集。 你不需要先知 Azure 或 Slurm 来部署模板,但操作和定制环境需要这些技能。 解决方案使用 PMix v4、Pyxis 和 enroot 预配置 Slurm 群集,以支持容器化 AI/HPC Slurm 作业。 您可以通过SSH或Visual Studio Code访问配置登录节点,执行常见任务,如提交和管理Slurm作业。

虽然 Azure CycleCloud 已经允许你执行其中一些任务,但它不会为你部署 AI/HPC 基础结构。 必须处理安装和配置 CycleCloud、配置网络和存储以及创建和配置 Slurm 群集等任务。 Azure CycleCloud Workspace for Slurm 在市场解决方案模板中为你执行这些任务,你可以直接从 Azure 门户或通过 Azure CLI 进行部署。 你已经准备好了,只需几分钟,而不是几天或几周。

选择 Azure 协调选项

根据调度员的经验和团队所需的基础设施控制水平选择一个选项:

选项 特别适合 运行模型
适用于 Slurm 的 Azure CycleCloud 工作区 需要为高性能计算或人工智能工作负载提供即时部署Slurm环境的团队 市场解决方案在你的Azure订阅中部署了CycleCloud、Slurm、网络、存储和访问组件。
Azure CycleCloud 需要除 Slurm 以外的调度器、自定义集群拓扑或与现有本地工作流程高度对齐的高性能计算环境 你安装CycleCloud,配置调度器、集群、网络和存储。 CycleCloud 负责配置和自动扩展 Azure 基础设施。
Azure Batch 并行且高吞吐量的工作负载,无需运行调度软件 Azure 以服务形式提供调度功能。 你用 Batch 的 API 和工具构建,而 Batch 则管理池、节点、作业和任务。

以你当前的环境作为决定因素:

起点 偏好 为什么
你需要Slurm,预设的网络、存储、访问和集群架构满足你的需求。 适用于 Slurm 的 Azure CycleCloud 工作区 Marketplace解决方案缩短了实现Slurm运行的路径,同时将资源保留在订阅中。
你需要使用 Slurm 以外的调度器,或者需要对拓扑、调度器策略或基础设施进行超出该解决方案设计范围的自定义。 Azure CycleCloud CycleCloud 提供对调度器和集群配置的控制。
你的应用程序可以使用池、作业和任务,并且无需与调度程序兼容。 Azure Batch Batch 提供调度服务,免除了运行 Slurm 的需求。

如果你期待一个托管平台服务,就不要选择 Workspace 来运行 Slurm。 你的团队仍然拥有已部署的 Azure 资源、Slurm 配置、安全、监控、升级和工作负载操作。 当预定义架构不符合要求的拓扑或集成时,选择自定义CycleCloud。

在生产实施前,记录为何适合 Workspace for Slurm,哪些替代方案被拒绝,部署是否为新开发或重复利用现有资源,网络和身份设计,存储基准,区域虚拟机配额和容量,恢复方法,运营负责人,以及每个代表工作的时间和成本。 从 部署规划开始。 关于自定义的 CycleCloud 集群,请参见 规划和规模 HPC 集群

适用于 Slurm 的 Azure CycleCloud 工作区的优点

若要在 Azure 中构建 AI/HPC 环境,Azure CycleCloud 是一个很好的解决方案,可以提升和转移某些本地 AI/HPC 工作负载或构建新环境。 但是,构建完整的端到端 AI/HPC 环境并不容易。 必须决定如何设计网络、要用作共享文件系统的存储组件、用于运行工作负荷的 VM 类型,以及许多可能使项目复杂交付的小事项。

Azure CycleCloud Workspace for Slurm 为想要在 Azure 上运行 Slurm 工作负载的用户提供多项优势,例如:

  • 简单快速的群集创建:可以在几分钟内在 Azure 上创建 Slurm 群集,只需遵循 GUI 中的几个简单步骤即可。 过去没有 Azure CycleCloud Workspace for Slurm 时,需要工作几天或几周,而此过程需要的时间更短。 可以从各种 Azure 虚拟机(VM)大小和类型中进行选择。 可以自定义群集设置,例如节点数、网络配置、从 Azure NetApp 文件到 Azure 托管 Lustre 文件系统的存储选项,以及 Slurm 参数。

  • 灵活动态的群集管理:Azure CycleCloud 纵向扩展或缩减 Slurm 群集。 可以监视群集状态、性能和利用率。 可以在 GUI 中查看群集日志和指标。 还可以在不再需要 Slurm 群集时删除这些群集,并且只需为使用的资源付费。

如何为 Slurm 创建 Azure CycleCloud 工作区?

可以从 Azure 市场或使用 Azure CLI 部署用于 Slurm 的 Azure CycleCloud 工作区。 若要从市场部署,请搜索 Slurm,然后选择“ 创建”。 若要使用 Azure CLI 进行部署,需要先创建输入参数文件,然后使用命令进行部署 az deployment sub create 。 有关详细说明,请参阅 如何使用 CLI 部署 CycleCloud Slurm 工作区环境

Azure CycleCloud Workspace for Slurm 不是什么?

适用于 Slurm 的 Azure CycleCloud 工作区不是 PaaS 服务。 整个基础结构部署在租户中,这样就可以部署所有内容(绿地部署),或指定现有资源来重复使用(棕色字段部署),例如目标资源组、虚拟网络、Azure NetApp 文件等。

Azure CycleCloud Workspace for Slurm 部署的环境是怎样的

概述体系结构

以下是 Azure CycleCloud Workspace for Slurm 部署内容的典型体系结构。 该体系结构包括必需的资源,例如用于运行 CycleCloud 的虚拟机、用户主目录的共享文件系统,以及 CycleCloud 项目存储的存储帐户。

适用于 Slurm 的 Azure CycleCloud 工作区可以部署虚拟网络,也可以使用现有虚拟网络创建资源。 (可选)可以在自己的子网中创建 Azure 托管 Lustre 文件系统。

如果你公司的安全规则不允许公共 IP 地址(许多公司都允许),则你能够以中心辐射型模式创建虚拟网络与现有虚拟网络的对等互连。 中心包含所有连接服务,例如虚拟网络网关或 Azure Bastion。

最后,在没有公共 IP 且没有 VPN 的环境中,需要 Bastion。 Bastion 提供对 CycleCloud Web 门户的安全访问,并允许使用 SSH 连接到身份验证节点。

后续步骤