Ray 在 AI 运行时

Important

此功能目前以公共预览版提供。

注释

本页介绍了Ray在AI运行时上的应用。 如果你在Databricks classic计算中使用Ray,配合Databricks运行时机器学习,请参见 Ray在Databricks上的应用

Ray 是一个用于扩展 Python 工作负载的开放源代码框架。 你可以创建Ray集群,并在AI运行时运行Ray应用,使用无服务器GPU计算,自动处理基础设施配置。

AI 运行时 CLI 支持 Ray 的单节点和多节点配置。 在工作负载 command的 下包含一个引导脚本,启动 Ray 集群,并在工作负载启动时协调头节点和工作节点。 Ray hello World 的例子就体现了这一模式。

AI 运行时支持 Ray 的核心库,包括 Ray CoreRay DataRay TrainRay Tune。 在标准 Databricks 环境中,将 ray 库或相关的 Ray 附加组件(ray[data]ray[train]ray[tune])安装为工作负载的依赖项。 如果您使用 Databricks AI 环境,ray 已预安装,但额外组件必须单独安装。

Examples

示例 Description
Ray Hello World 示例(CLI) Ray Core、Ray Train、Ray Data 和 Ray Tune 的最小单节点和多节点示例,包括集群引导模式。
使用 Ray Train 进行分布式训练 (CLI) 利用Ray Train和PyTorch对跨多个节点的大型语言模型进行微调。
使用Ray Data和vLLM(CLI)进行批处理推理 使用光线数据进行大规模批量推断,用于分布式数据加载,vLLM用于高效模型服务。
使用 Ray Tune 进行超参数搜索(CLI) 使用 Ray Tune 搜索 Qwen2.5 的 LoRA 微调超参数,每个 GPU 运行一个试验,并通过 ASHA 计划程序提前停止表现不佳的试验。