AI 运行时

重要

此功能目前以公共预览版提供。

AI 运行时是Databricks提供的一款无服务器GPU计算产品,面向 深度学习 工作负载。 可以使用 AI 运行时使用你喜欢的框架来训练和微调自定义模型,并获取最先进的效率、性能和质量。

开始

使用我们的快速入门指南,几分钟内完成你的第一个工作量。

开始 Description
🚀 CLI 快速入门 您是从 Slurm 或 Kubernetes 集群迁移而来吗? 几分钟内即可直接在终端中使用 AI Runtime 进行训练。
📓 笔记本快速入门 几秒钟内将笔记本连接到GPU并进行交互开发......
⚡ Ray 来自射线簇? 在支持仪表板的 AI 运行时上运行 Ray。
🧭 概述 在两分钟内了解 AI 运行时的关键内容:可用的 GPU、其工作原理以及限制。

Features

AI 运行时是一个全栈 GPU 平台,拥有多种连接 GPU 的方式,内置可观察性和调试工具,以及预建环境。

连接无服务器GPU:无论你工作在哪里,都能连接无服务器GPU。

功能 Description
Notebooks 将笔记本连接到无服务器GPU计算,进行交互式开发,无需集群设置。
基于SSH的IDE 通过 SSH 隧道从 IDE 或终端连接,直接在 GPU 节点上工作。
AI 运行时 CLI 用 YAML 作业配置从笔记本提交和管理分布式 GPU 训练任务。
射线 在无服务器GPU计算上运行Ray Core、Ray Data、Ray Train和Ray Tune。

管理依赖:控制工作负载运行的Python和系统库。

功能 Description
预建环境 从最简标准环境或预装机器学习框架的Databricks AI环境开始。
Docker 支持 带上你自己的容器镜像,用自定义依赖栈运行工作负载。

将数据加载到显卡:高效地将训练数据传递给显卡。

功能 Description
高效的数据加载器 通过专为高 GPU 利用率打造的容错加载器,从 Unity Catalog 卷中流式传输数据。

调试与可观察性:跟踪实验,检查输出,诊断故障。

功能 Description
用于深度学习的 MLflow 用MLflow跟踪实验、指标和运行,并将模型检查点保存到Unity Catalog卷中。
日志查看器 查看训练输出,并在代码运行时监控GPU资源使用。
与代理进行调试 使用 Genie Code 生成训练代码、解决环境问题和调试 GPU 故障。

调度与实时在线服务:从交互式开发转向计划任务和端点。

功能 Description
生产化你的工作 部署带有声明式自动化捆绑包的培训代码,安排运行,构建多任务GPU和CPU工作流。
服务你的模特 借助 Model Serving,通过可扩展端点部署您训练好的模型。

示例

克隆端到端示例,并在几分钟内通过命令行或在笔记本中让它们运行于 AI Runtime 上。

Example Description
Ray 示例 把你现有的Ray项目拿出来,几分钟内就在AI运行时上运行。
训练表式推荐模型 训练深度学习推荐模型,如双塔架构。
计算机视觉 GPU上的物体检测和图像分类工作负载。
经典机器学习 GPU 加速的 XGBoost、时间序列预测以及其他经典机器学习任务。
对OSS大型语言模型进行微调 通过LoRA、QLoRA或全微调对开源大型语言模型进行微调。

了解详细信息

查找有用内容:最新产品更新以及AI运行时的底层运作方式。

Resource Description
产品更新 查看最新的 AI 运行时产品更新和公告。
AI 运行时的底层工作原理 阅读Databricks如何让GPU在AI运行时中保持可靠性。