重要
此功能目前以公共预览版提供。
AI 运行时是Databricks提供的一款无服务器GPU计算产品,面向 深度学习 工作负载。 可以使用 AI 运行时使用你喜欢的框架来训练和微调自定义模型,并获取最先进的效率、性能和质量。
开始
使用我们的快速入门指南,几分钟内完成你的第一个工作量。
| 开始 | Description |
|---|---|
| 🚀 CLI 快速入门 | 您是从 Slurm 或 Kubernetes 集群迁移而来吗? 几分钟内即可直接在终端中使用 AI Runtime 进行训练。 |
| 📓 笔记本快速入门 | 几秒钟内将笔记本连接到GPU并进行交互开发...... |
| ⚡ Ray | 来自射线簇? 在支持仪表板的 AI 运行时上运行 Ray。 |
| 🧭 概述 | 在两分钟内了解 AI 运行时的关键内容:可用的 GPU、其工作原理以及限制。 |
Features
AI 运行时是一个全栈 GPU 平台,拥有多种连接 GPU 的方式,内置可观察性和调试工具,以及预建环境。
连接无服务器GPU:无论你工作在哪里,都能连接无服务器GPU。
| 功能 | Description |
|---|---|
| Notebooks | 将笔记本连接到无服务器GPU计算,进行交互式开发,无需集群设置。 |
| 基于SSH的IDE | 通过 SSH 隧道从 IDE 或终端连接,直接在 GPU 节点上工作。 |
| AI 运行时 CLI | 用 YAML 作业配置从笔记本提交和管理分布式 GPU 训练任务。 |
| 射线 | 在无服务器GPU计算上运行Ray Core、Ray Data、Ray Train和Ray Tune。 |
管理依赖:控制工作负载运行的Python和系统库。
| 功能 | Description |
|---|---|
| 预建环境 | 从最简标准环境或预装机器学习框架的Databricks AI环境开始。 |
| Docker 支持 | 带上你自己的容器镜像,用自定义依赖栈运行工作负载。 |
将数据加载到显卡:高效地将训练数据传递给显卡。
| 功能 | Description |
|---|---|
| 高效的数据加载器 | 通过专为高 GPU 利用率打造的容错加载器,从 Unity Catalog 卷中流式传输数据。 |
调试与可观察性:跟踪实验,检查输出,诊断故障。
| 功能 | Description |
|---|---|
| 用于深度学习的 MLflow | 用MLflow跟踪实验、指标和运行,并将模型检查点保存到Unity Catalog卷中。 |
| 日志查看器 | 查看训练输出,并在代码运行时监控GPU资源使用。 |
| 与代理进行调试 | 使用 Genie Code 生成训练代码、解决环境问题和调试 GPU 故障。 |
调度与实时在线服务:从交互式开发转向计划任务和端点。
| 功能 | Description |
|---|---|
| 生产化你的工作 | 部署带有声明式自动化捆绑包的培训代码,安排运行,构建多任务GPU和CPU工作流。 |
| 服务你的模特 | 借助 Model Serving,通过可扩展端点部署您训练好的模型。 |
示例
克隆端到端示例,并在几分钟内通过命令行或在笔记本中让它们运行于 AI Runtime 上。
| Example | Description |
|---|---|
| Ray 示例 | 把你现有的Ray项目拿出来,几分钟内就在AI运行时上运行。 |
| 训练表式推荐模型 | 训练深度学习推荐模型,如双塔架构。 |
| 计算机视觉 | GPU上的物体检测和图像分类工作负载。 |
| 经典机器学习 | GPU 加速的 XGBoost、时间序列预测以及其他经典机器学习任务。 |
| 对OSS大型语言模型进行微调 | 通过LoRA、QLoRA或全微调对开源大型语言模型进行微调。 |
了解详细信息
查找有用内容:最新产品更新以及AI运行时的底层运作方式。
| Resource | Description |
|---|---|
| 产品更新 | 查看最新的 AI 运行时产品更新和公告。 |
| AI 运行时的底层工作原理 | 阅读Databricks如何让GPU在AI运行时中保持可靠性。 |