這很重要
這項功能目前處於 公開預覽版。
AI Runtime 是 Databricks 提供的無伺服器 GPU 運算產品,專為 深度學習 工作負載設計。 你可以使用 AI Runtime 訓練並微調自訂模型,使用你喜愛的框架,獲得最先進的效率、效能與品質。
開始
利用我們的快速入門指南,幾分鐘內完成你的第一個工作負載。
| 開始 | 描述 |
|---|---|
| 🚀 CLI 快速啟動 | 是從 Slurm 或 Kubernetes 叢集來的嗎? 從終端機訓練 AI 執行時,只需幾分鐘。 |
| 📓 筆記本快速入門 | 幾秒鐘內將筆電連接到 GPU 並互動開發...... |
| ⚡ 雷 | 來自射線星團? 在 AI 執行時執行 Ray 並支援儀表板。 |
| 🧭 概述 | 兩分鐘內了解 AI 執行環境的關鍵資訊:可用的 GPU、運作方式以及限制。 |
功能
AI Runtime 是一個全端 GPU 平台,具備多種連接 GPU 的方式、內建可觀察性與除錯工具,以及預先建置的環境。
連接無伺服器 GPU:無論你工作地點,都能接觸到無伺服器 GPU。
| Feature | 描述 |
|---|---|
| Notebooks | 將筆記型電腦連接到無伺服器 GPU 運算,互動式開發,無需叢集設置。 |
| 透過 SSH 的 IDE | 從你的 IDE 或終端機透過 SSH 隧道直接連接 GPU 節點。 |
| AI 執行時 CLI | 從筆電提交並管理分散式 GPU 訓練工作,使用 YAML 工作設定。 |
| Ray | 在無伺服器 GPU 運算上執行 Ray Core、Ray Data、Ray Train 和 Ray Tune。 |
管理相依性:控制你的工作負載所搭配的 Python 和系統函式庫。
| Feature | 描述 |
|---|---|
| 預建環境 | 從最簡的標準環境或預先載入機器學習框架的 Databricks AI 環境開始。 |
| Docker 支援 | 帶上你自己的容器映像檔,用自訂相依堆疊來執行工作負載。 |
將資料載入 GPU:有效率地將訓練資料傳送給 GPU。
| Feature | 描述 |
|---|---|
| 高效資料載入器 | 從 Unity 目錄卷中串流資料,搭配為高 GPU 利用率打造的容錯載入器。 |
除錯與可觀察性:追蹤實驗、檢查輸出並診斷故障。
| Feature | 描述 |
|---|---|
| 深度學習的 MLflow | 用 MLflow 追蹤實驗、指標和執行,並將模型檢查點存到 Unity 目錄卷中。 |
| 日誌檢視器 | 在程式碼執行時查看訓練輸出並監控 GPU 資源使用。 |
| 使用代理程式除錯 | 使用 Genie Code 來產生訓練程式碼、解決環境問題及除錯 GPU 故障。 |
排程與即時服務:從互動式開發轉向排程工作與端點。
| Feature | 描述 |
|---|---|
| 生產化你的工作 | 部署使用宣告式自動化套件的訓練程式碼、排程執行,並建立多工 GPU 與 CPU 工作流程。 |
| 服務你的模特兒 | 將訓練好的模型部署在可擴展的端點後方,並搭配 Model Serving。 |
Examples
端對端複製範例,並在 AI 執行時中幾分鐘內執行,無論是從 CLI 或筆記本中執行。
| Example | 描述 |
|---|---|
| 雷伊範例 | 把你現有的 Ray 專案拿出來,在 AI 執行時上幾分鐘就能跑。 |
| 訓練表格式推薦模型 | 訓練深度學習推薦模型,例如雙塔架構。 |
| 電腦視覺 | GPU 上的物件偵測與影像分類工作負載。 |
| 經典機器學習 | GPU 加速的 XGBoost、時間序列預測及其他經典機器學習任務。 |
| 微調OSS LLM | 透過 LoRA、QLoRA 或完整微調,微調開源大型語言模型。 |
瞭解更多資訊
尋找有用內容:最新產品更新以及 AI 執行環境的運作方式。
| Resource | 描述 |
|---|---|
| 產品更新 | 請參閱最新的 AI Runtime 產品更新與公告。 |
| AI 執行環境的運作原理 | 閱讀 Databricks 如何讓 GPU 在 AI 執行時中保持可靠性。 |