這很重要
這項功能目前處於 公開預覽版。
AI Runtime 是 Databricks 針對 深度學習 工作負載的計算產品,並為 Databricks Serverless 提供 GPU 支援。 你可以使用 AI Runtime 訓練並微調自訂模型,使用你喜愛的框架,獲得最先進的效率、效能與品質。 關於 無伺服器運算 如何融入 Databricks 架構的概述,請參見 無伺服器工作區架構。
關鍵功能
- 全託管 GPU 基礎設施:無伺服器、靈活存取 GPU,無需叢集配置、驅動程式選擇或自動擴展政策。
- 專為深度學習設計的執行環境:選擇最小標準環境以最大化依賴彈性,或是預載流行機器學習框架的完整 AI 環境。
- 原生整合於筆記本、工作、Unity Catalog 與 MLflow,實現無縫開發、資料存取與實驗追蹤。
- 合規支援:支援大多數合規標準。 關於支援的標準與例外,請參見 合規安全設定檔。
-
網頁終端存取:當連接到無伺服器 GPU 環境 5 或以上時,執行 shell 指令、監控 GPU 使用率
nvidia-smi,並直接在運算上管理檔案。 請參閱在 Azure Databricks 網路終端機中執行 Shell 命令。
硬體選項
所有 AI 執行時加速器都配置單一節點。 該節點上的 GPU 數量取決於加速器類型:
| 加速器 | 每個節點的 GPU 數 | GPU 記憶體 | 最適合用於 | 分散式訓練 |
|---|---|---|---|---|
| 1xA10 | 1 | 24 GB | 中小型機器學習與深度學習任務,如經典機器學習模型或微調較小語言模型 | 不支援(單一 GPU) |
| 1xH100 | 1 | 80 GB | 需要比 1 張 A10 所提供的 GPU 記憶體更多、但不需要多 GPU 分散訓練的工作負載,例如微調中型語言模型 | 不支援(單一 GPU) |
| 8xH100 | 8 | 每張 GPU 80 GB | 大型 AI 工作負載,包括訓練或微調大型模型,或執行進階深度學習任務 | 支援搭配 @distributed 使用 gpus=8 修飾器 |
建議使用案例
Databricks 建議在涉及深度學習、大規模經典工作負載或 GPU 的任何客製化模型訓練使用情境中使用 AI Runtime。
例如:
- LLM 微調(LoRA、QLoRA、完整微調)
- 電腦視覺(物體偵測、影像分類)
- 基於深度學習的推薦系統
- 增強式學習
- 以深度學習為基礎的時間序列預測
要求
- 以下 Azure 支援區域之一的工作空間:
centraluseastuseastus2northcentraluswestcentraluswestuswestus3
局限性
- AI Runtime 僅支援 A10 和 H100 加速器。
- AI 執行環境不支援 FedRAMP High 或 DoD IL5 標準的 合規安全設定檔 。 其他所有合規標準皆有支援。
- AI 執行時排程工作不支援使用 環境 面板新增相依性。 建議在你的筆記本中使用
%pip install透過程式安裝相依套件。 - 對於 AI 執行時的排程工作,不支援與筆記本相關且不相容的套件版本自動恢復行為。
- 工作負載的執行時間上限為 7 天。 對於超過此限制的模型訓練工作,應實作檢查點,並在達到最大執行時間後重新啟動工作。
- AI 執行環境提供按需存取 GPU 資源。 雖然這讓 GPU 取得更輕鬆且靈活,但有時區域容量有限或無法使用。
- AI Runtime 在某些情況下會利用跨區域 GPU,特別是在需求高峰時。 使用時可能會產生出口成本,且跨區域網路連線在特定時間段可能受到限制。
連接 AI 執行環境
你可以透過筆記本、使用 SSH 隧道的 IDE 終端機、排程工作、Jobs API 以及宣告式自動化套件,互動式連接 AI 執行環境。 有關逐步說明,請參見 「連接 AI 執行環境」。
建立環境
AI 執行環境提供兩個受管型 Python 環境:一個是最小標準環境,另一個是功能完整的 Databricks AI 環境,預載了熱門機器學習框架如 PyTorch 和 Transformers。 關於選擇環境、快取行為、匯入自訂模組及已知限制的細節,請參見 「設定您的環境」。
載入 AI 執行時的資料
了解 AI 執行時的資料存取運作方式,對於流暢的體驗至關重要。 詳情請參見 AI 執行時載入資料。
分散式訓練
AI Runtime 支援在連接的單一節點上,透過多個 GPU 進行分散式訓練。 使用 @distributed Python API 中的 serverless_gpu 裝飾器,你可以僅需極少設定,即可透過 PyTorch DDP、FSDP 或 DeepSpeed 啟動多 GPU 工作負載。 如需詳細資訊,請參閱 筆記本中的分散式訓練。
Ray 在 AI 執行環境上
AI 執行時支援 Ray 用於分散式 GPU 工作負載,包括 Ray Core、Ray Data、Ray Train 及 Ray Tune。 你可以在無伺服器 GPU 運算上執行單節點或多節點 Ray 工作,無需叢集設置。 詳情與範例請參見 Ray on AI Runtime。
實驗追蹤與可觀測性
關於 MLflow 整合、查看日誌及模型檢查點管理,請參見 實驗追蹤與可觀察性。
Genie Code 用於深度學習
Genie Code 支援在 AI 執行環境上進行深度學習工作負載。 它能協助產生訓練程式碼、解決函式庫安裝錯誤、建議優化方案及除錯常見問題。 請參見 使用 Genie Code 來了解資料科學。
Guides
關於從經典工作負載遷移、範例筆記本及故障排除,請參閱 AI 執行環境使用者指南。