AI 運行環境

這很重要

這項功能目前處於 公開預覽版。

AI Runtime 是 Databricks 提供的無伺服器 GPU 運算產品,專為 深度學習 工作負載設計。 你可以使用 AI Runtime 訓練並微調自訂模型,使用你喜愛的框架,獲得最先進的效率、效能與品質。

開始

利用我們的快速入門指南,幾分鐘內完成你的第一個工作負載。

開始 描述
🚀 CLI 快速啟動 是從 Slurm 或 Kubernetes 叢集來的嗎? 從終端機訓練 AI 執行時,只需幾分鐘。
📓 筆記本快速入門 幾秒鐘內將筆電連接到 GPU 並互動開發......
⚡ 雷 來自射線星團? 在 AI 執行時執行 Ray 並支援儀表板。
🧭 概述 兩分鐘內了解 AI 執行環境的關鍵資訊:可用的 GPU、運作方式以及限制。

功能

AI Runtime 是一個全端 GPU 平台,具備多種連接 GPU 的方式、內建可觀察性與除錯工具,以及預先建置的環境。

連接無伺服器 GPU:無論你工作地點,都能接觸到無伺服器 GPU。

Feature 描述
Notebooks 將筆記型電腦連接到無伺服器 GPU 運算,互動式開發,無需叢集設置。
透過 SSH 的 IDE 從你的 IDE 或終端機透過 SSH 隧道直接連接 GPU 節點。
AI 執行時 CLI 從筆電提交並管理分散式 GPU 訓練工作,使用 YAML 工作設定。
Ray 在無伺服器 GPU 運算上執行 Ray Core、Ray Data、Ray Train 和 Ray Tune。

管理相依性:控制你的工作負載所搭配的 Python 和系統函式庫。

Feature 描述
預建環境 從最簡的標準環境或預先載入機器學習框架的 Databricks AI 環境開始。
Docker 支援 帶上你自己的容器映像檔,用自訂相依堆疊來執行工作負載。

將資料載入 GPU:有效率地將訓練資料傳送給 GPU。

Feature 描述
高效資料載入器 從 Unity 目錄卷中串流資料,搭配為高 GPU 利用率打造的容錯載入器。

除錯與可觀察性:追蹤實驗、檢查輸出並診斷故障。

Feature 描述
深度學習的 MLflow 用 MLflow 追蹤實驗、指標和執行,並將模型檢查點存到 Unity 目錄卷中。
日誌檢視器 在程式碼執行時查看訓練輸出並監控 GPU 資源使用。
使用代理程式除錯 使用 Genie Code 來產生訓練程式碼、解決環境問題及除錯 GPU 故障。

排程與即時服務:從互動式開發轉向排程工作與端點。

Feature 描述
生產化你的工作 部署使用宣告式自動化套件的訓練程式碼、排程執行,並建立多工 GPU 與 CPU 工作流程。
服務你的模特兒 將訓練好的模型部署在可擴展的端點後方,並搭配 Model Serving。

Examples

端對端複製範例,並在 AI 執行時中幾分鐘內執行,無論是從 CLI 或筆記本中執行。

Example 描述
雷伊範例 把你現有的 Ray 專案拿出來,在 AI 執行時上幾分鐘就能跑。
訓練表格式推薦模型 訓練深度學習推薦模型,例如雙塔架構。
電腦視覺 GPU 上的物件偵測與影像分類工作負載。
經典機器學習 GPU 加速的 XGBoost、時間序列預測及其他經典機器學習任務。
微調OSS LLM 透過 LoRA、QLoRA 或完整微調,微調開源大型語言模型。

瞭解更多資訊

尋找有用內容:最新產品更新以及 AI 執行環境的運作方式。

Resource 描述
產品更新 請參閱最新的 AI Runtime 產品更新與公告。
AI 執行環境的運作原理 閱讀 Databricks 如何讓 GPU 在 AI 執行時中保持可靠性。