Important
這項功能目前處於 公開預覽版。
備註
本頁介紹了 Ray 在 AI 執行環境上的應用。 如果你在 Databricks classic 運算中使用 Ray,搭配 Databricks 執行時機器學習,請參考 Ray 在 Databricks 上的應用。
Ray 是一個用於擴展 Python 工作負載的開放原始碼框架。 你可以建立 Ray 叢集並在 AI 執行環境上執行 Ray 應用程式,使用無伺服器的 GPU 運算,自動處理基礎設施配置。
在筆記本中使用 Ray
當您的筆記本已連線至 AI Runtime GPU 計算資源時,請使用 serverless_gpu 套件中的 ray_init(),在所附加的計算資源上啟動 Ray:
from serverless_gpu import ray_init
ray_init()
ray_init() 將 Ray 儀表板設定為透過 Databricks 驅動代理存取,並在筆記本輸出中列印儀表板 URL。 在程式碼執行時,利用儀表板檢查 Ray 的工作、任務和資源使用情況。
備註
ray_init() 需要環境版本 5 或更新。 Databricks AI v6 包含了 Ray。 如果你使用 Standard v6,請在呼叫 ray_init(). 前先安裝 Ray。
筆記本範例
| 範例 | Description |
|---|---|
| Ray Core Hello World | 在已連接的運算資源上提交非同步 GPU 任務,在 Ray 儀表板中檢視排程情況,並擷取結果。 |
| 使用 Ray Data 和 vLLM 進行 Qwen2.5-32B 批次推論 | 在 8 顆 H100 GPU 上執行多語言批次推論,使用八個持久的 vLLM 副本,並將結果儲存為 Unity 目錄中的 Parquet。 |
透過 AI Runtime CLI 使用 Ray
AI 執行時 CLI 支援 Ray 的單節點與多節點配置。 在工作負載的 command 下加入 bootstrap 指令碼,以在工作負載啟動時啟動 Ray 叢集,並協調 head 節點與 worker 節點。
Ray Hello World範例會逐步說明這種模式。
AI 執行時支援 Ray 的核心函式庫,包括 Ray Core、 Ray Data、 Ray Train 與 Ray Tune。 在標準環境中,將 ray 或對應的額外項目(ray[data]、ray[train] 或 ray[tune])新增至工作負載相依性。 Databricks 的 AI 環境包含 Ray。
CLI 範例
| 範例 | Description |
|---|---|
| Ray Hello 世界範例 | 以下是 Ray Core、Ray Train、Ray Data 及 Ray Tune 的最小單節點與多節點範例,包括叢集引導模式。 |
| 使用 Ray Train 進行分散式訓練 | 利用 Ray Train 和 PyTorch 微調跨多個節點的大型語言模型。 |
| 使用 Ray Data 與 vLLM 進行批次推論 | 使用雷線資料進行大規模批次推論,進行分散式資料載入,並以 vLLM 進行高效模型服務。 |
| 使用 Ray Tune 進行超參數搜尋 | 使用 Ray Tune 為 Qwen2.5 搜尋 LoRA 微調超參數,每個 GPU 執行一個試驗,並使用 ASHA 排程器提早停止表現不佳的試驗。 |