多GPU分散式訓練

這很重要

這項功能位於 測試版 (Beta) 中。 工作區管理員可以從 「預覽 」頁面控制對此功能的存取。 請參閱 管理 Azure Databricks 預覽。

這些筆記本可在 AI 執行階段上將模型訓練擴展至多個 GPU 和節點。 它們涵蓋三種主要的平行處理技術:DDP、FSDP 和 DeepSpeed ZeRO,並使用 H100 GPU 上的 serverless_gpu Python API。

備註

H100 GPU 支援多 GPU 分散式訓練。

選擇你的平行運算技巧

根據你的模型大小、可用 GPU 記憶體和效能需求選擇平行處理技術。 下表比較了這些選項。

技巧 使用時機
DDP(分散式資料平行) 完整模型可容納於單一 GPU 記憶體中;需要擴展資料吞吐量
FSDP(完全分片資料平行) 非常大型的模型,無法放進單一 GPU 記憶體
DeepSpeed ZeRO 具備先進記憶體優化需求的大型模型

關於每種技術的詳細資訊,請參見 DDP、 FSDP和 DeepSpeed。

如需建議與模式,幫助你的訓練流程更有效率且具韌性,請參閱 績效與韌性指南。

依技術與框架分類的範例筆記本

下表依照你使用的框架/函式庫及所應用的平行處理技巧來組織範例筆記本。 同一格子中可能會出現多個筆記本。

框架/函式庫 DDP 範例 FSDP 範例 DeepSpeed 範例
PyTorch(原生) 簡單 MLP 神經網路
RetinaNet 影像偵測
10M 參數變壓器 —
Huggingface TRL 調整 GPT OSS 20B 微調 GPT OSS 120B 模型 微調 Llama 3.2 1B
懶惰 微調 Llama 3.2 3B — —
蠑螈 微調 Olmo3 7B — —
閃電 雙塔推薦系統 — —

開始

請參考以下教學,開始使用無伺服器 GPU Python 函式庫進行分散式訓練:

Tutorial 說明
搭載 H100 GPU 的 AI 執行時 學習如何使用 Databricks AI Runtime 搭配 H100 加速器,使用 serverless_gpu Python 函式庫來執行分散式 GPU 工作負載。