使用 Genie Code 搭配 AI 執行環境

Important

這項功能目前處於 公開預覽版。

Genie Code 可協助你在連線至 AI Runtime 的筆記本中開發及對深度學習工作負載進行疑難排解。 它能產生分散式訓練程式碼、解決環境與相依性問題,並調查 GPU 工作負載故障。

Genie Code 在 AI Runtime 筆記本中建立並執行分散式 CNN 訓練工作負載,並在八顆 H100 GPU 上運作。

Requirements

若要將 Genie Code 與 AI 執行階段一同使用:

開始

  1. 開啟 Azure Databricks 筆記本。

  2. 將筆記本連接到 AI 執行環境。 請參考「 從筆記本連接 AI 執行環境」。

  3. 打開精靈代碼視窗。

  4. 描述你想要開發的工作量或你想解決的問題。

  5. 在批准前,請審查擬議的計畫、法規變更及相關行動。

    Important

    精靈密碼也會犯錯。 執行前,先審查已產生的程式碼、環境變更及其他建議的行動。 有些診斷需要額外的日誌或工作量背景。

Genie Code 能幫助什麼?

開發分散式訓練工作負載

Genie Code 可以產生或更新 AI 執行時的訓練程式碼。 它能幫助你選擇合適的 PyTorch 分散式策略,使用 @distributed 套件中的 serverless_gpu API,並套用 AI 執行時模式進行資料載入、檢查點及機器學習流程追蹤。 關於 API 細節與範例,請參見 「分散式筆記本訓練」。

解決環境與相依性問題

Genie Code 可以檢查目前環境,區分套件相容性失敗與程式碼或 API 變更,並建議針對性的修正。 它也能幫助你根據工作負載的依賴性,在 Databricks AI 和標準環境之間做出選擇。 關於可用環境的資訊,請參見 「設定你的環境」。

除錯 GPU 與分散式工作負載

Genie Code 可以利用筆記本輸出和可用日誌來調查分散式訓練失敗、通訊錯誤、訓練當機及 GPU 記憶體問題。 它能協助辨識原始故障,並將其與其他階級的下游錯誤區分開來。 關於查看分散式訓練日誌的資訊,請參閱 實驗追蹤與可觀察性。

範例提示

開發分散式訓練工作負載

  • 「更新此筆記本,在 AI 執行時中對所有八顆 H100 GPU 執行分散式訓練。」
  • 檢視這份分散式訓練筆記本,並修正其中對 serverless_gpu 與 MLflow 的使用方式。
  • 「將此訓練工作量調整為 AI 執行環境,並說明重要的變更。」

解決環境與相依性問題

  • 「這本筆記本在我安裝新套件後就壞了。 檢查環境,判斷問題是相依性問題還是程式碼 API 變更。」
  • 「這個工作負載應該使用 Databricks AI 還是標準環境? 在更改任何東西之前,先檢視其相依並建議環境。」
  • 「診斷此套件相容性錯誤,並建議最小且適當的變更。」

除錯 GPU 與分散式工作負載

  • 「利用每個階級的可用輸出分析這次失敗的分散式訓練,找出根本原因。」
  • 為什麼這個分散式工作負載會卡住? 使用筆記本的輸出結果來建議下一個除錯步驟。
  • 「調查這個GPU記憶體故障,並建議有證據支持的下一步。」

其他資源