Important
この機能は パブリック プレビュー段階です。
このクイックスタートでは、ディープラーニング用のサーバーレスGPU計算であるAI Runtimeでコードを最速で実行する方法を紹介します。 ノートパソコンをGPUに接続して、クラスター設定なしで短いPyTorchのトレーニングステップを実行します。
Tip
- ノートブックを サーバーレスGPU に接続すれば、数分でGPU上で動作を開始します。
- まずは1xA10で開発を始め、その後、より大規模なモデルや分散トレーニング向けにスケールアップしましょう。
- クラスタのセットアップは不要で、標準環境にはすでに
torchが含まれています。
始める前の準備
ワークスペースはAI Runtimeを有効にし、サポートエリアに属している必要があります。 要件を参照してください。
ステップ1:ノートパソコンをGPUに接続する
- ノートブックを作成または開きます。
- ノートブック上部の計算ドロップダウンから「 Serverless GPU」を選択します。
- アクセラレーターフィールドで1xA10を選択してください。
- 「応募」をクリックしてから「確認」をクリックします。
Tip
開発や小規模なワークロードには、まずは1xA10から始めましょう。 GPUメモリやマルチGPU分散トレーニングが必要な場合は 、1台H100 や 8台H100 に切り替えましょう。 ハードウェア オプションを参照してください。
ステップ2:最初のGPUコードを実行します
ノートブックのセルでGPUが接続されているか確認するために以下の手順を実行し、1つのトレーニングステップを実行します:
import torch
# Confirm a GPU is attached.
print(torch.cuda.get_device_name(0))
# Run a minimal training step on the GPU.
model = torch.nn.Linear(10, 1).cuda()
optimizer = torch.optim.SGD(model.parameters(), lr=0.01)
x, y = torch.randn(32, 10).cuda(), torch.randn(32, 1).cuda()
loss = torch.nn.functional.mse_loss(model(x), y)
loss.backward()
optimizer.step()
print("loss:", loss.item())
今はサーバーレスGPUコンピュートで動作しています。
次のステップ
- AI Runtimeの例ノートブックからエンドツーエンドのノートブックをクローンします。
- ノートパソコンでの分散トレーニングで複数のGPUにスケールを広げましょう。
- ターミナルからAI Runtime CLIを使ってトレーニングジョブを送信してください。