Important
この機能は パブリック プレビュー段階です。
AI Runtimeは、Databricksが提供するサーバーレスGPU計算サービスで、 ディープラーニング ワークロード向けに設計されています。 AI ランタイムを使用して、お気に入りのフレームワークを使用してカスタム モデルをトレーニングおよび微調整し、最先端の効率、パフォーマンス、品質を得ることができます。
概要
クイックスタートガイドを使って、最初の作業を数分で実行できます。
| 概要 | Description |
|---|---|
| 🚀 CLI quickstart | SlurmやKubernetesクラスタから来ていますか? 端末から数分でAIランタイムを学習できます。 |
| 📓 ノートクイックスタート | ノートパソコンを数秒でGPUに接続し、インタラクティブに開発できます。 |
| ⚡ レイ | レイクラスターから来るのですか? ダッシュボード対応のAIランタイムでRayを動かしてください。 |
| 🧭 概要 | 2分間でAIランタイムの重要なポイントを学びましょう:利用可能なGPU、その仕組み、そして制限事項。 |
機能
AIランタイムはフルスタックのGPUプラットフォームであり、GPUへの多様な接続方法、組み込みの観測可能性およびデバッグツール、そして事前構築された環境を備えています。
サーバーレスGPUに接続:職場からサーバーレスGPUにアクセスできます。
| 特徴 | Description |
|---|---|
| ノートブック | ノートブックをサーバーレスGPUコンピュートに接続し、クラスター構成なしでインタラクティブに開発できます。 |
| SSH経由のIDE | IDEやターミナルからSSHトンネル経由で直接GPUノードに接続してください。 |
| AI Runtime CLI | ノートパソコンからYAMLジョブ設定を使って分散GPUトレーニングジョブを提出・管理します。 |
| Ray | サーバーレスGPUコンピュートでRay Core、Ray Data、Ray Train、Ray Tuneを実行します。 |
依存関係の管理:ワークロードが動作するPythonやシステムライブラリを制御します。
| 特徴 | Description |
|---|---|
| 事前構築環境 | 最低限のStandard環境か、MLフレームワークをあらかじめインストールしたDatabricksのAI環境から始めましょう。 |
| Dockerサポート | カスタム依存スタックでワークロードを実行するために、独自のコンテナイメージを持ち込むのも良いでしょう。 |
GPUへのデータ読み込み:効率的にトレーニングデータをGPUに送りましょう。
| 特徴 | Description |
|---|---|
| 効率的なデータローダー | 高いGPU利用率を実現するよう設計された耐障害性ローダーを使用して、Unity Catalogボリュームからデータをストリーミングできます。 |
デバッグと観察可能性:実験の追跡、出力の検査、故障の診断。
| 特徴 | Description |
|---|---|
| ディープラーニングのためのMLflowです | MLflowで実験、指標、実行を追跡し、モデルチェックポイントをUnityカタログのボリュームに保存します。 |
| ログビューア | トレーニング出力を表示し、コードが実行されている間にGPUリソースの使用状況を監視できます。 |
| エージェントによるデバッグ | Genie Codeを使ってトレーニングコードの生成、環境の問題解決、GPUの故障のデバッグを行います。 |
スケジューリングとリアルタイムサービス:インタラクティブ開発からスケジュールされたジョブやエンドポイントへと移行。
| 特徴 | Description |
|---|---|
| 仕事を生産化しましょう | 宣言的自動化バンドルを用いたトレーニングコードをデプロイし、実行をスケジュールし、マルチタスクのGPUとCPUワークフローを構築しましょう。 |
| モデルにサービスを提供しましょう | 訓練済みのモデルをModel Servingを使ったスケーラブルなエンドポイントの背後に展開します。 |
Examples
エンドツーエンドの例をクローンし、CLI やノートブックから数分で AI Runtime 上で実行できます。
| Example | Description |
|---|---|
| レイの例 | 既存のRayプロジェクトをAI Runtimeで数分で実行できます。 |
| 表形式の推薦モデルの訓練 | 2タワーアーキテクチャなどのディープラーニングレコメンデーションモデルを訓練します。 |
| コンピュータビジョン | GPU上の物体検出および画像分類のワークロード。 |
| 古典的な機械学習 | GPU加速によるXGBoost、時系列予測、その他のクラシックなMLタスク。 |
| OSS LLMのファインチューニング | LoRA、QLoRA、またはフルファインチューニングでオープンソースの大規模言語モデルを微調整できます。 |
詳細情報
役立つコンテンツを見つけましょう:最新の製品アップデートやAIランタイムの仕組みなど。
| Resource | Description |
|---|---|
| 製品の更新プログラム | 最新のAIランタイム製品のアップデートや発表をご覧ください。 |
| AIランタイムの内部構造 | DatabricksがどのようにAIランタイム全体でGPUの信頼性を維持しているかをご覧ください。 |