Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Important
Fitur ini ada di Pratinjau Umum.
Kirimkan job pelatihan pertama Anda dengan AI Runtime CLI dalam tiga langkah: tulis konfigurasi train.yaml, jalankan dengan air run, lalu periksa hasil eksekusinya. Sebelum memulai, instal CLI dan konfigurasikan autentikasi.
Langkah 1: Tulis konfigurasi YAML
Buat train.yaml yang menjelaskan beban kerja. Konfigurasi minimal memerlukan nama eksperimen, spesifikasi komputasi, dan perintah. Perintah di bawah ini berjalan tanpa kode lokal apa pun, sehingga Anda dapat segera mengirimkan eksekusi pertama Anda:
experiment_name: my-first-air-run
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
command: echo "hello AIR!"
Jalankan kode Anda sendiri
Untuk menjalankan skrip pelatihan lokal, tambahkan environment blok yang mencantumkan dependensi Python Anda dan code_source blok yang mengunggah kode lokal Anda. Tempatkan skrip Anda bersama train.yaml:
my-project/
├── train.yaml
└── train.py
experiment_name: my-first-air-run
environment:
version: '4'
dependencies:
- torch
- transformers
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
code_source:
type: snapshot
snapshot:
root_path: .
command: python $CODE_SOURCE_PATH/train.py
Konfigurasi ini menginstal dependensi yang tercantum, mengunggah direktori saat ini (root_path: .), dan berjalan train.py pada satu GPU A10.
$CODE_SOURCE_PATH mengarah ke lokasi kode yang diunggah pada node jarak jauh. Databricks merekomendasikan menggunakan ini daripada menetapkan jalur secara hardcode.
environment.version memilih versi lingkungan GPU tanpa server dan bersifat opsional (default ke '4'). Untuk semua versi yang tersedia, lihat Versi lingkungan tanpa server.
Untuk referensi bidang lengkap, lihat Referensi YAML Beban Kerja.
Langkah 2: Kirim proses
Kirimkan beban kerja:
air run --file train.yaml
CLI mengunggah kode lokal Anda (jika Anda mengonfigurasi code_source), mengirimkan pekerjaan, dan mencetak ID eksekusi. Gunakan ID tersebut untuk memeriksa, menonton, dan membatalkan eksekusi dalam perintah selanjutnya.
Pengajuan membuat sebuah run dalam eksperimen MLflow yang disebutkan di experiment_name (satu eksperimen dapat berisi banyak run). Run tersebut mencatat metrik, parameter, artefak, dan log beban kerja tersebut, yang semuanya dapat dilihat di antarmuka pengguna MLflow di ruang kerja. Log juga tersedia di luar MLflow: streaming ke terminal atau file Anda, atau unduh nanti dengan air logs (lihat Langkah 3).
Untuk menonton log hingga selesai, tambahkan --watch:
air run --file train.yaml --watch
Langkah 3: Periksa proses yang berjalan
Periksa status:
air get run <run-id>
Output mencakup tautan yang dapat diklik ke eksperimen MLflow milik run tersebut dan run MLflow di UI ruang kerja.
Alirkan atau unduh log:
air logs <run-id>
air logs <run-id> --node 2
air logs <run-id> --download-to ./logs/
Beban kerja terdistribusi berjalan di beberapa simpul. Secara bawaan, air logs mengalir dari simpul 0. Untuk melihat log dari node tertentu, sertakan --node. Gunakan --download-to untuk menulis log ke direktori lokal alih-alih mengalirkannya.
Mencantumkan eksekusi terbaru:
air list runs --limit 10
air list runs --active
Batalkan eksekusi:
air cancel <run-id>
Pola umum
Ambil alih bidang YAML dari baris perintah:
air run --file train.yaml --override compute.num_accelerators=32 timeout_minutes=120
Validasi konfigurasi tanpa mengirimkan:
air run --file train.yaml --dry-run
Buat permintaan dapat dicoba ulang dengan aman:
air run --file train.yaml --idempotency-key my-unique-key
Jika kunci yang sama telah digunakan sebelumnya, proses eksekusi yang ada akan dikembalikan alih-alih membuat proses eksekusi baru.