Panduan Memulai Cepat AI Runtime CLI

Important

Fitur ini ada di Pratinjau Umum.

Kirimkan job pelatihan pertama Anda dengan AI Runtime CLI dalam tiga langkah: tulis konfigurasi train.yaml, jalankan dengan air run, lalu periksa hasil eksekusinya. Sebelum memulai, instal CLI dan konfigurasikan autentikasi.

Langkah 1: Tulis konfigurasi YAML

Buat train.yaml yang menjelaskan beban kerja. Konfigurasi minimal memerlukan nama eksperimen, spesifikasi komputasi, dan perintah. Perintah di bawah ini berjalan tanpa kode lokal apa pun, sehingga Anda dapat segera mengirimkan eksekusi pertama Anda:

experiment_name: my-first-air-run
compute:
  num_accelerators: 1
  accelerator_type: GPU_1xA10
command: echo "hello AIR!"

Jalankan kode Anda sendiri

Untuk menjalankan skrip pelatihan lokal, tambahkan environment blok yang mencantumkan dependensi Python Anda dan code_source blok yang mengunggah kode lokal Anda. Tempatkan skrip Anda bersama train.yaml:

my-project/
├── train.yaml
└── train.py
experiment_name: my-first-air-run
environment:
  version: '4'
  dependencies:
    - torch
    - transformers
compute:
  num_accelerators: 1
  accelerator_type: GPU_1xA10
code_source:
  type: snapshot
  snapshot:
    root_path: .
command: python $CODE_SOURCE_PATH/train.py

Konfigurasi ini menginstal dependensi yang tercantum, mengunggah direktori saat ini (root_path: .), dan berjalan train.py pada satu GPU A10. $CODE_SOURCE_PATH mengarah ke lokasi kode yang diunggah pada node jarak jauh. Databricks merekomendasikan menggunakan ini daripada menetapkan jalur secara hardcode. environment.version memilih versi lingkungan GPU tanpa server dan bersifat opsional (default ke '4'). Untuk semua versi yang tersedia, lihat Versi lingkungan tanpa server.

Untuk referensi bidang lengkap, lihat Referensi YAML Beban Kerja.

Langkah 2: Kirim proses

Kirimkan beban kerja:

air run --file train.yaml

CLI mengunggah kode lokal Anda (jika Anda mengonfigurasi code_source), mengirimkan pekerjaan, dan mencetak ID eksekusi. Gunakan ID tersebut untuk memeriksa, menonton, dan membatalkan eksekusi dalam perintah selanjutnya.

Pengajuan membuat sebuah run dalam eksperimen MLflow yang disebutkan di experiment_name (satu eksperimen dapat berisi banyak run). Run tersebut mencatat metrik, parameter, artefak, dan log beban kerja tersebut, yang semuanya dapat dilihat di antarmuka pengguna MLflow di ruang kerja. Log juga tersedia di luar MLflow: streaming ke terminal atau file Anda, atau unduh nanti dengan air logs (lihat Langkah 3).

Untuk menonton log hingga selesai, tambahkan --watch:

air run --file train.yaml --watch

Langkah 3: Periksa proses yang berjalan

Periksa status:

air get run <run-id>

Output mencakup tautan yang dapat diklik ke eksperimen MLflow milik run tersebut dan run MLflow di UI ruang kerja.

Alirkan atau unduh log:

air logs <run-id>
air logs <run-id> --node 2
air logs <run-id> --download-to ./logs/

Beban kerja terdistribusi berjalan di beberapa simpul. Secara bawaan, air logs mengalir dari simpul 0. Untuk melihat log dari node tertentu, sertakan --node. Gunakan --download-to untuk menulis log ke direktori lokal alih-alih mengalirkannya.

Mencantumkan eksekusi terbaru:

air list runs --limit 10
air list runs --active

Batalkan eksekusi:

air cancel <run-id>

Pola umum

Ambil alih bidang YAML dari baris perintah:

air run --file train.yaml --override compute.num_accelerators=32 timeout_minutes=120

Validasi konfigurasi tanpa mengirimkan:

air run --file train.yaml --dry-run

Buat permintaan dapat dicoba ulang dengan aman:

air run --file train.yaml --idempotency-key my-unique-key

Jika kunci yang sama telah digunakan sebelumnya, proses eksekusi yang ada akan dikembalikan alih-alih membuat proses eksekusi baru.

Sumber daya tambahan