Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Important
Эта функция доступна в общедоступной предварительной версии.
Отправьте свое первое задание на обучение с помощью train.yaml CLI AI Runtime в три шага: напишите файл конфигурации, запустите его с помощью air run, а затем проверьте результаты запуска. Перед началом установите CLI и настройте аутентификацию.
Шаг 1: Напишите конфигурацию YAML
Создайте описание рабочей нагрузки train.yaml. Для минимальной конфигурации требуется имя эксперимента, спецификация вычислений и команда. Следующая команда выполняется без локального кода, поэтому вы можете отправить первый запуск сразу:
experiment_name: my-first-air-run
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
command: echo "hello AIR!"
Запуск собственного кода
Чтобы запустить локальный скрипт обучения, добавьте environment блок, который содержит список зависимостей Python и code_source блок, который отправляет локальный код. Поместите скрипт рядом с train.yaml:
my-project/
├── train.yaml
└── train.py
experiment_name: my-first-air-run
environment:
version: '4'
dependencies:
- torch
- transformers
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
code_source:
type: snapshot
snapshot:
root_path: .
command: python $CODE_SOURCE_PATH/train.py
Эта конфигурация устанавливает перечисленные зависимости, загружает текущий каталог (root_path: .) и запускает train.py на одном графическом процессоре A10.
$CODE_SOURCE_PATH указывает на путь к отправленному коду на удалённом узле. Databricks рекомендует использовать это вместо жесткой кодировки пути.
environment.version выбирает версию среды GPU без сервера и является необязательной (по умолчанию '4'— ). Для всех доступных версий см. Версии среды.
Полное описание всех полей см. в справочнике по YAML для рабочей нагрузки.
Шаг 2: Отправьте запуск
Отправьте рабочую нагрузку:
air run --file train.yaml
Интерфейс командной строки отправляет локальный код (если вы настроили code_source), отправляет задание и выводит идентификатор выполнения. Используйте этот идентификатор для проверки, просмотра и отмены выполнения в последующих командах.
При отправке создается запуск в эксперименте MLflow, указанном в experiment_name (эксперимент может содержать много запусков). Этот запуск записывает метрики, параметры, артефакты и журналы рабочей нагрузки, доступные для просмотра в пользовательском интерфейсе MLflow рабочей области. Журналы также доступны за пределами MLflow: потоковая передача их в терминал или файл или скачивание их позже с помощью air logs (см. шаг 3).
Чтобы просмотреть журналы до завершения, добавьте --watch:
air run --file train.yaml --watch
Шаг 3. Проверка выполнения
Проверьте состояние:
air get run <run-id>
Выходные данные включают интерактивные ссылки на эксперимент MLflow запуска и на запуск MLflow в пользовательском интерфейсе рабочей области.
Транслировать или скачать журналы:
air logs <run-id>
air logs <run-id> --node 2
air logs <run-id> --download-to ./logs/
Распределённые рабочие нагрузки выполняются на нескольких узлах. По умолчанию air logs передаёт поток из узла 0. Чтобы просмотреть журналы с определенного узла, передайте --node. Используйте --download-to для записи журналов в локальный каталог вместо потоковой передачи.
Список последних запусков:
air list runs --limit 10
air list runs --active
Отменить запуск:
air cancel <run-id>
Распространенные шаблоны
Переопределите поля YAML из командной строки:
air run --file train.yaml --override compute.num_accelerators=32 timeout_minutes=120
Проверьте конфигурацию без отправки:
air run --file train.yaml --dry-run
Сделайте отправку безопасной для повторной попытки:
air run --file train.yaml --idempotency-key my-unique-key
Если тот же ключ уже использовался, возвращается существующий запуск, а не создаётся новый.