Краткое руководство по началу работы с интерфейсом командной строки среды выполнения ИИ

Important

Эта функция доступна в общедоступной предварительной версии.

Отправьте свое первое задание на обучение с помощью train.yaml CLI AI Runtime в три шага: напишите файл конфигурации, запустите его с помощью air run, а затем проверьте результаты запуска. Перед началом установите CLI и настройте аутентификацию.

Шаг 1: Напишите конфигурацию YAML

Создайте описание рабочей нагрузки train.yaml. Для минимальной конфигурации требуется имя эксперимента, спецификация вычислений и команда. Следующая команда выполняется без локального кода, поэтому вы можете отправить первый запуск сразу:

experiment_name: my-first-air-run
compute:
  num_accelerators: 1
  accelerator_type: GPU_1xA10
command: echo "hello AIR!"

Запуск собственного кода

Чтобы запустить локальный скрипт обучения, добавьте environment блок, который содержит список зависимостей Python и code_source блок, который отправляет локальный код. Поместите скрипт рядом с train.yaml:

my-project/
├── train.yaml
└── train.py
experiment_name: my-first-air-run
environment:
  version: '4'
  dependencies:
    - torch
    - transformers
compute:
  num_accelerators: 1
  accelerator_type: GPU_1xA10
code_source:
  type: snapshot
  snapshot:
    root_path: .
command: python $CODE_SOURCE_PATH/train.py

Эта конфигурация устанавливает перечисленные зависимости, загружает текущий каталог (root_path: .) и запускает train.py на одном графическом процессоре A10. $CODE_SOURCE_PATH указывает на путь к отправленному коду на удалённом узле. Databricks рекомендует использовать это вместо жесткой кодировки пути. environment.version выбирает версию среды GPU без сервера и является необязательной (по умолчанию '4'— ). Для всех доступных версий см. Версии среды.

Полное описание всех полей см. в справочнике по YAML для рабочей нагрузки.

Шаг 2: Отправьте запуск

Отправьте рабочую нагрузку:

air run --file train.yaml

Интерфейс командной строки отправляет локальный код (если вы настроили code_source), отправляет задание и выводит идентификатор выполнения. Используйте этот идентификатор для проверки, просмотра и отмены выполнения в последующих командах.

При отправке создается запуск в эксперименте MLflow, указанном в experiment_name (эксперимент может содержать много запусков). Этот запуск записывает метрики, параметры, артефакты и журналы рабочей нагрузки, доступные для просмотра в пользовательском интерфейсе MLflow рабочей области. Журналы также доступны за пределами MLflow: потоковая передача их в терминал или файл или скачивание их позже с помощью air logs (см. шаг 3).

Чтобы просмотреть журналы до завершения, добавьте --watch:

air run --file train.yaml --watch

Шаг 3. Проверка выполнения

Проверьте состояние:

air get run <run-id>

Выходные данные включают интерактивные ссылки на эксперимент MLflow запуска и на запуск MLflow в пользовательском интерфейсе рабочей области.

Транслировать или скачать журналы:

air logs <run-id>
air logs <run-id> --node 2
air logs <run-id> --download-to ./logs/

Распределённые рабочие нагрузки выполняются на нескольких узлах. По умолчанию air logs передаёт поток из узла 0. Чтобы просмотреть журналы с определенного узла, передайте --node. Используйте --download-to для записи журналов в локальный каталог вместо потоковой передачи.

Список последних запусков:

air list runs --limit 10
air list runs --active

Отменить запуск:

air cancel <run-id>

Распространенные шаблоны

Переопределите поля YAML из командной строки:

air run --file train.yaml --override compute.num_accelerators=32 timeout_minutes=120

Проверьте конфигурацию без отправки:

air run --file train.yaml --dry-run

Сделайте отправку безопасной для повторной попытки:

air run --file train.yaml --idempotency-key my-unique-key

Если тот же ключ уже использовался, возвращается существующий запуск, а не создаётся новый.

Дополнительные ресурсы