Пакетный вывод с помощью Ray Data и vLLM

Important

Эта функция доступна в общедоступной предварительной версии.

В этом примере выполняется пакетный инференс LLM в офлайн-режиме с помощью Ray Data и vLLM на 8 узлах A10. Bootstrap-скрипт запускает кластер Ray на всех узлах, после чего драйвер использует API LLM в Ray Data (ray.data.llm), чтобы запустить по одной реплике vLLM на каждом узле и пропустить через них набор данных с запросами, записывая сгенерированный текст в том Unity Catalog в формате Parquet.

Она использует публичную модель (Qwen2.5-7B-Instruct), поэтому работает как есть без токена Hugging Face.

Рабочая нагрузка выполняет следующие действия:

  • Загружает локальный проект с помощью code_source: snapshot.
  • Запускает лучевую головку на узле 0, соединяет 7 рабочих узлов, затем запускает драйвер пакетного вывода.
  • Используется ray.data.llm для запуска одной реплики vLLM на узел и параллельной обработки запросов.
  • Записывает запросы и созданные выходные данные в том каталога Unity в виде Parquet.

Необходимые условия

Структура проекта

Создайте каталог со следующими файлами.

ray_batch_inference/
├── train.yaml            # air workload config (inline dependencies + Ray bootstrap)
└── batch_inference.py    # Ray Data + vLLM batch inference driver

Шаг 1. Напишите YAML-файл рабочей нагрузки

train.yaml запрашивает 8 GPU_1xA10 узлов. Зависимости объявляются непосредственно под environment (с клиентским образом version), а command запускает кластер Ray на всех узлах, а затем драйвер, поэтому рабочей нагрузке не требуется отдельный файл зависимостей или скрипт запуска.

vLLM отсутствует в базовом образе, поэтому он устанавливается прямо здесь вместе с тремя жёстко закреплёнными зависимостями, которые нужны узлам GPU: hf_transfer (базовый образ включает быстрые загрузки из Hugging Face и ожидает наличие этого пакета), более новая версия fsspec (в базовом образе поставляется старая версия, которая ломает загрузку), и закреплённая версия opencv-python-headless (vLLM подтягивает OpenCV, а его wheel-пакет по умолчанию вызывает сбой самопроверки OpenSSL FIPS на узлах GPU).

Задайте OUTPUT_PATH для тома каталога Unity, на который можно написать. Установите NUM_GPUS то же значение, что и num_accelerators.

experiment_name: air-ray-batch-inference

environment:
  version: '5'
  dependencies:
    - ray[data]==2.56.1
    - vllm
    - datasets>=3.0
    - huggingface_hub>=0.34
    # The base image sets HF_HUB_ENABLE_HF_TRANSFER=1; install the package it expects
    # so model and dataset downloads don't error out.
    - hf_transfer
    # The base image ships fsspec 2023.5.0, which is too old for modern
    # huggingface_hub and breaks dataset/model downloads. Pin a newer fsspec.
    - fsspec>=2024.6.1
    # vLLM pulls in opencv; its default wheel crashes the OpenSSL FIPS self-test
    # on the GPU nodes. This pinned headless build avoids the crash.
    - opencv-python-headless==4.12.0.88

# 8 A10 nodes, one GPU each. Ray Data runs one vLLM replica per node.
compute:
  num_accelerators: 8
  accelerator_type: GPU_1xA10

code_source:
  type: snapshot
  snapshot:
    root_path: .

command: |
  cd $CODE_SOURCE_PATH
  RAY_HEAD_PORT=6379
  GPUS_PER_NODE=${LOCAL_WORLD_SIZE:-1}
  if [ "${NODE_RANK:-0}" = "0" ]; then
    echo "NODE_RANK=0: starting Ray head with $GPUS_PER_NODE GPU(s)..."
    ray start --head --port=$RAY_HEAD_PORT --num-gpus="$GPUS_PER_NODE" --dashboard-host=0.0.0.0
    python batch_inference.py
    ray stop
  else
    echo "NODE_RANK=$NODE_RANK: connecting to Ray head at $MASTER_ADDR:$RAY_HEAD_PORT..."
    for i in $(seq 1 12); do
      if ray start --address="$MASTER_ADDR:$RAY_HEAD_PORT" --num-gpus="$GPUS_PER_NODE" --block 2>/dev/null; then
        break
      fi
      echo "Attempt $i failed, retrying in 5s..."
      sleep 5
    done
  fi

max_retries: 0
timeout_minutes: 60
env_variables:
  NCCL_SOCKET_IFNAME: eth0
  # Unity Catalog volume where results land as Parquet. Replace with your volume.
  OUTPUT_PATH: /Volumes/main/default/air_examples/ray_batch_inference
  NUM_GPUS: '8' # must match num_accelerators

Однострочная команда command запускает головной узел Ray, используя GPU узла 0, затем запускает драйвер с помощью python batch_inference.py, после чего останавливает кластер. Рабочие узлы присоединяются к головному узлу, используя MASTER_ADDR и NODE_RANK, которые автоматически задаются платформой.

Шаг 2. Определить драйвер пакетного инференса

batch_inference.py создает набор данных Ray из промптов, настраивает процессор vLLM с помощью ray.data.llm и записывает результаты. concurrency — это количество реплик vLLM, которые Ray Data запускает параллельно. Драйвер ждёт, пока все узлы соединятся, прежде чем считывать количество GPU, поэтому используется каждый узел:

import os
import time

import ray
from ray.data.llm import build_processor, vLLMEngineProcessorConfig

ray.init(address="auto")
num_gpus = int(os.environ["NUM_GPUS"])
for _ in range(60):
    if int(ray.cluster_resources().get("GPU", 0)) >= num_gpus:
        break
    time.sleep(5)
total_gpus = int(ray.cluster_resources().get("GPU", 0))
if total_gpus < num_gpus:
    raise SystemExit(f"Expected {num_gpus} GPU(s) but Ray only sees {total_gpus}.")

config = vLLMEngineProcessorConfig(
    model_source="Qwen/Qwen2.5-7B-Instruct",
    engine_kwargs={"max_model_len": 4096, "tensor_parallel_size": 1},
    concurrency=total_gpus,   # one vLLM replica per GPU in the cluster
    batch_size=64,
)

processor = build_processor(
    config,
    preprocess=lambda row: dict(
        messages=[{"role": "user", "content": row["instruction"]}],
        sampling_params=dict(max_tokens=256, temperature=0.7),
    ),
    postprocess=lambda row: dict(instruction=row["instruction"], output=row["generated_text"]),
)

out = processor(ds)       # ds is a Ray Dataset with an "instruction" column
out.write_parquet(OUTPUT_PATH)

preprocess преобразует каждую входную строку в запрос чата и postprocess сохраняет столбцы. Ray Data добавляет generated_text столбец с выходными данными модели. Полный скрипт находится в скрипте полного драйвера в конце этой страницы.

Для более крупных моделей задайте tensor_parallel_size, чтобы разбить одну реплику на несколько GPU, и разделите значение total_gpus на это число, чтобы реплики по-прежнему заполняли кластер, например concurrency=total_gpus // 2 с tensor_parallel_size=2.

Шаг 3: Отправьте запуск

air run -f train.yaml --dry-run
air run -f train.yaml --watch

Шаг 4. Проверка выполнения

air get run <run-id>
air logs <run-id>

В журналах отображаются показатели пропускной способности промпта и генерации для ядра vLLM во время выполнения пакета, а затем — строка Wrote <n> rows, когда записываются выходные данные.

Куда попадают результаты

Драйвер записывает один набор данных Parquet в OUTPUT_PATH том с столбцом instruction и столбцом output . Считайте это обратно с помощью Spark или pandas, например spark.read.parquet(OUTPUT_PATH).

Полный скрипт драйвера

Полный текст batch_inference.py для копирования и вставки:

#!/usr/bin/env python3
"""Offline batch inference with Ray Data + vLLM across 8 A10 nodes.

The workload `command` starts a Ray head on node 0 and joins 7 worker nodes, each
contributing 1 GPU. Ray Data's LLM API (`ray.data.llm`) launches one vLLM replica
per GPU and streams a dataset of prompts through them, then writes the generated text
to a Unity Catalog volume as Parquet.

Uses a public model (no Hugging Face token required) so the example runs as-is.
"""

import os
import time

import ray
from datasets import load_dataset
from ray.data.llm import build_processor, vLLMEngineProcessorConfig

MODEL_SOURCE = "Qwen/Qwen2.5-7B-Instruct"
NUM_PROMPTS = 1000
# Unity Catalog volume path where results land as Parquet. Set this in train.yaml.
OUTPUT_PATH = os.environ.get("OUTPUT_PATH", "/Volumes/main/default/air_examples/ray_batch_inference")


def build_prompts():
    """Build a Ray Dataset of prompts from a public instruction dataset."""
    raw = load_dataset("tatsu-lab/alpaca", split=f"train[:{NUM_PROMPTS}]")
    items = []
    for row in raw:
        instruction = row["instruction"]
        if row.get("input"):
            instruction = f"{instruction}\n\n{row['input']}"
        items.append({"instruction": instruction})
    return ray.data.from_items(items)


def main():
    ray.init(address="auto")
    num_gpus = int(os.environ["NUM_GPUS"])
    for _ in range(60):
        if int(ray.cluster_resources().get("GPU", 0)) >= num_gpus:
            break
        time.sleep(5)
    total_gpus = int(ray.cluster_resources().get("GPU", 0))
    if total_gpus < num_gpus:
        raise SystemExit(
            f"Expected {num_gpus} GPU(s) but Ray only sees {total_gpus}; "
            "check GPU discovery / node join on all nodes."
        )
    print(f"Ray cluster ready: {total_gpus} GPU(s)", flush=True)

    ds = build_prompts()

    # vLLM engine config. concurrency = number of replicas Ray Data runs in parallel;
    # one per GPU in the cluster here. engine_kwargs are passed through to the vLLM engine.
    config = vLLMEngineProcessorConfig(
        model_source=MODEL_SOURCE,
        engine_kwargs={
            "max_model_len": 4096,
            "tensor_parallel_size": 1,
            "enable_chunked_prefill": True,
        },
        concurrency=total_gpus,
        batch_size=64,
    )

    # preprocess maps each input row to a chat request; postprocess keeps the columns
    # we want to persist. ray.data.llm adds a `generated_text` column.
    processor = build_processor(
        config,
        preprocess=lambda row: dict(
            messages=[
                {"role": "system", "content": "You are a helpful assistant."},
                {"role": "user", "content": row["instruction"]},
            ],
            sampling_params=dict(max_tokens=256, temperature=0.7),
        ),
        postprocess=lambda row: dict(
            instruction=row["instruction"],
            output=row["generated_text"],
        ),
    )

    # materialize once so the write and the sample print don't re-run inference.
    out = processor(ds).materialize()
    out.write_parquet(OUTPUT_PATH)
    print(f"Wrote {out.count()} rows to {OUTPUT_PATH}", flush=True)

    for row in out.take(2):
        print("INSTRUCTION:", row["instruction"][:120], flush=True)
        print("OUTPUT:", row["output"][:200], flush=True)

    ray.shutdown()


if __name__ == "__main__":
    main()

Дальнейшие действия