Ray für KI-Laufzeitumgebungen

Important

Dieses Feature befindet sich in der Public Preview.

Hinweis

Diese Seite behandelt Ray auf AI Runtime. Wenn du Ray auf Databricks Classic Compute mit Databricks Runtime ML verwendest, siehe Ray on Databricks.

Ray ist ein Open Source-Framework zur Skalierung von Python-Workloads. Man kann Ray-Cluster erstellen und Ray-Anwendungen auf AI Runtime ausführen, wobei serverlose GPU-Compute automatisch die Infrastrukturbereitstellung übernimmt.

Ray in Notizbüchern verwenden

Wenn Ihr Notebook mit AI Runtime-GPU-Compute verbunden ist, verwenden Sie ray_init() aus dem Paket serverless_gpu, um Ray auf der verbundenen Recheninstanz zu starten:

from serverless_gpu import ray_init

ray_init()

ray_init() konfiguriert das Ray-Dashboard für den Zugriff über den Databricks-Treiber-Proxy und druckt die Dashboard-URL im Notebook-Output aus. Nutze das Dashboard, um Ray-Jobs, Aufgaben und Ressourcenverbrauch während deines Codes zu inspizieren.

Hinweis

ray_init() Benötigt Umgebungsversion 5 oder neuer. Databricks AI v6 enthält Ray. Wenn du Standard v6 verwendest, installiere Ray, bevor du ray_init() aufrufst.

Notebook-Beispiele

Beispiel Description
Ray Core Hello World Reiche asynchrone GPU-Aufgaben auf Attached Compute ein, inspiziere die Planung im Ray-Dashboard und rufe die Ergebnisse ab.
Qwen2.5-32B Batch-Inferenz mit Ray Data und vLLM Führe mehrsprachige Batch-Inferenz mit acht persistenten vLLM-Replikaten auf 8 H100-GPUs aus und speichere die Ergebnisse als Parquet im Unity-Katalog.

Verwenden Sie Ray mit der KI-Laufzeit-CLI

Die AI Runtime CLI unterstützt Ray in Einzelknoten- und Mehrknotenkonfigurationen. Fügen Sie ein Bootstrap-Skript unter dem command des Workloads ein, das den Ray-Cluster startet und die Head- und Worker-Knoten beim Starten des Workloads koordiniert. Die Ray-Hello-World-Beispiele zeigen dieses Muster.

AI Runtime unterstützt die Kernbibliotheken von Ray, darunter Ray Core, Ray Data, Ray Train und Ray Tune. In der Standardumgebung fügen Sie ray oder den entsprechenden Zusatz (ray[data], ray[train] oder ray[tune]) den Abhängigkeiten Ihrer Workload hinzu. Die Databricks-KI-Umgebung beinhaltet Ray.

CLI-Beispiele

Beispiel Description
Ray-Hello-World-Beispiele Minimale Einzel- und Mehrknoten-Beispiele für Ray Core, Ray Train, Ray Data und Ray Tune, einschließlich des Cluster-Bootstrap-Musters.
Verteiltes Training mit Ray Train Feinjustieren Sie ein großes Sprachmodell über mehrere Knoten hinweg mit Ray Train und PyTorch.
Batch-Inferenz mit Ray Data und vLLM Führen Sie groß angelegte Batch-Inferenz mit Ray Data für verteiltes Datenladen und vLLM für effiziente Modellbereitstellung durch.
Hyperparametersuche mit Ray Tune Suchen Sie mit Ray Tune die Hyperparameter für die LoRA-Feinabstimmung für Qwen2.5, führen Sie pro GPU einen Versuch aus, und beenden Sie leistungsschwache Versuche mithilfe des ASHA-Schedulers frühzeitig.