Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Important
Dieses Feature befindet sich in der Public Preview.
Hinweis
Diese Seite behandelt Ray auf AI Runtime. Wenn du Ray auf Databricks Classic Compute mit Databricks Runtime ML verwendest, siehe Ray on Databricks.
Ray ist ein Open Source-Framework zur Skalierung von Python-Workloads. Man kann Ray-Cluster erstellen und Ray-Anwendungen auf AI Runtime ausführen, wobei serverlose GPU-Compute automatisch die Infrastrukturbereitstellung übernimmt.
Die AI Runtime CLI unterstützt Ray in Einzelknoten- und Mehrknotenkonfigurationen. Fügen Sie ein Bootstrap-Skript unter dem command des Workloads ein, das den Ray-Cluster startet und die Head- und Worker-Knoten beim Starten des Workloads koordiniert. Die Ray-Hello-World-Beispiele zeigen dieses Muster.
AI Runtime unterstützt die Kernbibliotheken von Ray, darunter Ray Core, Ray Data, Ray Train und Ray Tune. Installiere die ray-Bibliothek oder die relevante Ray-Erweiterung (ray[data], ray[train], ray[tune]) als Abhängigkeit für deinen Workload in der Databricks-Standardumgebung. Wenn du die Databricks-KI-Umgebung verwendest, ist ray vorinstalliert, aber Extras müssen separat installiert werden.
Beispiele
| Beispiel | Description |
|---|---|
| Ray-Hello-World-Beispiele (CLI) | Minimale Einzel- und Mehrknoten-Beispiele für Ray Core, Ray Train, Ray Data und Ray Tune, einschließlich des Cluster-Bootstrap-Musters. |
| Verteiltes Training mit Ray Train (CLI) | Feinjustieren Sie ein großes Sprachmodell über mehrere Knoten hinweg mit Ray Train und PyTorch. |
| Batch-Inferenz mit Ray Data und vLLM (CLI) | Führen Sie groß angelegte Batch-Inferenz mit Ray Data für verteiltes Datenladen und vLLM für effiziente Modellbereitstellung durch. |
| Hyperparametersuche mit Ray Tune (CLI) | Durchsuche mit Ray Tune die Hyperparameter für das LoRA-Feintuning von Qwen2.5, führe pro GPU einen Lauf aus und beende leistungsschwache Läufe mithilfe des ASHA-Schedulers frühzeitig. |