Overview

Important

Dieses Feature befindet sich in der Public Preview.

AI Runtime ist ein Compute-Angebot bei Databricks, das für Deep Learning-Workloads vorgesehen ist, und bietet GPU-Unterstützung für Databricks Serverless. Sie können KI-Runtime verwenden, um benutzerdefinierte Modelle mit Ihren bevorzugten Frameworks zu trainieren und zu optimieren und modernste Effizienz, Leistung und Qualität zu erzielen. Eine Übersicht darüber, wie serverloses Computing in die Databricks-Architektur passt, finden Sie unter Architektur des serverlosen Arbeitsbereichs.

Wichtigste Funktionen

AI Runtime kombiniert eine verwaltete GPU-Infrastruktur mit einer Laufzeit, die für Deep Learning entwickelt wurde:

  • Vollständig verwaltete GPU-Infrastruktur: Serverloser, flexibler Zugriff auf GPUs und keine Clusterkonfiguration, Treiberauswahl oder automatische Skalierungsrichtlinien zur Verwaltung.
  • Eine für Deep Learning dedizierte Laufzeit: Wählen Sie entweder eine minimale Standardumgebung für maximale Flexibilität gegenüber Abhängigkeiten oder eine vorkonfigurierte KI-Umgebung mit beliebten ML-Frameworks aus.
  • nativ in Notizbücher, Aufträge, Unity-Katalog und MLflow integriert, um nahtlose Entwicklung, Datenzugriff und Experimentverfolgung zu ermöglichen.

Hardware-Optionen

Alle AI-Runtime-Beschleuniger stellen einen einzelnen Knoten bereit. Die Anzahl der GPUs auf diesem Knoten hängt vom Beschleunigertyp ab.

Accelerator GPUs pro Knoten GPU-Arbeitsspeicher Am besten geeignet für: Verteilte Schulung
1xA10 1 24 GB Kleine bis mittlere ML- und Deep Learning-Aufgaben wie klassische ML-Modelle oder Feinabstimmung kleinerer Sprachmodelle Nicht unterstützt (einzelne GPU)
1xH100 1 80 GB Workloads, die mehr GPU-Speicher als 1xA10 benötigen, aber kein verteiltes Multi-GPU-Training erfordern, wie etwa das Fine-Tuning mittelgroßer Sprachmodelle Nicht unterstützt (einzelne GPU)
8xH100 8 80 GB pro GPU Große KI-Workloads, einschließlich Schulungen oder Feinabstimmung massiver Modelle oder Ausführen erweiterter Deep Learning-Aufgaben Unterstützt mithilfe des @distributed Dekorators mit gpus=8

Tipp

Nur 8xH100 unterstützt verteiltes Multi-GPU-Training. Für Workloads mit einer einzelnen GPU wählen Sie 1xA10 oder 1xH100 , je nach GPU-Speicher, den Ihr Modell benötigt.

Databricks empfiehlt KI-Runtime für alle benutzerdefinierten Modellschulungs-Anwendungsfälle, die Deep Learning, umfangreiche klassische Workloads oder GPUs umfassen.

Beispiel:

  • LLM-Feinabstimmung (LoRA, QLoRA, vollständige Feinabstimmung)
  • Computervision (Objekterkennung, Bildklassifizierung)
  • Deep-Learning-basierte Empfehlungssysteme
  • Vertiefendes Lernen
  • Deep-Learning-basierte Zeitreihenprognose

Anforderungen

Bevor Sie beginnen, bestätigen Sie, dass Ihr Arbeitsplatz folgende Anforderungen erfüllt:

  • Ein Arbeitsbereich in einer der folgenden von Azure unterstützten Regionen:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3
  • Die AI-Laufzeit-Vorschau muss über die Admin-Einstellungen des Arbeitsbereichs aktiviert werden. Siehe Vorschauen von Databricks verwalten.

Limitations

Behalte beim Planen eines KI-Laufzeit-Workloads folgende Einschränkungen im Hinterkopf:

  • AI-Runtime unterstützt nur die A10- und H100-Beschleuniger.
  • AI Runtime unterstützt das Compliance-Sicherheitsprofil weder für den Standard FedRAMP High noch für DoD IL5.
  • Das Hinzufügen von Abhängigkeiten mithilfe des Bereichs "Umgebungen " wird für geplante KI-Runtime-Aufträge nicht unterstützt. Installieren Sie Abhängigkeiten stattdessen programmgesteuert mit %pip install in Ihrem Notizbuch.
  • Bei geplanten Aufgaben in AI Runtime wird das Verhalten der automatischen Wiederherstellung für inkompatible Paketversionen, die Ihrem Notizbuch zugeordnet sind, nicht unterstützt.
  • KI-Laufzeit-Verbindungsversuche beenden nach 15 Minuten für interaktive Notizbücher und nach 24 Stunden für Notebook-Jobs oder CLI-Jobs. Verbundene Notebooksitzungen und Notebook-Jobs können bis zu zwei Tage ausgeführt werden, und CLI-Jobs können bis zu 14 Tage ausgeführt werden. Für lang andauernde Trainingsläufe für Modelle implementieren Sie Checkpointing und starten Sie den Trainingslauf neu, wenn die maximale Laufzeit erreicht ist.
  • KI-Runtime bietet On-Demand-Zugriff auf GPU-Ressourcen. Dies führt zwar zu einem einfachen, flexiblen Zugriff auf GPUs, aber es kann Zeiträume geben, in denen die Kapazität eingeschränkt oder in Ihrer Region nicht verfügbar ist.
  • KI-Runtime nutzt regionsübergreifende GPUs in bestimmten Fällen bei hoher Nachfrage. Bei einer solchen Nutzung können Kosten für ausgehenden Datenverkehr anfallen, und die regionsübergreifende Netzwerkkonnektivität kann zu bestimmten Zeiten eingeschränkt sein.

Herstellen einer Verbindung mit AI-Runtime

Sie können interaktiv über Notizbücher, ein IDE-Terminal mit einem SSH-Tunnel, geplanten Aufträgen, der Auftrags-API und deklarativen Automatisierungspaketen eine Verbindung mit AI Runtime herstellen. Eine Schritt-für-Schritt-Anleitung finden Sie unter Herstellen einer Verbindung zur AI Runtime aus einem Notebook.

Einrichten der Umgebung

AI Runtime bietet zwei verwaltete Python Umgebungen: eine minimale Standardumgebung und eine voll funktionsfähige Databricks AI-Umgebung, die mit beliebten ML-Frameworks wie PyTorch und Transformers vorinstalliert ist. Ausführliche Informationen zum Auswählen einer Umgebung, Zwischenspeicherungsverhalten, Importieren von benutzerdefinierten Modulen und bekannten Einschränkungen finden Sie unter "Einrichten Ihrer Umgebung".

Tipp

Wählen Sie die Standardumgebung für die volle Kontrolle über Ihren Abhängigkeitsstack oder die Databricks-KI-Umgebung , um gängige Frameworks wie PyTorch und Transformers zu überspringen.

Laden von Daten auf AI-Runtime

Das Verständnis der Funktionsweise des Datenzugriffs auf AI-Runtime ist für eine reibungslose Benutzererfahrung unerlässlich. Ausführliche Informationen finden Sie unter Laden von Daten auf AI-Runtime.

Verteilte Schulung

KI-Runtime unterstützt verteilte Schulungen über mehrere GPUs auf dem einzelnen Knoten, mit dem Ihr Notizbuch verbunden ist. Mithilfe des @distributed Dekorors aus der serverless_gpu Python-API können Sie Multi-GPU-Workloads mit PyTorch DDP, FSDP oder DeepSpeed mit minimaler Konfiguration starten. Ausführliche Informationen finden Sie unter "Verteilte Schulung" in Notizbüchern.

Tipp

Prüfe deine Arbeitslast auf einer einzelnen GPU, bevor du mit dem @distributed Decorator auf 8xH100 skalierst.

Ray für KI-Laufzeitumgebungen

AI Runtime unterstützt Ray für verteilte GPU-Workloads, darunter Ray Core, Ray Data, Ray Train und Ray Tune. Du kannst Single- und Multi-Node-Ray-Jobs auf serverloser GPU-Berechnung ohne Cluster-Setup ausführen. Für Details und Beispiele siehe Ray on AI Runtime.

Experimentverfolgung und Beobachtbarkeit

Informationen zur MLflow-Integration, zum Anzeigen von Protokollen und zur Modellprüfpunktverwaltung finden Sie unter Experiment-Tracking und Observability.

Trainingsarbeitslasten produktivisieren

Setzen Sie eine KI-Laufzeit-Workload mit Declarative Automation Bundles ein, um Ihren eigenen Trainingscode auszuführen, Mehraufgabenjobs zu erstellen, die GPU- und CPU-Aufgaben kombinieren, Pipelines zu planen und von der Entwicklung zur Produktion zu befördern. Siehe Trainingsworkloads produktivsetzen.

Genie Code für Deep Learning

Genie Code kann helfen, Deep-Learning-Workloads in AI Runtime zu entwickeln und zu beheben. Es kann verteilten Trainingscode generieren, Umwelt- und Abhängigkeitsprobleme lösen sowie GPU- und verteilte Arbeitslastausfälle untersuchen. Siehe Use Genie Code with AI Runtime.

Guides

Informationen zur Migration von klassischen Workloads, z. B. Notizbüchern und Zur Problembehandlung, finden Sie in den Benutzerhandbüchern für KI-Runtime.