Environnement d'exécution IA

Important

Cette fonctionnalité est disponible en préversion publique.

AI Runtime est une offre de calcul GPU serverless chez Databricks, destinée aux charges de travail en apprentissage profond . Vous pouvez utiliser AI Runtime pour entraîner et affiner des modèles personnalisés à l’aide de vos frameworks favoris et obtenir une efficacité, des performances et une qualité de pointe.

Get started

Faites votre première charge de travail en quelques minutes grâce à nos guides de démarrage rapide.

Get started Description
🚀 Démarrage rapide CLI Venez-vous d’un cluster Slurm ou Kubernetes ? Entraînez votre modèle sur AI Runtime à partir de votre terminal en quelques minutes.
📓 Prise en main rapide du bloc-notes Connectez votre notebook à un GPU en quelques secondes et développez de façon interactive...
⚡ Ray Vous venez d’un cluster Ray ? Exécutez Ray sur AI Runtime avec support des tableaux de bord.
🧭 Aperçu Apprenez les éléments clés du temps d’exécution de l’IA en deux minutes : les GPU disponibles, son fonctionnement et leurs limitations.

Fonctionnalités

AI Runtime est une plateforme GPU full-stack, offrant de nombreuses façons de se connecter aux GPU, des outils intégrés d’observabilité et de débogage, ainsi que des environnements préconçus.

Connectez-vous aux GPU serverless : Contactez les GPU serverless depuis votre lieu de travail.

Fonctionnalité Description
Notebooks Connectez un notebook à un GPU serverless et développez de manière interactive, sans configuration de cluster.
IDE via SSH Connectez-vous depuis votre IDE ou terminal via un tunnel SSH pour travailler directement sur un nœud GPU.
CLI de l’environnement d’exécution IA Soumettez et gérez les tâches d’entraînement GPU distribué depuis votre ordinateur portable en utilisant des configurations de tâches YAML.
Rayon Exécutez Ray Core, Ray Data, Ray Train et Ray Tune sur un GPU serverless.

Gestion des dépendances : Contrôlez les bibliothèques Python et système avec lesquelles votre charge de travail fonctionne.

Fonctionnalité Description
Environnements préconstruits Partez d’un environnement Standard minimal ou d’un environnement IA Databricks préchargé de frameworks ML.
Prise en charge de Docker Apportez votre propre image conteneur pour exécuter des charges de travail avec une pile de dépendances personnalisée.

Chargement des données dans les GPU : Alimentez efficacement vos données d’entraînement sur vos GPU.

Fonctionnalité Description
Chargeurs de données efficaces Diffusez les données depuis des volumes du catalogue Unity avec des chargeurs tolérants aux pannes conçus pour une forte utilisation du GPU.

Débogage et observabilité : Suivre les expériences, inspecter les résultats et diagnostiquer les défaillances.

Fonctionnalité Description
MLflow pour l’apprentissage profond Suivez les expériences, les métriques et les exécutions avec MLflow, et sauvegardez les points de contrôle du modèle dans les volumes du catalogue Unity.
Afficheur de journaux Consultez la sortie d’entraînement et surveillez l’utilisation des ressources GPU pendant que votre code s’exécute.
Débogage avec des agents Utilisez Genie Code pour générer du code d’entraînement, résoudre les problèmes d’environnement et déboguer les pannes du GPU.

Planification et service en temps réel : Passez du développement interactif aux tâches et terminaux planifiés.

Fonctionnalité Description
Produisez vos emplois Déploie du code d’entraînement avec des Déclarative Automation Bundles, planifie les exécutions et construit des workflows multitâches GPU et CPU.
Déployer vos modèles Déploie tes modèles entraînés derrière un endpoint évolutif avec Model Serving.

Examples

Clonez des exemples de bout en bout et exécutez-les sur AI Runtime en quelques minutes, depuis la CLI ou dans des notebooks.

Exemple Description
Exemples Ray Reprenez votre projet Ray existant et exécutez-le sur AI Runtime en quelques minutes.
Entraînement d’un modèle de recommandation tabulaire Entraînez des modèles de recommandation de deep learning, tels que les architectures à double tour.
Vision par ordinateur Charges de travail de détection d’objets et de classification d’image sur les GPU.
Apprentissage automatique classique XGBoost accéléré par GPU, prévision de séries temporelles et autres tâches classiques de ML.
Affinage d’un LLM OSS Affinez les grands modèles de langage open source avec LoRA, QLoRA ou un affinage complet.

En savoir plus

Trouvez du contenu utile : les dernières mises à jour des produits et le fonctionnement de l’IA Runtime en coulisses.

Resource Description
Mises à jour de produit Consultez les dernières mises à jour et annonces des produits AI Runtime.
Comment fonctionne l’IA Runtime sous le capot Lisez comment Databricks maintient les GPU fiables tout au long de l’exécution IA.