Stratégie de maintenance des modèles IA

Cette page décrit la stratégie de maintenance de modèle pour les API Foundation Model avec paiement par jeton, les API Foundation Model provisionnés le débit, l’inférence Batch avec ai_queryet les offres de réglage des fins du modèle Foundation .

Pour continuer à prendre en charge les modèles les plus moderne, Databricks gère les modèles par le biais d’un cycle de vie qui passe de la mise à jour à la dépréciation jusqu’à la mise hors service.

  • Mise à jour : Databricks applique des mises à jour incrémentielles à un modèle pour fournir des optimisations. Consultez les mises à jour du modèle.
  • Déconseillé : un modèle déconseillé n’est plus recommandé pour les nouvelles charges de travail, mais reste disponible dans les espaces de travail avec l’utilisation existante du modèle. Les espaces de travail qui n’utilisent pas le modèle au moment de la dépréciation n’ont plus accès à celui-ci.
  • Mise hors service : un modèle mis hors service n’est plus accessible et la prise en charge du modèle est entièrement abandonnée. Toute charge de travail utilisant le modèle cesse de fonctionner.

Stratégie de dépréciation du modèle

Lorsque Databricks déprécie un modèle, ce modèle n’est plus recommandé et est prévu pour la mise hors service. Databricks annonce les dates de mise hors service des modèles déconseillés avec les chronologies de notification résumées dans les sections suivantes. Les dates de mise hors service peuvent être annoncées au moment de la dépréciation ou à une date ultérieure. Après la date de mise hors service, le modèle n’est plus accessible et toute charge de travail qui l’utilise cesse de fonctionner.

Pour les modèles déconseillés et supprimés et leurs dates de mise hors service annoncées, consultez Modèles dépréciés et mis hors service. Pour les modèles partenaires, consultez la stratégie de mise hors service du modèle partenaire.

Important

Les stratégies de dépréciation qui s’appliquent aux API Foundation Model pay-per-token et Foundation Model Fine-tuning n’affectent que les modèles de conversation et d’achèvement pris en charge.

Modèle de base des API

Le tableau suivant récapitule la stratégie de dépréciation pour les API Foundation Model pay-per token, Foundation Model APIs provisioned débit et Batch Inference avec ai_query des offres.

Notification de dépréciation Transition vers la mise hors service À la date de mise hors service
Databricks effectue les étapes suivantes pour informer les clients d’une dépréciation du modèle :
  • Dans l’interface utilisateur Databricks, un message d’avertissement indique que le modèle est déconseillé.
  • La documentation applicable contient un avis indiquant que le modèle est déconseillé, ainsi qu’une date de mise hors service si un modèle a été annoncé.
Après avoir déprécié un modèle, Databricks annonce une date de mise hors service trois mois ou plus à l’avenir. Pendant cette période de transition :
  • Le modèle reste disponible uniquement pour les espaces de travail avec des charges de travail existantes qui l’utilisent, jusqu’à la date de mise hors service annoncée.
  • Le modèle déconseillé n’est pas accessible à partir d’espaces de travail qui ne l’utilisaient pas activement au moment de la dépréciation.
  • Les clients disposant de charges de travail existantes doivent migrer vers le modèle de remplacement recommandé ou les charges de travail affectées par un coucher de soleil.
Le modèle n’est plus disponible pour être utilisé et est supprimé du produit. Toutes les charges de travail existantes utilisant le modèle arrêtent de fonctionner. La documentation applicable est mise à jour pour indiquer que le modèle n’est plus disponible et recommander un modèle de remplacement.

Stratégie de mise hors service du modèle partenaire

Les modèles partenaires sont des modèles que les partenaires tiers ( en particulier OpenAI, Anthropic et Google) fournissent via les API Foundation Model. Pour ces modèles partenaires, Databricks suit généralement les mêmes chronologies et stratégies de dépréciation décrites ci-dessus.

Toutefois, les partenaires peuvent fournir des dates de retraite plus courtes que la période de transition de trois mois que Databricks publie. Dans ce cas, Databricks tente de combler l’écart en redirigeant temporairement les modèles vers une version similaire, afin que les clients reçoivent le temps de transition complet.

Par exemple, si une mise hors service d’un modèle partenaire est annoncée avec un délai d’un mois au lieu de trois, Databricks redirige le modèle pendant deux mois supplémentaires afin d’éviter une rupture immédiate et de laisser le temps pour la migration. Les requêtes échouent à la fin de la période complète de trois mois.

Note

Cette redirection ne peut se produire que si le modèle de remplacement a le même prix et est rétrocompatible. Le modèle de remplacement est généralement une version incrémentielle du modèle, comme 3.0 et 3.1.

Réglage précis du modèle de base

Le tableau suivant récapitule la stratégie de dépréciation pour le réglage précis du modèle foundation.

Notification de dépréciation Transition vers la mise hors service À la date de mise hors service
Databricks effectue les étapes suivantes pour informer les clients d’une dépréciation du modèle :
  • Dans l’onglet Expériences , un message d’avertissement s’affiche dans le menu déroulant pour le réglage précis du modèle Foundation qui indique que le modèle est déconseillé.
  • La documentation applicable contient un avis indiquant que le modèle est déconseillé, ainsi qu’une date de mise hors service si un modèle a été annoncé.
Après avoir déprécié un modèle, Databricks annonce une date de mise hors service trois mois ou plus à l’avenir. Pendant cette période de transition, les clients doivent migrer leurs charges de travail vers un modèle de remplacement recommandé ou supprimer le point de terminaison affecté. Le modèle n’est plus disponible pour être utilisé et est supprimé du produit. La documentation applicable est mise à jour pour recommander l’utilisation d’un modèle de remplacement.

Mises à jour du modèle

Databricks peut expédier des mises à jour de modèle incrémentielles pour fournir des optimisations. Lorsque Databricks met à jour un modèle, l’URL du point de terminaison reste la même, mais l’ID de modèle dans l’objet de réponse change pour refléter la date de la mise à jour. Par exemple, si Databricks envoie une mise à jour vers meta-llama/Meta-Llama-3.3-70B le 3/4/2024, le nom du modèle dans l’objet de réponse est mis à jour vers meta-llama/Meta-Llama-3.3-70B-030424. Databricks gère un historique des versions des mises à jour. Pour plus d’informations, contactez votre équipe de compte Databricks.

Modèles dépréciés et supprimés

Les sections suivantes répertorient les modèles déconseillés (qui ne sont plus recommandés pour les nouvelles charges de travail) ou supprimés (fin de vie et qui ne sont plus disponibles). Les dates de mise hors service des modèles déconseillés sont annoncées au moins trois mois à l’avance.

Mise hors service des API de modèle de fondation

Le tableau suivant présente les retraits des modèles, leurs dates de mise hors service et les modèles de remplacement recommandés à utiliser pour les API de modèle Foundation et les charges de travail de service de débit approvisionnées. Databricks vous recommande de migrer vos applications pour utiliser des modèles de remplacement avant la date de mise hors service indiquée.

Note

Les modèles OpenAI et Google Gemini sont disponibles uniquement via les services ADI, fournis par Databricks.

Modèle partenaire Date de mise hors service Modèle de remplacement recommandé
Anthropic Claude Sonnet 4 Paiement par jeton : 9 octobre 2026 Claude Sonnet 4.6
OpenAI GPT-5.1 Codex Max Paiement par jeton : 16 juillet 2026 OpenAI GPT-5.5
OpenAI GPT-5.1 Codex Mini Paiement par jeton : 16 juillet 2026 OpenAI GPT-5.4 Codex Mini
OpenAI GPT-5.2 Codex Paiement par jeton : 16 juillet 2026 OpenAI GPT-5.5
Anthropic Claude 3.7 Sonnet Paiement par jeton : 12 avril 2026 Utiliser le dernier modèle Claude Sonnet
Gemini 2.5 Flash Paiement par jeton : 2 octobre 2026
Débit provisionné : 2 octobre 2026
Gemini 3.1 Pro ou Gemini 3.5 Flash
Gemini 2.5 Pro Débit provisionné : 2 octobre 2026 Gemini 3.1 Pro ou Gemini 3.5 Flash
Gemini 3 Pro Débit provisionné : 26 mars 2026 Gemini 3.1 Pro. Pour permettre une migration plus longue, entre le 26 mars 2026 et le 7 juin 2026, les appels d’API vers Gemini 3 Pro seront temporairement redirigés vers Gemini 3.1 Pro. La tarification des deux modèles est identique.
Ouvrir le modèle Date de mise hors service Modèle de remplacement recommandé
Meta Llama 3.1 405B Paiement par jeton : 15 février 2026
Débit provisionné : 15 mai 2026
OpenAI GPT OSS 120B
DBRX / DBRX Instruct Paiement par jeton : 30 avril 2025
Débit provisionné : 19 décembre 2025
Paiement par jeton : Meta-Llama-4-Maverick
Débit provisionné : Modèle comparable sur la même offre, comme Llama 3.2, 3.3 ou 4 modèle de taille similaire.
Mixtral 8x7B / Mixtral-8x7B Instruct Paiement par jeton : 30 avril 2025
Débit provisionné : 27 février 2026
Paiement par jeton : Meta-Llama-4-Maverick
Débit provisionné : Modèle comparable sur la même offre, comme Llama 3.2, 3.3 ou 4 modèle de taille similaire.
Meta Llama 3 (70B) Paiement par jeton : 23 juillet 2024 (Meta-Llama-3-70B-Instruct) ; 11 décembre 2024 (Meta-Llama-3.1-70B-Instruct)
Débit provisionné : 27 février 2026
Paiement par jeton : Meta-Llama-4-Maverick
Débit provisionné : Modèle comparable sur la même offre, comme Llama 3.2, 3.3 ou 4 modèle de taille similaire.
Meta Llama 3 8B Débit provisionné : 27 février 2026 Modèle comparable dans la même gamme d'offres, comme Llama 3.2, 3.3 ou le modèle 4 de taille similaire.
Meta Llama 2 70B / Meta-Llama-2-70B-Chat Paiement par jeton : 30 octobre 2024
Débit provisionné : 27 février 2026
Paiement par jeton : Meta-Llama-4-Maverick
Débit provisionné : Modèle comparable sur la même offre, comme Llama 3.2, 3.3 ou 4 modèle de taille similaire.
Meta Llama 2 13B Débit provisionné : 27 février 2026 Modèle comparable dans la même gamme d'offres, comme Llama 3.2, 3.3 ou le modèle 4 de taille similaire.
Meta Llama 2 7B Débit provisionné : 27 février 2026 Modèle comparable dans la même gamme d'offres, comme Llama 3.2, 3.3 ou le modèle 4 de taille similaire.
Mistral 7B Débit provisionné : 27 février 2026 Modèle comparable dans la même gamme d'offres, comme Llama 3.2, 3.3 ou le modèle 4 de taille similaire.
MPT 30B / MPT 30B Instruct Paiement par jeton : 30 août 2024
Débit provisionné : 19 décembre 2025
Paiement par jeton : Meta-Llama-4-Maverick
Débit provisionné : Modèle comparable sur la même offre, comme Llama 3.2, 3.3 ou 4 modèle de taille similaire.
MPT 7B / MPT 7B Instruct Paiement par jeton : 30 août 2024
Débit provisionné : 19 décembre 2025
Paiement par jeton : Meta-Llama-4-Maverick
Débit provisionné : Modèle comparable sur la même offre, comme Llama 3.2, 3.3 ou 4 modèle de taille similaire.

Si vous avez besoin d’un support à long terme pour une version spécifique d'un modèle, Databricks recommande d’utiliser les API Foundation Model débit provisionné pour vos charges de travail de déploiement.

Retraits d’ajustement de Foundation Model

Le tableau suivant présente les familles de modèles supprimées, leurs dates de mise hors service et les familles de modèles de remplacement recommandées à utiliser pour les charges de travail de réglage précis du modèle Foundation. Databricks vous recommande de migrer vos applications pour utiliser des modèles de remplacement avant la date de mise hors service indiquée.

Famille de modèles Date de mise hors service Famille de modèles de remplacement recommandée
DBRX 30 avril 2025 Llama-3.1-70B
Mixtral 30 avril 2025 Llama-3.1-70B
Mistral 30 avril 2025 Llama-3.1-8B
Meta-Llama-3.1-405B 30 janvier 2025 Llama-3.1-70B
Meta-Llama-3 7 janvier 2025 Meta-Llama-3.1
Meta-Llama-2 7 janvier 2025 Meta-Llama-3.1
Code Llama 7 janvier 2025 Meta-Llama-3.1

Rechercher des charges de travail qui utilisent des modèles supprimés

Utilisez la requête suivante pour rechercher les charges de travail qui utilisent des modèles déconseillés et identifier leurs propriétaires.

SELECT
   eu.requester,
   se.endpoint_name,
   se.entity_name,
   COUNT(*) AS request_count,
   SUM(eu.input_token_count) AS total_input_tokens,
   SUM(eu.output_token_count) AS total_output_tokens,
   MIN(eu.request_time) AS first_request,
   MAX(eu.request_time) AS last_request
 FROM system.serving.endpoint_usage eu
 JOIN system.serving.served_entities se
   ON eu.served_entity_id = se.served_entity_id
 WHERE LOWER(se.entity_name) LIKE '%<retired-model-name>%'
 GROUP BY eu.requester, se.endpoint_name, se.entity_name
 ORDER BY request_count DESC