Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Cette page décrit la tarification prioritaire au jeton pour la tarification au jeton des API Foundation Model, notamment son fonctionnement et la manière d’envoyer des requêtes prioritaires.
Qu’est-ce que le paiement par jeton prioritaire ?
Le paiement par jeton prioritaire, également appelé mode priorité, est une fonctionnalité de paiement par jeton pour les applications en temps réel sensibles à la latence. Lorsque vous envoyez une requête avec le paramètre service_tier défini sur "priority", Azure Databricks traite la requête en priorité par rapport au trafic standard en mode meilleur effort au paiement par jeton sur le même modèle. Cela permet de maintenir la disponibilité plus cohérente pendant les périodes de trafic élevé.
La tarification prioritaire au jeton s’active à la demande, requête par requête ; vous pouvez donc envoyer des requêtes prioritaires et standard vers le même modèle. Elle ne nécessite aucun engagement de capacité et est facturée à un taux de paiement par jeton plus élevé que les demandes de paiement par jeton standard.
Databricks recommande le mode priorité quand :
- Vous avez besoin de performances et d’une disponibilité plus cohérentes qu’avec la tarification standard à l’usage par jeton, mais vous n’êtes pas encore prêt à opter pour une capacité dédiée.
- Vos applications de production nécessitent une disponibilité plus élevée.
Modèles pris en charge
Les modèles de paiement par jeton suivants prennent en charge le mode priorité. Pour envoyer une demande de priorité, utilisez le nom du point de terminaison du modèle avec le service_tier paramètre défini sur "priority".
Important
Le paiement par jeton prioritaire est disponible pour les modèles OpenAI et Google Gemini via ADI Services, fournis par Databricks. Pour accéder à ces modèles partenaires dans votre environnement de Azure Databricks, consultez les services ADI.
Modèles open source
| Provider | Model | Nom du point de terminaison | Notes |
|---|---|---|---|
| Alibaba Cloud | Qwen3.5 122B A10B | databricks-qwen35-122b-a10b |
|
Comportement du paiement par jeton de priorité
Tenez compte du comportement suivant avant d’utiliser le paiement par jeton prioritaire :
- Performances et disponibilité cohérentes. La tarification prioritaire au jeton est conçue pour maintenir une disponibilité constante en cas de forte charge. Elle ne garantit pas un objectif spécifique de temps d’obtention du premier jeton ni de latence de bout en bout. Les requêtes prioritaires ciblent une disponibilité plus élevée que les demandes de paiement par jeton standard. Azure Databricks définit la disponibilité à un niveau comme le nombre de requêtes réussies divisées par le nombre total de requêtes admises à ce niveau.
- Capacité optimale. Le mode priorité ne réserve pas de capacité et il n’y a pas d’engagement de capacité.
- Repli vers la facturation standard au jeton. Si la capacité de priorité est entièrement abonnée, les demandes sont traitées à la disponibilité de paiement par jeton standard et facturées à des tarifs de paiement par jeton standard.
- Premium par jeton. Les demandes de priorité sont facturées à un taux de paiement par jeton plus élevé que les demandes de paiement par jeton standard.
Paiement par jeton prioritaire par rapport au débit provisionné
La tarification prioritaire au jeton et le débit provisionné ciblent tous deux les charges de travail de production, mais ils impliquent des compromis différents :
| Considérations | Paiement prioritaire par token | Capacité de traitement provisionnée |
|---|---|---|
| Capacity | Meilleur effort, partagé. | Capacité réservée dédiée. |
| Engagement | Aucun. Optez par demande. | Nécessite un point de terminaison provisionné. |
| Availability | Plus stable que la tarification standard au jeton en cas de forte charge. | Prédictible, en fonction de la capacité réservée. |
| Billing | Par jeton, à un niveau premium par rapport au paiement par jeton standard. | En fonction des unités de modèle approvisionnées. |
Envoyer une demande de priorité
Pour utiliser le mode prioritaire, définissez le paramètre service_tier sur "priority" pour chaque requête. L’exemple suivant utilise le client OpenAI :
from databricks_openai import DatabricksOpenAI
client = DatabricksOpenAI()
response = client.chat.completions.create(
model="databricks-model-name",
messages=[
{
"role": "user",
"content": "What is a mixture of experts model?",
}
],
max_tokens=256,
service_tier="priority",
)
Consultez la référence de l’API REST du modèle Foundation pour la syntaxe des paramètres et Utiliser des modèles de base pour plus d’options de requête.
Limites de capacité
Chaque cluster prend en charge un nombre total maximal de tokens par minute pour l’ensemble des locataires. Azure Databricks définit une limite par locataire pendant l’intégration afin qu’un seul locataire ne puisse pas consommer toutes les capacités du cluster. Si votre charge de travail nécessite plus de capacité que la limite par locataire, contactez votre équipe de compte Databricks.
Pour en savoir plus sur les limites des Foundation Model APIs, consultez Limites et quotas des Foundation Model APIs.