Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Important
Cette fonctionnalité est en version bêta. Les administrateurs de compte peuvent contrôler l’accès à cette fonctionnalité à partir de la page Aperçus de la console de compte. Consultez Gérer les préversions d’Azure Databricks.
Cette page décrit comment configurer les limites de taux pour les services d’IA Unity AI Gateway. Les limites de débit vous permettent d’appliquer des limites de consommation sur un service de modèle ou un service MCP pour gérer la capacité et les coûts.
Requirements
- Préversion de Unity AI Gateway activée pour votre compte. Consultez Gérer les préversions d’Azure Databricks.
- Un espace de travail Azure Databricks dans une région prise en charge par le Unity AI Gateway.
Configurer des limites de débit sur un service de modèle ou un service MCP
Vous pouvez définir des limites de débit en fonction des requêtes par minute (QPM) ou des jetons par minute (TPM), en fonction du type de service :
- Services de modèle : définir des limites de requêtes par minute (QPM) et de jetons par minute (TPM).
- Services MCP : Définissez les limites de requêtes par minute (QPM). Les limites basées sur les jetons ne s’appliquent pas aux services MCP.
Pour activer les limites de débit, sélectionnez Limites de débit lors de la configuration de votre service de modèle ou du service MCP. Vous pouvez définir des limites de débit aux niveaux suivants :
| Champ | Description |
|---|---|
| Service | Spécifiez le QPM ou le TPM maximal que l’ensemble du service peut prendre en charge. Cette limite s’applique à tout le trafic, quel que soit l’utilisateur. |
| Utilisateur (par défaut) | Spécifiez une limite de débit par utilisateur par défaut qui s’applique à tous les utilisateurs du service, sauf si une limite de taux personnalisée plus spécifique est définie. |
| Limites de débit personnalisées | Les limites de débit personnalisées peuvent être spécifiées pour :
|
Détails et comportement
- Les limites de débit s’appliquent uniquement aux utilisateurs autorisés à interroger le service.
- Par défaut, il n’existe aucune limite de débit configurée pour les utilisateurs ou le service.
- La limite de débit de service est un maximum global. Si cette limite est dépassée, toutes les demandes adressées au service sont bloquées, quelles que soient les limites de débit spécifiques à l’utilisateur ou au groupe.
- Si un service, un utilisateur ou un principal de service a à la fois une limite de débit basée sur les requêtes et une limite de débit basée sur les jetons spécifiée, la limite de débit plus restrictive est appliquée.
- Les limites de débit personnalisées remplacent la limite de débit utilisateur (par défaut).
- Si un utilisateur appartient à une limite spécifique à l’utilisateur et à une limite spécifique à un groupe, la limite spécifique à l’utilisateur est appliquée.
- Si un utilisateur appartient à plusieurs groupes d’utilisateurs avec des limites de taux QPM ou TPM différentes, il est soumis à une limite s’il dépasse toutes les limites QPM ou toutes les limites TPM de ses groupes d’utilisateurs.
Comportement du limiteur de débit
Lorsqu’une limite de débit est dépassée, le service retourne une réponse HTTP 429 (Trop de requêtes). Les clients doivent implémenter une logique de réessai avec un retrait exponentiel.
Le limiteur de débit est conçu pour une faible latence, ce qui signifie que les comportements suivants sont attendus :
- Les demandes simultanées ne sont pas vérifiées à l’avance. Le système enregistre l’utilisation après l’envoi d’une réponse. Par conséquent, si plusieurs demandes arrivent en même temps, elles peuvent toutes passer avant que l’utilisation ne soit comptabilisée. Les demandes ultérieures sont ensuite rejetées jusqu’à ce que la capacité récupère. Dans la pratique, vous pouvez voir des rafales de trafic suivies de brèves pauses dans un modèle répétitif.
- Les limites sont appliquées indépendamment entre les instances de service, de sorte que des rafales courtes légèrement supérieures à la limite configurée peuvent se produire, en particulier juste après la création ou la mise à jour d’un service.
Dans une fenêtre de temps plus longue, le taux de requêtes moyen converge vers la limite configurée.
Limitations
- Vous pouvez spécifier un maximum de 20 limites de débit par service.
- Vous pouvez spécifier un maximum de 5 limites de taux spécifiques au groupe par service.