Plateforme et infrastructure de cloud computing pour la génération, le déploiement et la gestion d’applications et de services à travers un réseau mondial de centres de données gérés par Microsoft.
Bonjour FBA EDL,
Veuillez m’excuser pour la langue, j’ai utilisé Bing Translator pour convertir du français vers l’anglais.
Merci pour votre question concernant les problèmes de latence sur les points de terminaison Azure OpenAI, en particulier avec le modèle GPT-4.1 standard. La latence peut varier en fonction du type de déploiement, de la forme de la charge de travail et de la configuration du modèle.
Voici quelques recommandations et bonnes pratiques :
1.Utiliser Azure Monitor pour le diagnostic
Activez des métriques telles que :
- Processed Prompt Tokens
- Generated Completion Tokens
Cela permet d’estimer le débit au niveau du système et d’identifier les goulets d’étranglement.
2.Ajuster les paramètres de requête
- Réduisez la valeur de max_tokens pour diminuer le temps de génération.
- Utilisez stream: true pour recevoir les tokens au fur et à mesure de leur génération.
- Évitez de définir n > 1 sauf si plusieurs complétions sont nécessaires.
3.Choisir le bon modèle et la bonne région & Isoler les charges de travail
La latence peut varier selon la région et la version du modèle. GPT-4 Turbo (par exemple, gpt-4-0125-preview) peut offrir de meilleures performances que les versions précédentes. Prévoir des déploiements séparés pour les tâches sensibles à la latence et les traitements longs permet d’éviter les délais de file d’attente et d’améliorer la réactivité.
4.Utiliser les unités de débit provisionné (PTUs)
Les PTUs réservent une capacité de modèle pour des performances constantes. Idéal pour les charges de travail à fort volume ou sensibles à la latence.
5.Optimiser les sorties structurées
Si vous utilisez l’appel de fonctions, réduisez la complexité du JSON et testez des schémas plus petits.Cela peut réduire considérablement la latence.
Liens de référence :__
1.__ Azure OpenAI in Azure AI Foundry Models performance & latency - Azure OpenAI | Microsoft Learn