Probleme de latence sur les Endpoints Azure OPEN AI

FBA EDL 0 Points de réputation
2025-07-10T15:45:41.8866667+00:00

Nous constatons des problèmes de latence sur les Endpoints modèle 4.1 standard open AI.

Les temps réponses fluctuent fortement allant de 4s a 50s pour un même appel.

Avez vous des solutions a nous proposer.

Je reste a disposition pour plus d'informations

cordialement,

Azure
Azure

Plateforme et infrastructure de cloud computing pour la génération, le déploiement et la gestion d’applications et de services à travers un réseau mondial de centres de données gérés par Microsoft.


1 réponse

  1. Nikhil Jha (Accenture International Limited) 4,335 Points de réputation Personnel externe Microsoft Modérateur
    2025-07-31T07:05:05.8866667+00:00

    Bonjour FBA EDL,

    Veuillez m’excuser pour la langue, j’ai utilisé Bing Translator pour convertir du français vers l’anglais.

    Merci pour votre question concernant les problèmes de latence sur les points de terminaison Azure OpenAI, en particulier avec le modèle GPT-4.1 standard. La latence peut varier en fonction du type de déploiement, de la forme de la charge de travail et de la configuration du modèle.

    Voici quelques recommandations et bonnes pratiques :

    1.Utiliser Azure Monitor pour le diagnostic

    Activez des métriques telles que :

    • Processed Prompt Tokens
    • Generated Completion Tokens

    Cela permet d’estimer le débit au niveau du système et d’identifier les goulets d’étranglement.

    2.Ajuster les paramètres de requête

    • Réduisez la valeur de max_tokens pour diminuer le temps de génération.
    • Utilisez stream: true pour recevoir les tokens au fur et à mesure de leur génération.
    • Évitez de définir n > 1 sauf si plusieurs complétions sont nécessaires.

    3.Choisir le bon modèle et la bonne région & Isoler les charges de travail

    La latence peut varier selon la région et la version du modèle. GPT-4 Turbo (par exemple, gpt-4-0125-preview) peut offrir de meilleures performances que les versions précédentes. Prévoir des déploiements séparés pour les tâches sensibles à la latence et les traitements longs permet d’éviter les délais de file d’attente et d’améliorer la réactivité.

    4.Utiliser les unités de débit provisionné (PTUs)

    Les PTUs réservent une capacité de modèle pour des performances constantes. Idéal pour les charges de travail à fort volume ou sensibles à la latence.

    5.Optimiser les sorties structurées

    Si vous utilisez l’appel de fonctions, réduisez la complexité du JSON et testez des schémas plus petits.Cela peut réduire considérablement la latence.

    Liens de référence :__
    1.__ Azure OpenAI in Azure AI Foundry Models performance & latency - Azure OpenAI | Microsoft Learn

    Cette réponse a-t-elle été utile ?

    0 commentaires Aucun commentaire

Votre réponse

Les réponses peuvent être marquées comme « Acceptées » par l’auteur de la question et « Recommandées » par les modérateurs, ce qui aide les utilisateurs à savoir que la réponse a résolu le problème de l’auteur.