Planifiez les déploiements d’assistants Copilot Studio pour le débit et les limites de taux

Les assistants Copilot Studio prêts pour la production nécessitent plus que des licences et la planification du volume total de messages. Ils ont également besoin d’une planification du débit. La planification du débit couvre la rapidité d’arrivée du trafic, les services de plateforme appelés par la solution, et les limites applicables à l’ensemble de la solution.

Cet article aide les architectes de solutions, les concepteurs et les administrateurs Power Platform à préparer des déploiements Copilot Studio à grand volume pour le trafic de production, les tests d’acceptation utilisateur (UAT), les tests de charge, les scénarios business-to-consumer (B2C) et les charges de travail autonomes.

Le provisionnement de la tarification est distinct du provisionnement des licences

La planification de Copilot Studio en production comporte deux flux de travail liés mais distincts :

  • La provision de licence couvre les droits et la consommation commerciales, tels que les licences, crédits, capacité prépayée, packs de messages et facturation à l’utilisation.
  • L’approvisionnement du débit couvre la vitesse à laquelle le trafic peut être traité avant que des contrôles de limitation ou de protection du service ne s’appliquent.

Note

Microsoft utilise le terme quotas pour désigner les limites de débit dans Copilot Studio. Dans le vocabulaire plus large de l’industrie, cette activité de planification est souvent appelée approvisionnement tarifaire. Vérifiez les limites publiées, estimez les taux de requêtes de pointe et planifiez avant que le trafic de production n’arrive.

Le paiement à l’utilisation peut augmenter les limites disponibles par rapport aux configurations à faible capacité, mais le débit n’est pas infini. Vérifiez les limites actuelles de Copilot Studio, les allocations de requêtes Power Platform, les limites Power Automate, les limites de protection des services Dataverse, les règles de limitation des connecteurs et les limites des API en aval.

Que se passe-t-il en cas de limitation de bande passante ?

La limitation du débit est un comportement de protection du service. Il protège les services partagés contre les schémas de trafic dépassant les limites publiées, les contrôles de rafales ou la capacité de service. Le symptôme exact dépend du service faisant l’objet de la limitation de bande passante.

Lorsque la limite est atteinte, la conséquence dépasse un simple problème de planification. Les requêtes peuvent être limitées, retardées, bloquées ou rejetées. Dans les conversations instantanées utilisateur, ce comportement peut apparaître comme une interruption temporaire de service. Par exemple, l’utilisateur peut ne pas pouvoir envoyer le message suivant, recevoir un message d’assistant indisponible ou de limitation d’utilisation, ou subir une échouée parce qu’un flux, un connecteur, un appel Dataverse, un service d’IA ou une API aval a atteint sa limite.

Découvrez les symptômes spécifiques à Copilot Studio et les messages d’erreur dans Résoudre les erreurs de limitation d’utilisation dans les assistants.

Comment sont mesurées les limites de débit

Les limites de débit mesurent la quantité de trafic qu’un service peut accepter pendant une fenêtre temporelle spécifique. Considérez ces fenêtres de manière granulaire : par minute, par cinq minutes, par 10 minutes, par heure, par jour, par semaine et par mois. Le volume mensuel ou hebdomadaire aide à estimer la demande totale, mais des fenêtres plus courtes sont essentielles pour l’approvisionnement du débit, car le ralentissement du service résulte souvent d’un trafic concentré.

Par exemple, une société B2C pourrait recevoir la majeure partie de son trafic d’assistant au cours d’une heure de campagne ciblée. Sa moyenne hebdomadaire peut sembler faible, mais cette seule heure peut tout de même exercer une pression de débit suffisante pour entraîner une limitation de débit ou des interruptions de service. Une conception qui semble sûre à l’échelle hebdomadaire ou mensuelle peut encore dépasser les limites pendant un pic d’une heure.

Comprendre la portée des limites

Les limites ne s’appliquent pas uniquement au niveau de l’assistant individuel. Selon le service, ils peuvent s’appliquer au niveau de l’environnement, de l’outil, de l’API, du connecteur, du canal ou du service en aval.

Par exemple, les limites du nombre de messages envoyés aux assistants de Copilot Studio sont fixées pour chaque environnement Dataverse. Lorsque vous estimez le trafic, incluez toutes les sources qui envoient des messages aux assistants dans cet environnement, y compris les canaux destinés aux utilisateurs, les intégrations, les charges de travail autonomes et les compétences Azure Bot Framework. Vérifiez les valeurs actuelles et la portée dans quotas et limites Copilot Studio.

Décidez si l’approvisionnement de tarif s’applique à votre assistant

Tous les assistants n’ont pas besoin d’un travail détaillé d’approvisionnement tarifaire. Un assistant interne de FAQ avec une petite audience, une utilisation prévisible et peu ou pas d’appels en aval est peu susceptible d’atteindre les limites de débit. Le provisionnement du débit devient important lorsqu’un assistant risque de dépasser les limites de requêtes par minute ou par heure, même si son volume mensuel semble modeste.

Pensez au trafic attendu en début de projet, parallèlement à la conception de la solution. Avant d’entamer les tests d’acceptation utilisateur (UAT) et les tests de charge, l’équipe doit s’assurer que la conception de l’assistant, l’environnement, les services connectés et les systèmes en aval sont capables de supporter le profil de débit attendu.

Cette recommandation est primordiale pour les assistants de niveau entreprise volumineux et intensifs, où le trafic peut arriver en rafales, de nombreux utilisateurs ou événements peuvent solliciter l’assistant simultanément, ou chaque interaction dépend de plusieurs services de plateforme. Cela peut également s’appliquer à des assistants de taille réduite avec des schémas d’utilisation concentrés, comme une fenêtre de lancement brève, un événement dédié à un département, un processus programmé ou un workflow qui produit beaucoup de requêtes en peu de temps.

Les assistants B2C et autonomes nécessitent un provisionnement à taux anticipé

Les assistants B2C en contact avec la clientèle peuvent recevoir du trafic provenant de campagnes, de sites web publics, de portails clients, de communications sur les incidents, de lancements de produits ou de la demande saisonnière. Les assistants autonomes peuvent générer un trafic à haute fréquence à partir de plannings, d’événements, de processus en arrière-plan, ou lorsqu’ils appellent plusieurs outils et workflows.

Astuce

Considérez les cas d’utilisation B2C et autonomes comme des scénarios d’approvisionnement de taux de première classe. Ils peuvent générer des pics de trafic, plusieurs requêtes simultanées et une activité en arrière-plan à haute fréquence plus rapidement que de nombreuses conversations instantanées internes destinées aux employés.

Utilisez les périodes de pointe, pas seulement les totaux mensuels

Demandez si l’assistant peut créer des requêtes concentrées en une minute ou une heure. Un scénario de moindre envergure peut tout de même nécessiter un approvisionnement de taux si un test de charge, une campagne, une réponse à une panne ou un déclencheur automatisé entraîne un afflux important de messages, d’appels à l’IA générative, d’actions de workflow, d’appels de connecteur ou de requêtes Dataverse dans l’environnement en peu de temps.

Le volume mensuel est utile pour estimer la demande totale, mais il n’est pas suffisant pour l’approvisionnement de taux. Adaptez l’utilisation attendue à des intervalles de temps plus courts afin de pouvoir comparer le modèle avec les requêtes actuelles par minute (RPM), par heure (RPH), les pics de trafic et les limites journalières indiquées sur les pages liées.

Élaborez à la fois un profil de trafic moyen et un profil de trafic de pointe. Par exemple, si la majorité du trafic a lieu chaque jour entre 17 h 00 et 18 h 00, le pic horaire doit refléter cette concentration. L’estimation journalière n’a pas besoin d’être 24 fois le pic horaire si le trafic est concentré sur une seule période.

Dans quels autres cas une limitation de débit peut-elle survenir ?

La limitation de débit peut également survenir lorsque :

  • Une grande population d’employés utilise l’assistant pendant une période de pointe prévisible, comme un événement ou une formation à l’échelle du département.
  • Une campagne marketing, une panne, un lancement ou un événement d’entreprise planifié provoque un pic de trafic temporaire.
  • Les flux Power Automate comportent des boucles, des tentatives de nouvelle exécution, de la pagination ou des flux enfants qui amplifient le nombre de requêtes.
  • Les rapports, l’audit, l’exportation de la télémétrie ou la capture des transcriptions s’exécutent de manière synchrone pendant le traitement de la requête utilisateur.
  • Plusieurs assistants ou charges de travail partagent le même environnement, identité, connecteur ou capacité d’API en aval.
  • Les tests de charge montent en puissance plus rapidement que ce que l’architecture de production ou les processus de support sont prêts à prendre en charge.

Où consulter les limites de taux pertinentes

Copilot Studio a ses propres limites, et le parcours d’exécution de l’assistant peut inclure d’autres services avec leurs propres limites. Vérifiez toutes les limites pertinentes pour les services que votre assistant utilise.

Limites de Copilot Studio

Zone de configuration des quotas de débit Éléments à rechercher Où vérifier les valeurs actuelles Comment l’utiliser ?
Messages à un agent Limite actuelle de RPM/RPH et portée des messages envoyés à l’assistant. Quotas et limites pour Copilot Studio Comparez les messages attendus par minute et par heure pour l’environnement Dataverse cible.
Messages d’IA générative Limite actuelle pour l’orchestration générative, les actions d’assistants, les outils d’IA, les actions de workflow d’assistants et les réponses génératives. Messages d’IA générative à un assistant Modéliser des scénarios axés sur l’IA et autonomes selon les limites publiées actuelles.
Nœuds déclencheurs autonomes Les limites actuelles qui s’appliquent lorsqu’un assistant autonome est déclenché par des événements, des horaires ou des processus en arrière-plan. Quotas et limites pour Copilot Studio Modélisez distinctement les charges de travail pilotées par événements et planifiées, indépendamment du trafic de la conversation instantanée interactive.
Limites de demandes d’abonnement Copilot Studio Limites actuelles de requêtes Power Platform applicables à l’utilisation de Copilot Studio. Limites d’abonnement à Copilot Studio Utilisez ces valeurs conjointement avec la planification des limites de requêtes pour les flux, Dataverse et les services connectés.

Autres limites de la plateforme à prendre en compte

La limite la plus basse du chemin d’exécution détermine l’expérience utilisateur. Un assistant Copilot Studio peut respecter ses propres limites tandis qu’un flux, un connecteur, un appel Dataverse, un service linguistique ou une API externe est bridé.

Note

D’autres limites de plateforme peuvent avoir un impact sur votre assistant s’il utilise d’autres composants dans le chemin de requête de l’assistant. Prenez également en compte ces limites, y compris Power Platform, Power Automate, Dataverse, les connecteurs, les services linguistiques et les systèmes en aval.

Zone d’exécution Éléments à consulter Questions sur le provisionnement de taux Où vérifier les limites actuelles
Plan des requêtes Power Platform Requêtes via Power Automate, appels de workflow Copilot Studio, utilisation de Dataverse, Power Apps et Dynamics 365. Quel utilisateur, quelle connexion, quel utilisateur d’application ou quel principal de service génère les requêtes ? Les quotas de requêtes sont-ils suffisants pour la charge de travail quotidienne et de pointe attendue ? Demandes de limites et d’allocations
Flux Power Automate Déclencheurs, actions, boucles, flux enfants, actions HTTP, actions du connecteur, tentatives de nouvelle exécution, pagination et exécution simultanée. Combien d’actions sont créées par tour d’assistant ? Les limites de rafale, de concurrence, de déclencheur et de connecteur sont-elles incluses dans le périmètre ? Comprendre les limites de la plateforme et éviter la limitation

Limites des flux automatisés, planifiés et instantanés
Dataverse Opérations CRUD, plug-ins, workflows, opérations d’assignation/partage, appels de connecteurs et opérations système nécessaires pour finaliser les transactions. Quels utilisateurs, utilisateurs d’applications ou principaux de service génèrent des appels Dataverse ? Les limites de protection du service ou le comportement de réessai sont-ils susceptibles de s’appliquer ? Limites de l’API de protection des services

Vue d’ensemble des limites d’API Dataverse
Connecteurs Connecteurs standards, connecteurs Premium, connecteurs personnalisés, throttling spécifique à chaque connecteur, et API en aval. Quel connecteur est le goulot d’étranglement ? Le service en aval applique-t-il sa propre limite de taux ? Limites de débit d’API sur les connecteurs

Créer une référence de connecteur Power Automate
Compréhension du langage naturel (CLU) et services d’IA Appels CLU, requêtes IA, opérations de recherche et de résumé, outils basés sur des modèles, taille de la charge utile et limites spécifiques au service. Chaque utilisateur appelle-t-il un langage ou un service IA ? Ces appels sont-ils répétés lors des réessais ou de l’orchestration ? Limites de la compréhension du langage courant

Quotas et limites pour Copilot Studio
API externes et systèmes métier API de fournisseurs, API internes, bases de données, intergiciel, passerelles et services personnalisés. Quelle limite le propriétaire en aval impose-t-il ? Existe-t-il un contrat de réessai, une file d’attente ou une stratégie de backpressure ? Utilisez les limites actuelles du propriétaire du service en aval, l’accord de niveau de service (SLA) et le processus de support.

Concevez pour réduire la pression de débit

N’optez pas pour une augmentation des limites de débit comme première solution de conception. D’abord, vérifiez la conception de l’assistant et optimisez l’efficacité. Si l’assistant doit consulter une information, veillez à ce que les appels externes soient ciblés, optimisez les appels API et évitez un volume inutile de requêtes sur Copilot Studio, Power Automate, Dataverse, les connecteurs et les systèmes en aval.

Une fois la conception optimisée, contrôlez le débit afin que le trafic atteigne la plateforme de manière prévisible :

  • Pour les limites au niveau de l’environnement, envisagez de répartir les assistants entre plusieurs environnements si cette approche correspond à votre conception opérationnelle. Cette approche peut aider à empêcher que des assistants à fort volume, des divisions, des régions ou des charges de travail autonomes ne se retrouvent en concurrence avec des charges de travail non liées pour les mêmes limites à l’échelle de l’environnement.
  • Pour les assistants autonomes, utilisez des files d’attente, du traitement par lots, des filtres de déclenchement, du traitement planifié, des contrôles de réessai et de la surveillance afin que le travail en arrière-plan n’arrive pas sous forme de rafale incontrôlée.
  • Déplacez les tâches planifiées, le reporting, l’exportation d’audit et la télémétrie hors du flux de conversation interactif lorsque cela est possible.
  • Vérifiez les résultats des tests de charge et la télémétrie de production pour identifier où se concentrent les requêtes, puis optimisez l’assistant, les flux, les connecteurs et les API en aval avant de solliciter des limites supérieures.

Les assistants autonomes sont particulièrement placés pour maximiser l’utilisation de leur capacité allouée avec une prévisibilité et une observabilité robustes, en mettant les requêtes en file d’attente et en contrôlant leurs taux de déclenchement.

Que faire si les limites de débit par défaut ne suffisent pas

Si l’estimation du trafic de pointe indique que l’assistant ou tout service connecté risque de dépasser les limites publiées actuelles, entamez le processus de support d’approvisionnement de débit avant l’UAT, les tests de charge ou la mise en production. N’attendez pas la première défaillance de production.

Note

Copilot Studio est un service SaaS doté de limites de débit pour protéger le service pour tous les clients. Avec une justification appropriée, l’équipe d’ingénierie peut activer des limites personnalisées pour les scénarios approuvés.

Ouvrir une demande de support

Les administrateurs peuvent demander le support depuis le centre d’administration Power Platform.

Ouvrez le ticket tôt et incluez les meilleures estimations disponibles. Plus vous apportez de précisions, plus le processus de vérification sera facile. Mettez à jour le ticket au fur et à mesure que la conception est affinée ou que les tests de charge fournissent des données observées.

Informations de base à inclure

Informations Description
ID environnement L’environnement Dataverse où l’assistant s’exécute.
Nom ou identifiant de l’assistant L’assistant concerné par la demande.
Impact commercial Impact critique si les limites par défaut ne suffisent pas.
Informations connues Ce qui est connu concernant le scénario, le canal, le contexte de lancement, la criticité commerciale, et s’il s’agit d’un agent B2C, autonome, destiné aux employés ou réservé à un usage interne.
Instantané de l’assistant Un instantané ou une exportation qui aide les évaluateurs à comprendre la configuration de l’assistant, la conception, les services connectés et les paramètres pertinents.
Conception d’assistant Description générale des rubriques, de l’utilisation de l’IA générative, des sources de connaissances, des actions, des flux, des connecteurs, des appels Dataverse et des API externes utilisées par l’assistant.
Estimation du trafic moyen Trafic moyen attendu par heure, jour, semaine ou mois.
Estimation du trafic de pointe Nombre maximal attendu de messages, sessions, appels d’IA générative, actions de flux, appels de connecteur, requêtes Dataverse et appels d’API externe, le cas échéant.

Plus de détails qui peuvent aider

Informations Description
Plage de dates Date de début et de fin de l’augmentation demandée. Séparez les plages de données de test de charge utilisateur et de dates de production si elles diffèrent.
Motif de pic Périodes de pointe, fuseaux horaires, facteurs de pics de charge attendus et concentration éventuelle du trafic sur une courte plage quotidienne.
Profil de session Sessions simultanées, durée moyenne et maximale des sessions, messages par session et questions par session.
Exemples de sessions typiques Parcours utilisateurs représentatifs, étapes habituellement réalisées, outils employés, et exemples d’identifiants de session, si disponibles.
Chemin d’exécution Flux, actions, requêtes IA, appels à la base de connaissances, requêtes Dataverse, connecteurs et APIs par interaction.
Pics de charge par fonctionnalité Volume maximal par assistant, fonctionnalité, utilisateur, environnement, connecteur, minute, heure et jour, lorsque connu.
Produits nécessitant une vérification Vérifiez si la demande concerne Copilot Studio, les allocations de requêtes Power Platform, Power Automate, les connecteurs, Dataverse, les services CLU/IA ou des API externes.
Preuve Exemples d’ID de session, d’erreurs, d’ID de corrélation, de journaux, de résultats de tests de charge ou d’observations en production.
Corrections Résumez ce que vous avez déjà essayé pour réduire la pression de service. Consultez les recommandations de Concevoir pour réduire la pression sur le débit, y compris la vérification de la conception, l’optimisation des appels externes, la segmentation de l’environnement, le traitement par lots, la mise en file d’attente, le filtrage des déclencheurs, la planification, la répartition de la charge de travail et les autres optimisations déjà en place.

Important

Une augmentation du débit n’est pas garantie. Le support Microsoft examine les demandes en fonction du scénario, de l’environnement, de la plage de dates demandée, du trafic attendu, de l’éligibilité, des limites actuelles et de la capacité du service.