Planificar las implementaciones de agentes de Copilot Studio para límites de capacidad y tasa

Los agentes de Copilot Studio listos para producción necesitan más que la planificación de licencias y del volumen total de mensajes. También necesitan planificación de rendimiento. La planificación del rendimiento abarca la rapidez con la que llega el tráfico, los servicios de plataforma que utiliza la solución y los límites que se aplican en toda la solución.

Este artículo ayuda a arquitectos de soluciones, creadores y administradores de Power Platform a preparar implementaciones de Copilot Studio de alto volumen para tráfico de producción, pruebas de aceptación de usuarios (UAT), pruebas de carga, escenarios de negocio a cliente (B2C) y cargas de trabajo autónomas.

El aprovisionamiento de tarifas es independiente del aprovisionamiento de licencias

La planificación para Copilot Studio en producción tiene dos secuencias de trabajo relacionadas pero independientes:

  • El aprovisionamiento de licencias abarca los derechos comerciales y el consumo, como licencias, créditos, capacidad prepagada, paquetes de mensajes y facturación de pago por uso.
  • El aprovisionamiento de tasa se refiere a la rapidez con la que se puede procesar el tráfico antes de que se apliquen controles de limitación o de protección del servicio.

Nota

Microsoft utiliza el término cuotas para los límites de tasa de Copilot Studio. En el vocabulario general del sector, esta actividad de planificación suele denominarse aprovisionamiento de tarifas. Revise los límites publicados, estime las tasas de solicitudes máximas y planifique antes de que comience el tráfico de producción.

El modelo de pago por uso puede aumentar los límites disponibles en comparación con configuraciones de menor capacidad, pero la capacidad de procesamiento no es ilimitada. Consulte los límites actuales de Copilot Studio, las asignaciones de solicitudes de Power Platform, los límites de Power Automate, los límites de protección de servicio de Dataverse, las reglas de limitación de conectores y los límites de API descendentes.

¿Qué ocurre cuando se produce la limitación?

La limitación es un comportamiento de protección de servicio. Protege los servicios compartidos de patrones de tráfico que superan los límites publicados, controles de ráfagas o capacidad de servicio. El síntoma exacto depende del servicio limitado.

Cuando se alcanza un límite, la consecuencia es más que un simple problema de planificación. Las solicitudes pueden ser limitadas, demoradas, bloqueadas o rechazadas. En chats orientados al usuario, este comportamiento puede aparecer como una interrupción temporal del servicio. Por ejemplo, el usuario puede no poder enviar el siguiente mensaje, recibir un mensaje de agente no disponible o de límite de uso, o experimentar un paso con error porque un flujo, conector, llamada a Dataverse, servicio de IA o API de destino alcanzó su límite.

Infórmese sobre los síntomas y mensajes de error específicos de Copilot Studio en Resolver errores de límite de uso en los agentes.

Cómo se miden los límites de tasa

Los límites de tasa miden cuánto tráfico puede aceptar un servicio durante una ventana temporal específica. Piense en estas ventanas de manera granular: por minuto, por cinco minutos, por 10 minutos, por hora, por día, por semana y por mes. El volumen mensual o semanal permite estimar la demanda total, pero los intervalos más cortos son importantes para dimensionar la tasa, ya que la limitación de caudal suele deberse a picos de tráfico concentrado.

P. ej., una empresa B2C podría recibir la mayor parte del tráfico de sus agentes durante una hora de campaña intensiva. Su media semanal puede parecer baja, pero esa única hora aún puede generar suficiente presión de rendimiento como para causar limitaciones o interrupciones del servicio. Un diseño que parece seguro en términos semanales o mensuales aún puede superar los límites durante un pico de tráfico de una hora.

Comprenda el alcance de los límites

Los límites no solo se aplican en el nivel de agente individual. En función del servicio, pueden aplicarse en el nivel de entorno, nivel de herramienta, nivel de API, nivel de conector, nivel de canal o nivel de servicio posterior.

Por ejemplo, en Copilot Studio, los límites de mensajes a agente se aplican por entorno de Dataverse. Cuando estime el tráfico, incluya todas los orígenes que envían mensajes a los agentes en ese entorno, incluyendo canales orientados al usuario, integraciones, cargas de trabajo autónomas y habilidades de Azure Bot Framework. Consulta los valores actuales y el ámbito en Cuotas y límites de Copilot Studio.

Decida si el aprovisionamiento de tarifas se aplica a su agente

No todos los agentes necesitan un aprovisionamiento detallado de tarifas. Es poco probable que un agente interno de preguntas frecuentes sencillo, con una audiencia pequeña, uso predecible y pocas o ninguna llamada a servicios posteriores, alcance los límites de tasa. El aprovisionamiento de capacidad cobra importancia cuando un agente podría superar los límites de solicitudes por minuto o por hora, incluso si su volumen mensual parece modesto.

Considere el tráfico esperado desde las primeras etapas del proyecto, junto con el diseño de la solución. Antes de que comiencen las pruebas de aceptación de usuario (UAT) y las pruebas de carga, el equipo debe estar seguro de que el diseño del agente, el entorno, los servicios conectados y los sistemas posteriores pueden admitir el perfil de tráfico esperado.

Esta orientación es especialmente relevante para agentes empresariales más grandes e intensivos, donde el tráfico puede llegar en ráfagas, muchos usuarios o eventos pueden invocar al agente al mismo tiempo, o cada interacción depende de varios servicios de plataforma. También puede aplicarse a agentes de menor tamaño con patrones de uso concentrado, como una ventana de lanzamiento corta, un evento departamental, un proceso programado o un flujo de trabajo que genere muchas solicitudes en pocos minutos.

Los agentes B2C y autónomos requieren aprovisionamiento temprana de capacidad de procesamiento

Los agentes B2C de cara al cliente pueden recibir tráfico de campañas, sitios web públicos, portales de clientes, comunicaciones de incidentes, lanzamientos de productos o demanda estacional. Los agentes autónomos pueden generar tráfico de alta frecuencia a partir de horarios, eventos, procesos en segundo plano o cuando llaman a múltiples herramientas y flujos de trabajo.

Sugerencia

Trate los casos de uso B2C y autónomos como escenarios de aprovisionamiento de tasas prioritarios. Pueden generar ráfagas de tráfico, solicitudes simultáneas y actividad en segundo plano de alta frecuencia más rápido que muchas experiencias de chat orientadas a empleados.

Usar las ventanas de pico, no solo los totales mensuales

Pregunte si el agente puede crear solicitudes concentradas en un minuto u una hora. Un escenario más pequeño aún puede necesitar aprovisionamiento de tasas si una prueba de carga, campaña, respuesta ante errores o un desencadenador automatizado envía demasiados mensajes, llamadas a IA generativa, acciones de flujo de trabajo, llamadas a conectores o solicitudes a Dataverse a través del entorno en una ventana de tiempo corta.

El volumen mensual es útil para estimar la demanda total, pero no es suficiente para el aprovisionamiento de tasas. Convertir el uso esperado en intervalos de tiempo menores para que pueda comparar el diseño con los límites actuales de solicitudes por minuto (R.P.M.), solicitudes por hora (R.P.H.), picos de tráfico y límites diarios de las páginas vinculadas.

Cree tanto un perfil de tráfico promedio como uno de pico. Por ejemplo, si la mayor parte del tráfico ocurre cada día entre las 17:00 y las 18:00, el pico horario debe reflejar esa concentración. La estimación diaria no debe ser 24 veces la hora punta si el tráfico está concentrado en una sola ventana.

¿Cuándo más puede producirse la limitación de velocidad?

La limitación también se produce cuando:

  • Una gran población de empleados utiliza el agente durante una ventana de máxima demanda predecible, como un evento o formación a nivel departamental.
  • Una campaña de marketing, una interrupción del servicio, un lanzamiento o un evento empresarial programado puede provocar un breve pico de tráfico.
  • Los flujos de Power Automate incluyen bucles, reintentos, paginación o flujos secundarios que amplifican el volumen de solicitudes.
  • La generación de informes, auditoría, exportación de telemetría o captura de transcripciones se ejecutan de forma sincrónica durante la interacción del usuario.
  • Múltiples agentes o cargas de trabajo comparten el mismo entorno, identidad, conector o capacidad de API aguas abajo.
  • Las pruebas de carga aumentan más rápido de lo que la arquitectura de producción o el proceso de soporte estaba preparado para manejar.

Dónde consultar los límites de velocidad relevantes

Copilot Studio tiene sus propios límites, y la ruta de ejecución del agente puede incluir otros servicios con sus propios límites. Revise todos los límites relevantes para los servicios que utiliza su agente.

Límites de Copilot Studio

Área de aprovisionamiento de tarifa Qué buscar Dónde comprobar los valores actuales Cómo usarlo
Mensajes para un agente Límite actual de RPM/RPH y ámbito para los mensajes enviados al agente. Cuotas y límites de Copilot Studio Compare la cantidad esperada de mensajes por minuto y por hora para el entorno de Dataverse de destino.
Mensajes de IA generativa Límite actual para la orquestación generativa, acciones del agente, herramientas de IA, acciones del flujo de trabajo del agente y respuestas generativas. Mensajes de IA generativa a un agente Modelar escenarios intensivos en IA y autónomos conforme a los límites publicados actualmente.
Nodos desencadenadores autónomos Límites vigentes aplicables cuando un agente autónomo se desencadena mediante eventos, programaciones o procesos en segundo plano. Cuotas y límites de Copilot Studio Modele las cargas de trabajo orientadas a eventos y programadas por separado del tráfico de chat interactivo.
Límites de solicitud de suscripción de Copilot Studio Límites actuales de solicitudes de Power Platform que se aplican al uso de Copilot Studio. Límites de suscripción de Copilot Studio Utilice estos valores junto con la planificación de límites de velocidad para flujos, Dataverse y servicios conectados.

Otros límites de plataforma a tener en cuenta

El límite más bajo en la ruta de ejecución determina la experiencia del usuario. Un agente de Copilot Studio puede estar dentro de sus propios límites mientras se limita un flujo, un conector, una llamada a Dataverse, un servicio de lenguaje o una API externa.

Nota

Otros límites de la plataforma podrían afectar su agente si emplea otros componentes en la ruta de solicitudes del agente. Considere estos límites también, incluidos Power Platform, Power Automate, Dataverse, conectores, servicios de lenguaje y sistemas posteriores.

Área de runtime Qué revisar Cuestiones sobre el aprovisionamiento de tarifas Dónde consultar los límites actuales
Plano de solicitud de Power Platform Solicitudes a través de Power Automate, llamadas a flujos de trabajo de Copilot Studio, solicitudes de Dataverse, Power Apps y Dynamics 365. ¿Qué usuario, conexión, usuario de aplicación o entidad de servicio genera las solicitudes? ¿Son suficientes las asignaciones de solicitudes para la carga diaria y pico esperada? Asignaciones y límites de solicitudes
Flujos de Power Automate Desencadenadores, acciones, bucles, flujos secundarios, acciones HTTP, acciones del conector, reintentos, paginación y simultaneidad. ¿Cuántas acciones se crean por cada turno de agente? ¿Se incluyen los límites de ráfaga, concurrencia, desencadenadores y conectores? Comprender los límites de la plataforma y evitar la limitación

Límites de flujos instantáneos, programados y automatizados
Dataverse Operaciones CRUD, complementos, flujos de trabajo, operaciones de asignación/compartición, llamadas a conectores y operaciones de sistema necesarias para completar las transacciones. ¿Qué usuarios, usuarios de aplicaciones o principales de servicio generan llamadas a Dataverse? ¿Es probable que se apliquen los límites de protección del servicio o el comportamiento de reintento? Límites de la API de protección de servicio

Información general sobre los límites de API de Dataverse
Conectores Conectores estándar, conectores Premium, conectores personalizados, limitación específica de conectores y APIs descendentes. ¿Qué conector es el cuello de botella? ¿El servicio descendente aplica su propio límite de tasa? Límites de rendimiento de la API en conectores

Referencia de conector de Power Automate
Reconocimiento del lenguaje conversacional (CLU) y servicios de IA Llamadas CLU, indicaciones de IA, operaciones de búsqueda y resumen, herramientas basadas en modelos, tamaño de carga útil y límites específicos del servicio. ¿Cada intervención del usuario invoca un servicio lingüístico o de IA? ¿Se repiten esas llamadas durante los intentos o la orquestación? Límites de reconocimienot del lenguaje conversacional

Cuotas y límites de Copilot Studio
API externas y sistemas de línea de negocio API de proveedores, APs internas, bases de datos, middleware, puertas de enlace y servicios personalizados. ¿Qué límite impone el propietario descendente? ¿Existe una estrategia de reintentos, una cola o una estrategia de retro presión? Utilice los límites actuales, el acuerdo de nivel de servicio (SLA) y el proceso de soporte del propietario del servicio dependiente.

Diseñar para reducir la presión de rendimiento

No hagas que el aumento de los límites de procesamiento sea su primera estrategia de diseño. Primero, revise el diseño del agente y optimice la eficiencia. Si el agente necesita buscar algo, mantenga las llamadas externas deliberadas, optimice las llamadas API y evite el volumen innecesario de solicitudes en Copilot Studio, Power Automate, Dataverse, conectores y sistemas descendentes.

Una vez que el diseño sea eficiente, controla el flujo para que el tráfico llegue a la plataforma de forma predecible:

  • Para los límites en el nivel de entorno, considera separar agentes entre varios entornos si ese enfoque encaja con tu diseño operativo. Este enfoque puede ayudar a impedir que agentes de alto volumen, unidades de negocio, regiones o cargas de trabajo autónomas compitan con cargas de trabajo no relacionadas por los mismos límites establecidos en el nivel de entorno.
  • Para los agentes autónomos, utilice colas, procesamiento por lotes, filtros de activación, procesamiento programado, controles de reintento y supervisión para que el trabajo en segundo plano no se acumule en una ráfaga descontrolada.
  • Traslada los trabajos programados, de informes, exportación de auditoría y telemetría fuera de la ruta interactiva de chat cuando sea posible.
  • Examina los resultados de las pruebas de carga y la telemetría de producción para identificar dónde se concentran las solicitudes; luego ajusta el agente, los flujos, los conectores y las APIs de los sistemas posteriores antes de solicitar un aumento de los límites.

Los agentes autónomos están especialmente posicionados para maximizar el uso de su capacidad asignada con una robusta predictibilidad y observabilidad, organizando las solicitudes en colas y controlando su frecuencia de activación.

Qué hacer si los límites de tasa por defecto no son suficientes

Si la estimación de tráfico máximo muestra que el agente o cualquier servicio conectado podría superar los límites publicados vigentes, inicie el proceso de soporte para el aprovisionamiento de capacidad antes de la UAT, de las pruebas de carga o del lanzamiento a producción. No esperes a la primera falla de producción.

Nota

Copilot Studio es un servicio SaaS con límites de tasa establecidos para proteger el servicio para todos los clientes. Con la justificación adecuada, el equipo de ingeniería puede habilitar límites personalizados para escenarios aprobados.

Abrir una solicitud de soporte técnico

Los administradores pueden solicitar soporte del Centro de administración de Power Platform.

Abra el vale con antelación e incluya las mejores estimaciones disponibles. Cuantos más detalles proporcione, más fácil será el proceso de revisión. Actualice la solicitud a medida que se refina el diseño o las pruebas de carga proporcionen datos observados.

Información esencial a incluir

Información Description
Id. de entorno El ambiente Dataverse donde se ejecuta el agente.
Nombre o identificador del agente El agente afectado por la solicitud.
Impacto en el negocio Impacto crítico si los límites predeterminados no son suficientes.
Información conocida Detalles conocidos sobre el escenario, canal, contexto de lanzamiento, criticidad del negocio y si es B2C, autónomo, orientado al empleado o solo interno.
Instantánea de agente Una instantánea o exportación que ayude a los revisores a entender la configuración del agente, el diseño, los servicios conectados y los ajustes relevantes.
Diseño de agente Descripción de alto nivel de los temas, uso de IA generativa, fuentes de conocimientos, acciones, flujos, conectores, llamadas a Dataverse y APIs externas utilizadas por el agente.
Estimación promedio de tráfico Tráfico promedio esperado por hora, día, semana o mes.
Estimación máxima de tráfico Mensajes, sesiones, llamadas de IA generativa, acciones de flujo, llamadas a conectores, solicitudes a Dataverse y llamadas a API externas esperadas en el pico, cuando corresponda.

Más detalles que pueden ayudar

Información Description
Intervalo de fechas Fecha de inicio y fecha final del aumento solicitado. Separar las pruebas de carga de la prueba de aceptación del usuario y los rangos de fechas de producción si difieren.
Patrón de picos Periodos punta, zonas horarias, factores previstos que impulsan los picos de tráfico y si el tráfico se concentra en una breve franja diaria.
Perfil de la sesión Sesiones simultáneas, duración media y pico de las sesiones, mensajes por sesión y preguntas por sesión.
Ejemplos de sesiones típicas Rutas representativas de usuario, pasos típicos realizados, herramientas utilizadas y IDs de sesión de ejemplo, si están disponibles.
Ruta en tiempo de ejecución Flujos, acciones, indicaciones de IA, consultas de conocimiento, peticiones a Dataverse, conectores y API por interacción.
Picos de nivel de característica Volumen máximo por agente, característica, usuario, entorno, conector, minuto, hora y día según se conozca.
Productos que necesitan revisión Tanto si la solicitud implica Copilot Studio, asignaciones de solicitudes de Power Platform, Power Automate, conectores, Dataverse, servicios de CLU/IA o API externas.
Evidencia Ejemplos de id. de sesión, errores, id. de correlación, registros, resultados de pruebas de carga u observaciones de producción.
Mitigaciones Resume lo que ya ha intentado para reducir la presión de rendimiento. Consulte la guía de Diseño para reducir la presión de procesamiento, incluyendo revisión de diseño, llamadas externas optimizadas, segmentación del entorno, procesamiento por lotes, colas, filtrado de desencadenadores, programación, distribución de cargas de trabajo y otras optimizaciones ya implementadas.

Importante

No se garantiza un aumento en el rendimiento. Soporte de Microsoft evalúa las solicitudes en función del escenario, el entorno, el rango de fechas solicitadas, el tráfico esperado, la elegibilidad, los límites actuales y la capacidad de servicio.