Nota
L'accés a aquesta pàgina requereix autorització. Podeu provar d'iniciar la sessió o de canviar els directoris.
L'accés a aquesta pàgina requereix autorització. Podeu provar de canviar els directoris.
El procesamiento de prioridad proporciona un rendimiento de baja latencia con la flexibilidad de pago por uso. En este artículo, habilitará el procesamiento prioritario en una implementación de modelo, comprobará qué nivel de servicio procesó las solicitudes y supervisará los costos asociados.
Requisitos previos
- Una suscripción Azure: Crear una gratuita.
- Un proyecto de Microsoft Foundry con un modelo del tipo de implementación
GlobalStandardoDataZoneStandardya implementado. - Versiones del modelo
2025-12-01o posteriores.
Casos de uso clave
- Latencia coherente y baja para experiencias de usuario con capacidad de respuesta.
- Simplicidad de pago por uso sin compromisos a largo plazo.
- Tráfico durante horas hábiles o tráfico esporádico que se beneficia de un rendimiento escalable y rentable. Opcionalmente, puede combinar el procesamiento prioritario con unidades de rendimiento aprovisionadas (PTU) para la capacidad de estado estable y la optimización de costos.
Objetivo de latencia
En la tabla siguiente se muestra el valor de destino de latencia para cada modelo que admite el procesamiento de prioridad. El valor de destino de latencia se calcula como latencia de solicitud p50 por cada 5 minutos y se expresa como umbral de percentil. Por ejemplo, "99% > 50 tokens por segundo (TPS)" significa que 99% de solicitudes se procesan en más de 50 tokens por segundo.
| Modelo | Valor objetivo de latencia |
|---|---|
| gpt-6-sol, 2026-09-22 | 99% > 80 TPS |
| gpt-5.6-terra, 2026-07-09 | 99% > 70 TPS |
| gpt-5.6-sol, 2026-07-09 | 99% > 80 TPS |
| gpt-5.5, 2026-04-24 | 99% > 50 TPS |
| gpt-5.4-mini, 2026-03-17 | 99% > 100 TPS |
| gpt-5.4, 2026-03-051 | 99% > 50 TPS |
| gpt-5.2, 2025-12-11 | 99% > 50 TPS |
| gpt-5.1, 2025-11-13 | 99% > 50 TPS |
| gpt-4.1, 2025-04-141 | 99% > 80 TPS |
1Contexto largo para este modelo; es decir, las solicitudes que se estima que superarán los 128 000 tokens de entrada pasan al procesamiento estándar y se facturan a la tarifa del nivel estándar.
Disponibilidad de procesamiento prioritario por tipo de implementación
El procesamiento prioritario se puede habilitar en implementaciones estándar globales o implementaciones estándar de zona de datos (EE. UU.). Para obtener información sobre los precios, consulte la página de precios de OpenAI Azure.
Disponibilidad del modelo estándar global
| Región | gpt-6-sol, 2026-09-22 | gpt-5.6-terra, 2026-07-09 | gpt-5.6-sol, 2026-07-09 | gpt-5.5, 2026-04-24 | gpt-5.4-mini, 2026-03-17 | gpt-5.4, 2026-03-05 | gpt-5.2, 2025-12-11 | gpt-5.1, 2025-11-13 | gpt-4.1, 2025-04-14 |
|---|---|---|---|---|---|---|---|---|---|
| australiaeast | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| brazilsouth | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| canadacentral | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| Canadá Este | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| centralus | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| eastus | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| eastus2 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| francecentral | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| alemaniawestcentral | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| italynorth | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| japaneast | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| koreacentral | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| northcentralus | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| northeurope | - | - | - | ✅ | ✅ | ✅ | - | - | - |
| norwayeast | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| PolandCentral | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| southafricanorth | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| southcentralus | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| southeastasia | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| Sur de India | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| spaincentral | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| swedencentral | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| switzerlandnorth | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| switzerlandwest | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| uaenorth | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| uksouth | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| westeurope | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| westus | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| westus3 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
Habilitación del procesamiento de prioridad en el nivel de implementación
Puede habilitar el procesamiento de prioridad en el nivel de implementación y (opcionalmente) en el nivel de solicitud.
Nota
El procesamiento de prioridad se puede habilitar en implementaciones estándar globales o estándar de zona de datos (EE. UU.). El procesamiento de prioridad usa la misma cuota que el procesamiento estándar.
En el portal Microsoft Foundry, active el conmutador Procesamiento prioritario en la página de detalles de la implementación al crear la implementación o actualice la configuración de un modelo implementado editando los detalles de la implementación.
Nota
Si prefiere usar código para habilitar el procesamiento de prioridad en el nivel de implementación, puede hacerlo a través de la API REST para la implementación estableciendo el atributo de la service_tier siguiente manera: "properties" : {"service_tier" : "priority"}. Los valores permitidos para el service_tier atributo son default y priority.
default implica el procesamiento estándar, mientras que priority habilita el procesamiento prioritario.
Una vez configurada la implementación de un modelo para usar el procesamiento de prioridad, puede empezar a enviar solicitudes al modelo.
Visualización de métricas de uso
Puede ver la medida de uso del recurso en la sección Azure Monitor del portal de Azure.
Para ver el volumen de solicitudes procesadas por procesamiento estándar frente al procesamiento de prioridad, divida por el nivel de servicio (estándar o prioridad) que estaba en la solicitud original:
- Inicie sesión en https://portal.azure.com.
- Vaya al recurso Azure OpenAI y seleccione la opción Metrics en el panel de navegación izquierdo.
- En la página de métricas, agregue la métrica Solicitudes de Azure OpenAI. También puede seleccionar otras métricas, como latencia de Azure OpenAI, uso de Azure OpenAI y otras.
- Seleccione Agregar filtro para seleccionar la implementación estándar para la que se procesaron las solicitudes de procesamiento de prioridad.
- Seleccione Aplicar división para dividir los valores por ServiceTierRequest y ServiceTierResponse.
Para obtener más información sobre la supervisión de las implementaciones, consulte Monitor Azure OpenAI.
Supervisión de los costos
Puede ver un desglose de los costos de las solicitudes de prioridad y estándar en la página de análisis de costos del portal de Azure filtrando el nombre de implementación y las etiquetas de facturación de la siguiente manera:
- Vaya a la página de análisis de costos del portal Azure.
- (Opcional) Filtre por recurso.
- Para filtrar por nombre de implementación: agregue un filtro para la etiqueta de facturación > seleccione la implementación como valor y, a continuación, elija el nombre de la implementación.
Para obtener información sobre los precios del procesamiento prioritario, consulte la introducción a los precios de Azure OpenAI Service.
Habilitación del procesamiento de prioridad en el nivel de solicitud
Importante
A partir del 25 de septiembre de 2026, las solicitudes a modelos que no admiten el procesamiento Flex devuelven un error HTTP 400 con un invalid_request_error. Foundry no vuelve automáticamente de flex al procesamiento estándar. Compruebe que el modelo admite el procesamiento flex antes de enviar una solicitud. Si el procesamiento estándar es aceptable, establezca service_tier en default en su lugar. Para ver los modelos compatibles y la guía sobre alternativas, consulte Uso del procesamiento Flex con Azure OpenAI.
La habilitación del procesamiento de prioridad en el nivel de solicitud es opcional. Tanto la API de finalizaciones de chat como la API de respuestas tienen un atributo service_tier opcional que especifica el tipo de procesamiento que se va a usar al atender una solicitud. En el ejemplo siguiente se muestra cómo establecer service_tier a priority en una solicitud de respuestas.
curl -X POST https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AZURE_OPENAI_AUTH_TOKEN" \
-d '{
"model": "gpt-4.1",
"input": "This is a test",
"service_tier": "priority"
}'
Use el service_tier atributo para invalidar la configuración de nivel de implementación. En el caso del procesamiento estándar y de prioridad, service_tier puede tomar los valores auto, defaulty priority.
Si no establece el atributo , el valor predeterminado es
auto.service_tier = autosignifica que la solicitud usa el nivel de servicio configurado en la implementación.service_tier = defaultsignifica que la solicitud usa los precios y el rendimiento estándar para el modelo seleccionado.service_tier = prioritysignifica que la solicitud usa el nivel de servicio de procesamiento de prioridad.
En la tabla siguiente se resumen el enrutamiento estándar y de prioridad en función de la configuración de nivel de implementación y de nivel de solicitud para service_tier.
| Configuración de nivel de implementación | Configuración de nivel de solicitud | Solicitud procesada por nivel de servicio |
|---|---|---|
| valor predeterminado | automático, predeterminado | Estándar |
| valor predeterminado | prioridad | Procesamiento prioritario |
| prioridad | automóvil, prioridad | Procesamiento prioritario |
| prioridad | valor predeterminado | Estándar |
Limitaciones
Actualmente, el servicio no admite implementaciones estándar regionales ni implementaciones estándar de zona de datos de la UE.
El servicio puede volver a enrutar algunas solicitudes de prioridad al procesamiento estándar* durante estos escenarios:
- Si el rápido aumento de los tokens de procesamiento prioritario por minuto hace que se alcancen los límites de velocidad de rampa. Actualmente, el límite de aumento gradual se define como un aumento del tráfico en más de 50 % tokens por minuto en menos de 15 minutos.
- Durante periodos de mayor demanda de solicitudes al procesamiento prioritario.
- Solicitudes de contexto largas enviadas a determinados modelos enumerados en la tabla de objetivos de latencia.
Sugerencia
Si rutinariamente encuentra límites de aumento gradual, considere la posibilidad de comprar PTU en lugar del procesamiento prioritario o adicionalmente.
* El servicio factura las solicitudes procesadas por el nivel de servicio estándar a tarifas estándar. Las solicitudes procesadas por el nivel de servicio estándar incluyen
service_tier = defaulten la respuesta, mientras que las solicitudes procesadas por el nivel de procesamiento de prioridad incluyenservice_tier = priorityen la respuesta.
Solución de problemas
| Problema | Causa | Resolución |
|---|---|---|
| Solicitudes degradadas al nivel estándar | Una de estas situaciones: - El tráfico aumentó más del 50 % de tokens por minuto en menos de 15 minutos y alcanzó el límite de la tasa de aumento. - Solicitudes enviadas durante períodos de solicitudes máximas al procesamiento prioritario. - Solicitudes de contexto largas enviadas a determinados modelos enumerados en la tabla de latencia objetivo. |
- Aumente el tráfico de forma gradual si ha detectado límites de velocidad de rampa. - Considere la posibilidad de adquirir PTU para obtener una capacidad de estado estable. |