Determinar o dimensionamento da PTU para uma carga de trabalho (clássico)

Atualmente a ver:Versão do portal Foundry (clássica) - Mudar para a versão do novo portal Foundry

Antes de criar uma implantação aprovisionada, calcule quantas unidades de débito aprovisionado (PTUs) são necessárias para a sua carga de trabalho. Este artigo fornece os parâmetros de rendimento por modelo de que necessita e mostra como calcular os requisitos de PTU usando fórmulas de dimensionamento ou a calculadora de capacidade Foundry.

Se és novo no throughput provisionado, começa por O que é o throughput provisionado para Foundry Models?. Quando estiver pronto para criar a sua implementação, consulte Quickstart: Criar uma implementação de throughput provisionada.

Pré-requisitos

Estimar as PTUs necessárias

Existem duas abordagens disponíveis para estimar o número de PTUs necessárias para uma carga de trabalho:

Ambas as abordagens utilizam valores por modelo das tabelas de parâmetros de implementação para gerar estimativas. Para obter resultados mais precisos, compare uma implementação com tráfego representativo em vez de depender apenas de entradas estimadas.

Note

Para modelos mais antigos (antes do GPT-4o), a distribuição de pedido/forma de chamada afeta o consumo de capacidade: um pequeno número de chamadas grandes pode consumir significativamente mais capacidade do que muitas chamadas pequenas com a mesma contagem média de tokens. Para GPT-4o e modelos posteriores, o TPM por PTU é definido separadamente para os tokens de entrada e saída, por isso este efeito de escalonamento não se aplica.

Estimar manualmente

Pode estimar as PTUs que a sua carga de trabalho requer usando os valores específicos do modelo das tabelas de parâmetros de implementação e informações sobre o tráfego esperado da seguinte forma:

Entrada Description
Modelo O modelo que planeia implementar, por exemplo, gpt-5.2. Determina quais os valores de TPM de entrada por PTU e da razão saída-entrada a usar a partir das tabelas de parâmetros de implantação.
Tipo de implantação O tipo de implementação provisionada: Global Provisioned, Data Zone Provisioned ou Regional Provisioned.
RPM de pico O número máximo esperado de chamadas por minuto enviadas ao modelo.
Tamanho médio do prompt O número médio de tokens de entrada por solicitação.
Tamanho médio da resposta O número médio de tokens de saída por solicitação.
Taxa de cache A percentagem de tokens de entrada servidos a partir da cache de prompts. Use 0 se não utilizar a cache. Os tokens em cache são deduzidos 100% do cálculo de utilização e não consomem capacidade de PTU.

TPM normalizado

O cálculo manual das PTUs converte o volume esperado de tokens num único número chamado TPM normalizado. O número de PTUs necessários é então determinado dividindo-se o TPM normalizado pelo valor de TPM de entrada por PTU do modelo.

Fórmulas:

  • Input TPM = RPM de pico × tamanho médio do prompt (tokens)
  • TPM de saída = RPM de pico × tamanho médio da resposta (tokens)
  • TPM normalizado = (TPM de entrada × (1 − taxa de cache)) + (relação saída-entrada-entrada × TPM de saída)
  • PTUs necessárias = TPM normalizado ÷ TPM de entrada por PTU

Exemplo prático:

Suponha que a sua aplicação envia pedidos a uma taxa máxima de 1.000 RPM, com um tamanho médio de prompt de 200 tokens e um tamanho médio de resposta de 20 tokens, usando o modelo gpt-5.2 com implementação de throughput provisionada por Data Zone. Segundo a tabela, o gpt-5.2 tem um TPM de entrada por PTU de 3.400 e uma relação saída-entrada de 8.

  • TPM de entrada = 1.000 × 200 = 200.000
  • Saída TPM = 1.000 × 20 = 20.000
  • TPM normalizado (sem cache) = 200.000 + (8 × 20.000) = 360.000
  • PTUs necessárias = 360.000 ÷ 3.400 = 105,88 (110 PTUs arredondadas para as 5 PTUs mais próximas, correspondendo ao incremento da escala Data Zone Provisioned para gpt-5,2.)

Se forem servidos 50% de tokens de entrada a partir da cache de prompts:

  • TPM de entrada efetiva = 200.000 × (1 − 0,50) = 100.000
  • TPM normalizado = 100.000 + (8 × 20.000) = 260.000
  • PTUs necessárias = 260.000 ÷ 3.400 = 76,47 (80 PTUs arredondadas para as 5 PTUs mais próximas, correspondendo ao incremento da escala Data Zone Provisioned para gpt-5.2.)

Em resumo, as PTUs necessárias para este exemplo de forma de chamada com e sem cache são as seguintes:

Chamadas de pico por minuto (RPM) Tamanho do prompt (tokens) Tamanho da resposta (tokens) Taxa de cache TPM de entrada TPM de saída TPM normalizado PTUs estimados PTUs (arredondadas para cima)1
1,000 200 20 0% 200,000 20,000 360.000 105.88 110
1,000 200 20 50% 100,000 20,000 260,000 76.47 80

1 Arredondado para as 5 PTUs mais próximas, correspondendo ao incremento da escala Data Zone Provisioned para gpt-5.2.

Use o calculador de capacidade

Use o calculador de capacidade no portal Foundry para dimensionar formas específicas de carga de trabalho. Encontre a calculadora na página de Quota e introduza os seguintes parâmetros com base na sua carga de trabalho:

Entrada Description
Modelo O modelo que planeias usar.
Version A versão do modelo que planeias usar.
Chamadas de pico por minuto O número de chamadas por minuto que se espera que sejam enviadas ao modelo.
Tokens na chamada do prompt O número de tokens no prompt para cada chamada ao modelo. Chamadas com prompts maiores consomem mais capacidade de PTU. A calculadora assume um único valor de prompt — para cargas de trabalho com grande variação no tamanho do prompt, compare uma implementação com o seu tráfego real para uma estimativa mais precisa.
Tokens na resposta do modelo O número de tokens gerados por chamada, também chamado de tamanho de geração. Chamadas com maiores dimensões de geração consomem mais capacidade de PTU. Tal como nos tokens de prompt, a calculadora assume um único valor.
Taxa de cache Percentagem de tokens de entrada servidos a partir da cache de prompts.

Depois de preencher os dados exigidos, selecione Calcular. O resultado mostra:

  • O número estimado de PTU necessário para a carga de trabalho. Este valor é arredondado ao incremento da escala de PTU mais próximo para o tipo de implementação selecionado, ou para o número mínimo de PTUs desse tipo de implementação, consoante o que for maior.
  • A contagem bruta (não arredondada) estimada de PTU.

Como os tokens de entrada e saída afetam o rendimento

A taxa de processamento (medida em tokens por minuto, ou TPM) que uma implementação obtém por PTU depende do modelo e da mistura de tokens de entrada e de saída num determinado minuto. Gerar tokens de saída requer mais capacidade de processamento do que consumir tokens de entrada.

Para modelos GPT-4.1 e posteriores, o sistema determina uma relação saída-entrada para corresponder à razão padrão global de preços entre tokens de entrada e saída, com exceções para alguns modelos. Por exemplo

  • Para o gpt-5, um token de saída equivale a oito tokens de entrada para o seu limite de utilização, em conformidade com o rácio de preço padrão global do modelo.
  • Para o gpt-4.1, um token de saída conta como quatro tokens de entrada.
  • Modelos mais antigos usam proporções diferentes.

Em todas as implementações, os tokens em cache são deduzidos na totalidade do cálculo de utilização, o que significa que os tokens de prompt repetidos não consomem capacidade de PTU. Consulte Prompt caching para mais informações.

Modelos com uma relação saída-entrada não padrão

Alguns modelos utilizam uma relação saída-entrada que difere da sua razão padrão global de preços. Por exemplo, com o Llama-3.3-70B-Instruct, um token de saída conta como quatro tokens de entrada para efeitos do seu limite de utilização, o que difere do rácio de preços padrão do modelo. Consulte os preços dos modelos Llama para obter a discriminação completa dos preços de entrada e de saída.

Parâmetros de implementação e valores de throughput por modelo

As tabelas nesta secção listam os parâmetros de rendimento e implementação para cada modelo suportado. Para entender o que significam os parâmetros em cada linha, consulte o Apêndice.

Modelos OpenAI mais recentes do Azure

Note

Os objetivos de latência na tabela seguinte excluem contexto extenso, ou seja, pedidos que excedem o limiar:

  • 128k tokens de prompt para gpt-5.4, gpt-4.1, gpt-4.1-mini, e gpt-4.1-nano
  • 272k tokens de aviso para gpt-5.6-luna, gpt-5.6-sol, e gpt-5.6-terra

O sistema encaminha essas solicitações para implementações de contingência, se disponíveis. Caso contrário, os pedidos devolvem um erro.

Topic GPT-5.6-LUNA,
2026-07-09
gpt-5.6-terra,
2026-07-09
GPT-5,6-sol,
2026-07-09
GPT-5.5,
2026-04-24
GPT-5.4,
2026-03-05
GPT-5.4-MINI,
2026-03-17
gpt-5.3-codex,
2026-02-24
GPT-5.2,
2025-12-11
gpt-5.2-codex,
2026-01-14
GPT-5.1,
2025-11-13
gpt-5.1-codex,
2025-11-13
GPT-5,
2025-08-07
GPT-5-MINI,
2025-08-07
GPT-4.1,
2025-04-14
GPT-4.1-MINI,
2025-04-14
GPT-4.1-nano,
2025-04-14
o3,
2025-04-16
O4-mini,
2025-04-16
Implantação mínima provisionada da zona de dados global e regional 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15
Incremento de escala global e nas zonas de dados provisionadas 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5
Mínima implantação regional provisionada 50 50 50 50 50 25 50 50 50 50 50 50 25 50 25 25 50 25
Incremento de escala provisionada regional 50 50 50 50 50 25 50 50 50 50 50 50 25 50 25 25 50 25
TPM de entrada por PTU 5,950 2,400 1,200 1,200 2,400 7,900 3,400 3,400 3,400 4,750 4,750 4,750 23.750 3,000 14,900 59.400 3,000 5,400
Relação saída-entrada 6 6 6 6 6 6 8 8 8 8 8 8 8 4 4 4 4 4
Valor-alvo de latência1 99% > 100 TPS 99% > 70 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 100 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 80 TPS 99% > 80 TPS 99% > 90 TPS 99% > 100 TPS 99% > 80 TPS 99% > 90 TPS

1 Calculado como a latência de pedido p50 por cada 5 minutos. TPS = tokens por segundo.

Modelos anteriores do Azure OpenAI

Topic gpt-4o gpt-4o-mini O3-mini o1
Implantação mínima provisionada da zona de dados global e regional 15 15 15 15
Incremento de escala global e nas zonas de dados provisionadas 5 5 5 5
Mínima implantação regional provisionada 50 25 25 25
Incremento de escala provisionada regional 50 25 25 50
TPM de entrada por PTU 2,500 37,000 2,500 230
Relação saída-entrada 4 4 4 4
Valor-alvo de latência1 99% > 25 TPS 99% > 33 TPS 99% > 66 TPS 99% > 25 TPS

1 Calculado como a latência média dos pedidos por minuto ao longo do mês. TPS = tokens por segundo.

Modelos Foundry vendidos pela Azure

Esta secção lista outros Modelos Foundry vendidos pela Azure, não incluindo o OpenAI do Azure nos Modelos Foundry listados nas tabelas anteriores.

Topic Llama-3.3-70B-Instruct DeepSeek-R1 DeepSeek-V3-0324
Implantação mínima provisionada da zona de dados global e regional 100 100 100
Incremento de escala global e nas zonas de dados provisionadas 100 100 100
Mínima implantação regional provisionada NA NA NA
Incremento de escala provisionada regional NA NA NA
TPM de entrada por PTU 8,450 4,000 4,000
Relação saída-entrada 41 4 4
Valor alvo de latência2 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS

1 Para o Llama-3.3-70B-Instruct, um token de saída conta como quatro tokens de entrada para o seu limite de utilização. Esta razão difere da razão de preços padrão global entre tokens de entrada e saída. Veja Modelos com uma relação saída-entrada não padrão e preços do modelo Llama.

2 Calculado como a latência média dos pedidos por minuto ao longo do mês. TPS = tokens por segundo.

Fogos de artifício nos modelos do Microsoft Foundry

Os seguintes modelos Fireworks no Microsoft Foundry suportam tanto o throughput Global como o US Data Zone provisionado.

Topic DeepSeek v3.1 DeepSeek v3.2 DeepSeek V4 Flash DeepSeek V4 Pro Gemma 4 26B A4B IT Gemma 4 31B IT GLM-4.7 GLM 5 GLM-5.1 GLM 5.2 GPT-OSS-20B GPT-OSS-120B Kimi K2 Instruct 0905 Pensamento Kimi K2 Kimi K2.5 Kimi K2.6 Código Kimi K2.7 MiniMax M2.5 MiniMax M3 Ministral 3 3B Instrução 2512 Nemotron Super 120B Qwen 3 14B Qwen 3 32B Qwen 3.5 4B Qwen 3.5 9B Qwen 3.5 27B Qwen 3.5 35B A3B Qwen 3.5 112B A10B Qwen 3.5 397B Qwen 3.6 27B Qwen 3.6 35B A3B
Implantação mínima 200 300 100 400 200 200 200 300 400 400 80 40 200 200 200 200 200 400 400 40 100 80 80 80 40 550 40 100 100 40 40
Incremento de escala 100 150 50 200 100 100 100 150 200 200 40 20 100 100 100 100 100 200 200 20 50 40 40 40 20 275 20 50 50 20 20
TPM de entrada por PTU 2,100 3,000 2,800 200 5,400 2200 6000 600 900 300 25,000 13,500 2,500 1,400 1,060 4,000 2.000 5 300 5 300 25,400 4,850 4,800 5.000 35,500 10 700 2,730 17,800 5,600 4.250 7,700 31,000
Valor-alvo de latência1 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS

1 Calculado como a latência média dos pedidos por minuto ao longo do mês. TPS = tokens por segundo.

Appendix

Cada linha nas tabelas corresponde a um dos seguintes parâmetros:

Parâmetro Description
Zona global e de dados aprovisionada com implementação mínima O menor número de PTUs que pode implementar para os tipos de implementação Global Provisioned ou Data Zone Provisioned. Por exemplo, o GPT-5.2 exige uma implementação mínima de 15 PTUs.
Incremento global e de escala provisionada por zonas de dados O incremento de PTU pelo qual pode aumentar ou reduzir uma implementação com aprovisionamento global ou com aprovisionamento por zona de dados. Continuando com o exemplo do gpt-5.2, um incremento de 5 significa que as implantações podem ser dimensionadas em 15, 20, 25, e assim sucessivamente.
Implementação mínima regional aprovisionada O menor número de PTUs que pode implementar para uma implementação regional aprovisionada. Por exemplo, o gpt-5.2 exige uma implementação regional aprovisionada de, no mínimo, 50 PTUs.
Incremento da escala regional de provisões O incremento da PTU para implantações regionais provisionadas. Continuando com o exemplo do gpt-5.2, um incremento de 50 significa que as implementações podem ser dimensionadas para 50, 100, 150 e assim sucessivamente.
TPM de entrada por PTU O número máximo de tokens de entrada por minuto (TPM) que uma PTU suporta. Use este valor ao estimar PTUs.
Relação saída-entrada O peso aplicado aos tokens de saída ao estimar os requisitos de PTU. Este valor reflete a razão global de preço padrão do modelo entre os tokens de saída e de entrada, com exceções para alguns modelos. Por exemplo, um rácio de 8 significa que um token de saída conta como oito tokens de entrada para efeitos do limite de TPM do modelo. Consulte preços do Azure OpenAI, preços do modelo Llama e preços do modelo DeepSeek para conhecer os preços atuais.
Valor alvo de latência A latência esperada das solicitações ao nível de utilização de PTU indicado. Expresso como um limiar de percentil — por exemplo, "99% > 50 TPS" significa que 99% dos pedidos são processados a uma taxa superior a 50 tokens por segundo.