Determinar o dimensionamento da PTU para uma carga de trabalho

A visualizar atualmente:Versão do novo portal Foundry - Mudar para a versão do portal clássico do Foundry

Antes de criar uma implantação aprovisionada, calcule quantas unidades de débito aprovisionado (PTUs) são necessárias para a sua carga de trabalho. Este artigo fornece os parâmetros de rendimento por modelo de que necessita e mostra como calcular os requisitos de PTU usando fórmulas de dimensionamento ou a calculadora de capacidade Foundry.

Se és novo no throughput provisionado, começa por O que é o throughput provisionado para Foundry Models?. Quando estiver pronto para criar a sua implementação, consulte Quickstart: Criar uma implementação de throughput provisionada.

Pré-requisitos

Estimar as PTUs necessárias

Existem duas abordagens disponíveis para estimar o número de PTUs necessárias para uma carga de trabalho:

Ambas as abordagens utilizam valores por modelo das tabelas de parâmetros de implementação para gerar estimativas. Para obter resultados mais precisos, compare uma implementação com tráfego representativo em vez de depender apenas de entradas estimadas.

Note

Para modelos mais antigos (antes do GPT-4o), a distribuição de pedido/forma de chamada afeta o consumo de capacidade: um pequeno número de chamadas grandes pode consumir significativamente mais capacidade do que muitas chamadas pequenas com a mesma contagem média de tokens. Para GPT-4o e modelos posteriores, o TPM por PTU é definido separadamente para os tokens de entrada e saída, por isso este efeito de escalonamento não se aplica.

Estimar manualmente

Pode estimar as PTUs que a sua carga de trabalho requer usando os valores específicos do modelo das tabelas de parâmetros de implementação e informações sobre o tráfego esperado da seguinte forma:

Entrada Description
Modelo O modelo que planeia implementar, por exemplo, gpt-5.2. Determina quais os valores de TPM de entrada por PTU e da razão saída-entrada a usar a partir das tabelas de parâmetros de implantação.
Tipo de implantação O tipo de implementação provisionada: Global Provisioned, Data Zone Provisioned ou Regional Provisioned.
RPM de pico O número máximo esperado de chamadas por minuto enviadas ao modelo.
Tamanho médio do prompt O número médio de tokens de entrada por solicitação.
Tamanho médio da resposta O número médio de tokens de saída por solicitação.
Taxa de cache A percentagem de tokens de entrada servidos a partir da cache de prompts. Use 0 se não utilizar a cache. Os tokens em cache são deduzidos 100% do cálculo de utilização e não consomem capacidade de PTU.

TPM normalizado

O cálculo manual das PTUs converte o volume esperado de tokens num único número chamado TPM normalizado. O número de PTUs necessários é então determinado dividindo-se o TPM normalizado pelo valor de TPM de entrada por PTU do modelo.

Fórmulas:

  • Input TPM = RPM de pico × tamanho médio do prompt (tokens)
  • TPM de saída = RPM de pico × tamanho médio da resposta (tokens)
  • TPM normalizado = (TPM de entrada × (1 − taxa de cache)) + (relação saída-entrada-entrada × TPM de saída)
  • PTUs necessárias = TPM normalizado ÷ TPM de entrada por PTU

Exemplo prático:

Suponha que a sua aplicação envia pedidos a uma taxa máxima de 1.000 RPM, com um tamanho médio de prompt de 200 tokens e um tamanho médio de resposta de 20 tokens, usando o modelo gpt-5.2 com implementação de throughput provisionada por Data Zone. Segundo a tabela, o gpt-5.2 tem um TPM de entrada por PTU de 3.400 e uma relação saída-entrada de 8.

  • TPM de entrada = 1.000 × 200 = 200.000
  • Saída TPM = 1.000 × 20 = 20.000
  • TPM normalizado (sem cache) = 200.000 + (8 × 20.000) = 360.000
  • PTUs necessárias = 360.000 ÷ 3.400 = 105,88 (110 PTUs arredondadas para as 5 PTUs mais próximas, correspondendo ao incremento da escala Data Zone Provisioned para gpt-5,2.)

Se forem servidos 50% de tokens de entrada a partir da cache de prompts:

  • TPM de entrada efetiva = 200.000 × (1 − 0,50) = 100.000
  • TPM normalizado = 100.000 + (8 × 20.000) = 260.000
  • PTUs necessárias = 260.000 ÷ 3.400 = 76,47 (80 PTUs arredondadas para as 5 PTUs mais próximas, correspondendo ao incremento da escala Data Zone Provisioned para gpt-5.2.)

Em resumo, as PTUs necessárias para este exemplo de forma de chamada com e sem cache são as seguintes:

Chamadas de pico por minuto (RPM) Tamanho do prompt (tokens) Tamanho da resposta (tokens) Taxa de cache TPM de entrada TPM de saída TPM normalizado PTUs estimadas PTUs (arredondadas para cima)1
1,000 200 20 0% 200,000 20,000 360.000 105.88 110
1,000 200 20 50% 100,000 20,000 260,000 76.47 80

1 Arredondado para as 5 PTUs mais próximas, correspondendo ao incremento da escala Data Zone Provisioned para gpt-5.2.

Use o calculador de capacidade

Use o calculador de capacidade no portal Foundry para dimensionar formas específicas de carga de trabalho. Encontre a calculadora na página de Quota e introduza os seguintes parâmetros com base na sua carga de trabalho:

Entrada Description
Modelo O modelo que planeias usar.
Version A versão do modelo que planeias usar.
Chamadas de pico por minuto O número de chamadas por minuto que se prevê serem enviadas para o modelo.
Tokens na chamada do prompt O número de tokens no prompt para cada chamada ao modelo. Chamadas com prompts mais extensos consomem mais capacidade de PTU. A calculadora assume um único valor de prompt — para cargas de trabalho com grande variação no tamanho do prompt, compare uma implementação com o seu tráfego real para uma estimativa mais precisa.
Tokens na resposta gerada pelo modelo O número de tokens gerados por chamada, também chamado de tamanho de geração. Chamadas com maiores dimensões de geração consomem mais capacidade de PTU. Tal como nos tokens de prompt, a calculadora assume um único valor.
Taxa de cache Percentagem de tokens de entrada servidos a partir da cache de prompts.

Depois de preencher os dados exigidos, selecione Calcular. O resultado mostra:

  • O número estimado de PTU necessário para a carga de trabalho. Este valor é arredondado ao incremento da escala de PTU mais próximo para o tipo de implementação selecionado, ou para a contagem mínima de PTU do tipo de implementação, consoante o que for maior.
  • O número estimado de PTU em bruto (não arredondado).

Como os tokens de entrada e saída afetam o rendimento

A taxa de transferência (medida em tokens por minuto, ou TPM) que uma implantação obtém por PTU depende do modelo e da combinação de tokens de entrada e de saída num dado minuto. Gerar tokens de saída requer mais capacidade de processamento do que consumir tokens de entrada.

Para modelos GPT-4.1 e posteriores, o sistema determina uma relação saída-entrada para corresponder à razão padrão global de preços entre tokens de entrada e saída, com exceções para alguns modelos. Por exemplo

  • Para o gpt-5, um token de saída equivale a oito tokens de entrada para efeitos do seu limite de utilização, correspondendo ao rácio de preço padrão global do modelo.
  • Para o gpt-4.1, um token de saída conta como quatro tokens de entrada.
  • Modelos mais antigos usam proporções diferentes.

Em todas as implementações, os tokens em cache são deduzidos em 100% no cálculo da utilização, o que significa que os tokens de prompt repetidos não consomem capacidade de PTU. Consulte Prompt caching para mais informações.

Modelos com uma relação saída-entrada não padrão

Alguns modelos utilizam uma relação saída-entrada que difere da sua razão padrão global de preços. Por exemplo, com o Llama-3.3-70B-Instruct, um token de saída conta como quatro tokens de entrada para o limite de utilização, o que difere do rácio de preços padrão desse modelo. Consulte os preços dos modelos Llama para ver a discriminação completa dos preços de entrada e de saída.

Parâmetros de implementação e valores de throughput por modelo

As tabelas nesta secção listam os parâmetros de rendimento e implementação para cada modelo suportado. Para entender o que significam os parâmetros em cada linha, consulte o Apêndice.

Modelos OpenAI mais recentes do Azure

Note

Os objetivos de latência na tabela seguinte excluem contexto extenso, isto é, pedidos que excedem o limiar:

  • 128k tokens de prompt para gpt-5.4, gpt-4.1, gpt-4.1-mini, e gpt-4.1-nano
  • 272k tokens de prompt para gpt-5.6-terra e gpt-5.6-sol

O sistema encaminha esses pedidos para implementações de contingência, se estiverem disponíveis. Caso contrário, os pedidos devolvem um erro.

Topic gpt-5.6-terra,
2026-07-09
GPT-5,6-sol,
2026-07-09
GPT-5.5,
2026-04-24
GPT-5.4,
2026-03-05
GPT-5.4-MINI,
2026-03-17
gpt-5.3-codex,
2026-02-24
GPT-5.2,
2025-12-11
gpt-5.2-codex,
2026-01-14
GPT-5.1,
2025-11-13
gpt-5.1-codex,
2025-11-13
GPT-5,
2025-08-07
GPT-5-MINI,
2025-08-07
GPT-4.1,
2025-04-14
GPT-4.1-MINI,
2025-04-14
GPT-4.1-nano,
2025-04-14
o3,
2025-04-16
O4-mini,
2025-04-16
Implantação mínima provisionada da zona de dados global e regional 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15
Incremento de escala global e nas zonas de dados provisionadas 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5
Mínima implantação regional provisionada 50 50 50 50 25 50 50 50 50 50 50 25 50 25 25 50 25
Incremento de escala provisionada regional 50 50 50 50 25 50 50 50 50 50 50 25 50 25 25 50 25
TPM de entrada por PTU 2,400 1,200 1,200 2,400 7,900 3,400 3,400 3,400 4,750 4,750 4,750 23.750 3,000 14,900 59.400 3,000 5,400
Relação saída-entrada 6 6 6 6 6 8 8 8 8 8 8 8 4 4 4 4 4
Valor-alvo de latência1 99% > 70 TPS 99% > 50 TPS 99% > 100 TPS 99% > 50 TPS 99% > 100 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 80 TPS 99% > 80 TPS 99% > 90 TPS 99% > 100 TPS 99% > 80 TPS 99% > 90 TPS

1 Calculado como a latência de pedido p50 por cada 5 minutos. TPS = tokens por segundo.

Modelos anteriores do Azure OpenAI

Topic gpt-4o gpt-4o-mini O3-mini o1
Implantação mínima provisionada da zona de dados global e regional 15 15 15 15
Incremento de escala global e nas zonas de dados provisionadas 5 5 5 5
Mínima implantação regional provisionada 50 25 25 25
Incremento de escala provisionada regional 50 25 25 50
TPM de entrada por PTU 2,500 37,000 2,500 230
Relação saída-entrada 4 4 4 4
Valor-alvo de latência1 99% > 25 TPS 99% > 33 TPS 99% > 66 TPS 99% > 25 TPS

1 Calculado como a latência média dos pedidos por minuto ao longo do mês. TPS = tokens por segundo.

Modelos Foundry vendidos pela Azure

Esta secção lista outros Modelos Foundry vendidos pela Azure, não incluindo o OpenAI do Azure nos Modelos Foundry listados nas tabelas anteriores.

Topic Llama-3.3-70B-Instruct DeepSeek-R1 DeepSeek-V3-0324
Implantação mínima provisionada da zona de dados global e regional 100 100 100
Incremento de escala global e nas zonas de dados provisionadas 100 100 100
Mínima implantação regional provisionada NA NA NA
Incremento de escala provisionada regional NA NA NA
TPM de entrada por PTU 8,450 4,000 4,000
Relação saída-entrada 41 4 4
Valor alvo de latência2 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS

1 Para o Llama-3.3-70B-Instruct, um token de saída conta como quatro tokens de entrada para o seu limite de utilização. Esta razão difere da razão de preços padrão global entre tokens de entrada e saída. Veja Modelos com uma relação saída-entrada não padrão e preços do modelo Llama.

2 Calculado como a latência média dos pedidos por minuto ao longo do mês. TPS = tokens por segundo.

Fogos de artifício nos modelos do Microsoft Foundry

Os seguintes modelos Fireworks do Microsoft Foundry suportam throughput provisionado tanto da Zona de Dados Global como da Zona de Dados dos EUA.

Topic DeepSeek v3.1 DeepSeek v3.2 DeepSeek V4 Flash DeepSeek V4 Pro Gemma 4 26B A4B IT Gemma 4 31B IT GLM-4.7 GLM 5 GLM-5.1 GLM 5.2 GPT-OSS-120B Kimi K2 Instruct 0905 Pensamento Kimi K2 Kimi K2.5 Kimi K2.6 Código Kimi K2.7 MiniMax M2.5 Ministral 3 3B Instruct 2512 Nemotron Super 120B Qwen 3.5 9B Qwen 3.5 35B A3B Qwen 3.5 112B A10B Qwen 3.5 397B Qwen 3.6 27B Qwen 3.6 35B A3B
Implantação mínima 200 300 100 400 200 200 200 300 400 400 40 200 200 200 200 200 400 40 100 40 40 100 100 40 40
Incremento de escala 100 150 50 200 100 100 100 150 200 200 20 100 100 100 100 100 200 20 50 20 20 50 50 20 20
TPM de entrada por PTU 2,100 3,000 2,800 200 5,400 2200 6000 600 900 300 13,500 2,500 1,400 1,060 4,000 2.000 5.300 25,400 4,850 10 700 17,800 5,600 4.250 7,700 31,000
Valor-alvo de latência1 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS 99% > 50 TPS

1 Calculado como a latência média dos pedidos por minuto ao longo do mês. TPS = tokens por segundo.

Appendix

Cada linha nas tabelas corresponde a um dos seguintes parâmetros:

Parâmetro Description
Zona global e de dados com implantação mínima aprovisionada O número mínimo de PTUs que pode implementar para os tipos de implementação Global Provisioned ou Data Zone Provisioned. Por exemplo, o gpt-5.2 exige uma implementação mínima de 15 PTUs.
Incremento global e de escala provisionada por zonas de dados O incremento de PTU pelo qual pode aumentar ou diminuir uma implementação aprovisionada globalmente ou aprovisionada por zona de dados. Continuando com o exemplo do gpt-5.2, um incremento de 5 significa que as implantações podem ser dimensionadas em 15, 20, 25, e assim sucessivamente.
Implementação mínima aprovisionada regional O menor número de PTUs que pode ser implementado para uma implementação provisionada regional. Por exemplo, o gpt-5.2 exige um desdobramento regional provisionado mínimo de 50 PTUs.
Incremento da escala regional de provisões O incremento da PTU para implantações regionais provisionadas. Continuando com o exemplo do gpt-5.2, um incremento de 50 significa que as implementações podem ter dimensões de 50, 100, 150 e assim sucessivamente.
TPM de entrada por PTU O número máximo de tokens de entrada por minuto (TPM) que uma PTU suporta. Use este valor ao estimar PTUs.
Relação saída-entrada O peso aplicado aos tokens de saída ao calcular os requisitos de PTU. Este valor reflete a razão global de preço padrão do modelo entre os tokens de saída e de entrada, com exceções para alguns modelos. Por exemplo, um rácio de 8 significa que um token de saída conta como oito tokens de entrada para efeitos do limite de TPM do modelo. Consulte os preços do Azure OpenAI, os preços do modelo Llama e os preços do modelo DeepSeek para consultar os preços atuais.
Valor alvo de latência A latência esperada das solicitações no nível de utilização de PTU indicado. Expresso sob a forma de um limiar percentílico — por exemplo, "99% > 50 TPS" significa que 99% dos pedidos são processados a uma velocidade superior a 50 tokens por segundo.