Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
A visualizar atualmente:Versão do novo portal Foundry - Mudar para a versão do portal clássico do Foundry
Antes de criar uma implantação aprovisionada, calcule quantas unidades de débito aprovisionado (PTUs) são necessárias para a sua carga de trabalho. Este artigo fornece os parâmetros de rendimento por modelo de que necessita e mostra como calcular os requisitos de PTU usando fórmulas de dimensionamento ou a calculadora de capacidade Foundry.
Se és novo no throughput provisionado, começa por O que é o throughput provisionado para Foundry Models?. Quando estiver pronto para criar a sua implementação, consulte Quickstart: Criar uma implementação de throughput provisionada.
Pré-requisitos
- Familiaridade com os conceitos de O que é o débito aprovisionado para o Foundry Models?.
- Uma estimativa das características da sua carga de trabalho: picos esperados de pedidos por minuto (RPM), tamanho médio do prompt em tokens e tamanho médio da resposta em tokens.
Estimar as PTUs necessárias
Existem duas abordagens disponíveis para estimar o número de PTUs necessárias para uma carga de trabalho:
- Utilizar as fórmulas de dimensionamento para ter controlo total sobre o cálculo
- Use a calculadora de capacidade da Foundry para uma estimativa orientada.
Ambas as abordagens utilizam valores por modelo das tabelas de parâmetros de implementação para gerar estimativas. Para obter resultados mais precisos, compare uma implementação com tráfego representativo em vez de depender apenas de entradas estimadas.
Note
Para modelos mais antigos (antes do GPT-4o), a distribuição de pedido/forma de chamada afeta o consumo de capacidade: um pequeno número de chamadas grandes pode consumir significativamente mais capacidade do que muitas chamadas pequenas com a mesma contagem média de tokens. Para GPT-4o e modelos posteriores, o TPM por PTU é definido separadamente para os tokens de entrada e saída, por isso este efeito de escalonamento não se aplica.
Estimar manualmente
Pode estimar as PTUs que a sua carga de trabalho requer usando os valores específicos do modelo das tabelas de parâmetros de implementação e informações sobre o tráfego esperado da seguinte forma:
| Entrada | Description |
|---|---|
| Modelo | O modelo que planeia implementar, por exemplo, gpt-5.2. Determina quais os valores de TPM de entrada por PTU e da razão saída-entrada a usar a partir das tabelas de parâmetros de implantação. |
| Tipo de implantação | O tipo de implementação provisionada: Global Provisioned, Data Zone Provisioned ou Regional Provisioned. |
| RPM de pico | O número máximo esperado de chamadas por minuto enviadas ao modelo. |
| Tamanho médio do prompt | O número médio de tokens de entrada por solicitação. |
| Tamanho médio da resposta | O número médio de tokens de saída por solicitação. |
| Taxa de cache | A percentagem de tokens de entrada servidos a partir da cache de prompts. Use 0 se não utilizar a cache. Os tokens em cache são deduzidos 100% do cálculo de utilização e não consomem capacidade de PTU. |
TPM normalizado
O cálculo manual das PTUs converte o volume esperado de tokens num único número chamado TPM normalizado. O número de PTUs necessários é então determinado dividindo-se o TPM normalizado pelo valor de TPM de entrada por PTU do modelo.
Fórmulas:
- Input TPM = RPM de pico × tamanho médio do prompt (tokens)
- TPM de saída = RPM de pico × tamanho médio da resposta (tokens)
- TPM normalizado = (TPM de entrada × (1 − taxa de cache)) + (relação saída-entrada-entrada × TPM de saída)
- PTUs necessárias = TPM normalizado ÷ TPM de entrada por PTU
Exemplo prático:
Suponha que a sua aplicação envia pedidos a uma taxa máxima de 1.000 RPM, com um tamanho médio de prompt de 200 tokens e um tamanho médio de resposta de 20 tokens, usando o modelo gpt-5.2 com implementação de throughput provisionada por Data Zone. Segundo a tabela, o gpt-5.2 tem um TPM de entrada por PTU de 3.400 e uma relação saída-entrada de 8.
- TPM de entrada = 1.000 × 200 = 200.000
- Saída TPM = 1.000 × 20 = 20.000
- TPM normalizado (sem cache) = 200.000 + (8 × 20.000) = 360.000
- PTUs necessárias = 360.000 ÷ 3.400 = 105,88 (110 PTUs arredondadas para as 5 PTUs mais próximas, correspondendo ao incremento da escala Data Zone Provisioned para gpt-5,2.)
Se forem servidos 50% de tokens de entrada a partir da cache de prompts:
- TPM de entrada efetiva = 200.000 × (1 − 0,50) = 100.000
- TPM normalizado = 100.000 + (8 × 20.000) = 260.000
- PTUs necessárias = 260.000 ÷ 3.400 = 76,47 (80 PTUs arredondadas para as 5 PTUs mais próximas, correspondendo ao incremento da escala Data Zone Provisioned para gpt-5.2.)
Em resumo, as PTUs necessárias para este exemplo de forma de chamada com e sem cache são as seguintes:
| Chamadas de pico por minuto (RPM) | Tamanho do prompt (tokens) | Tamanho da resposta (tokens) | Taxa de cache | TPM de entrada | TPM de saída | TPM normalizado | PTUs estimadas | PTUs (arredondadas para cima)1 |
|---|---|---|---|---|---|---|---|---|
| 1,000 | 200 | 20 | 0% | 200,000 | 20,000 | 360.000 | 105.88 | 110 |
| 1,000 | 200 | 20 | 50% | 100,000 | 20,000 | 260,000 | 76.47 | 80 |
1 Arredondado para as 5 PTUs mais próximas, correspondendo ao incremento da escala Data Zone Provisioned para gpt-5.2.
Use o calculador de capacidade
Use o calculador de capacidade no portal Foundry para dimensionar formas específicas de carga de trabalho. Encontre a calculadora na página de Quota e introduza os seguintes parâmetros com base na sua carga de trabalho:
| Entrada | Description |
|---|---|
| Modelo | O modelo que planeias usar. |
| Version | A versão do modelo que planeias usar. |
| Chamadas de pico por minuto | O número de chamadas por minuto que se prevê serem enviadas para o modelo. |
| Tokens na chamada do prompt | O número de tokens no prompt para cada chamada ao modelo. Chamadas com prompts mais extensos consomem mais capacidade de PTU. A calculadora assume um único valor de prompt — para cargas de trabalho com grande variação no tamanho do prompt, compare uma implementação com o seu tráfego real para uma estimativa mais precisa. |
| Tokens na resposta gerada pelo modelo | O número de tokens gerados por chamada, também chamado de tamanho de geração. Chamadas com maiores dimensões de geração consomem mais capacidade de PTU. Tal como nos tokens de prompt, a calculadora assume um único valor. |
| Taxa de cache | Percentagem de tokens de entrada servidos a partir da cache de prompts. |
Depois de preencher os dados exigidos, selecione Calcular. O resultado mostra:
- O número estimado de PTU necessário para a carga de trabalho. Este valor é arredondado ao incremento da escala de PTU mais próximo para o tipo de implementação selecionado, ou para a contagem mínima de PTU do tipo de implementação, consoante o que for maior.
- O número estimado de PTU em bruto (não arredondado).
Como os tokens de entrada e saída afetam o rendimento
A taxa de transferência (medida em tokens por minuto, ou TPM) que uma implantação obtém por PTU depende do modelo e da combinação de tokens de entrada e de saída num dado minuto. Gerar tokens de saída requer mais capacidade de processamento do que consumir tokens de entrada.
Para modelos GPT-4.1 e posteriores, o sistema determina uma relação saída-entrada para corresponder à razão padrão global de preços entre tokens de entrada e saída, com exceções para alguns modelos. Por exemplo
- Para o gpt-5, um token de saída equivale a oito tokens de entrada para efeitos do seu limite de utilização, correspondendo ao rácio de preço padrão global do modelo.
- Para o gpt-4.1, um token de saída conta como quatro tokens de entrada.
- Modelos mais antigos usam proporções diferentes.
Em todas as implementações, os tokens em cache são deduzidos em 100% no cálculo da utilização, o que significa que os tokens de prompt repetidos não consomem capacidade de PTU. Consulte Prompt caching para mais informações.
Modelos com uma relação saída-entrada não padrão
Alguns modelos utilizam uma relação saída-entrada que difere da sua razão padrão global de preços. Por exemplo, com o Llama-3.3-70B-Instruct, um token de saída conta como quatro tokens de entrada para o limite de utilização, o que difere do rácio de preços padrão desse modelo. Consulte os preços dos modelos Llama para ver a discriminação completa dos preços de entrada e de saída.
Parâmetros de implementação e valores de throughput por modelo
As tabelas nesta secção listam os parâmetros de rendimento e implementação para cada modelo suportado. Para entender o que significam os parâmetros em cada linha, consulte o Apêndice.
Modelos OpenAI mais recentes do Azure
Note
Os objetivos de latência na tabela seguinte excluem contexto extenso, isto é, pedidos que excedem o limiar:
-
128k tokens de prompt para
gpt-5.4,gpt-4.1,gpt-4.1-mini, egpt-4.1-nano -
272k tokens de prompt para
gpt-5.6-terraegpt-5.6-sol
O sistema encaminha esses pedidos para implementações de contingência, se estiverem disponíveis. Caso contrário, os pedidos devolvem um erro.
| Topic |
gpt-5.6-terra, 2026-07-09 |
GPT-5,6-sol, 2026-07-09 |
GPT-5.5, 2026-04-24 |
GPT-5.4, 2026-03-05 |
GPT-5.4-MINI, 2026-03-17 |
gpt-5.3-codex, 2026-02-24 |
GPT-5.2, 2025-12-11 |
gpt-5.2-codex, 2026-01-14 |
GPT-5.1, 2025-11-13 |
gpt-5.1-codex, 2025-11-13 |
GPT-5, 2025-08-07 |
GPT-5-MINI, 2025-08-07 |
GPT-4.1, 2025-04-14 |
GPT-4.1-MINI, 2025-04-14 |
GPT-4.1-nano, 2025-04-14 |
o3, 2025-04-16 |
O4-mini, 2025-04-16 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Implantação mínima provisionada da zona de dados global e regional | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 |
| Incremento de escala global e nas zonas de dados provisionadas | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 |
| Mínima implantação regional provisionada | 50 | 50 | 50 | 50 | 25 | 50 | 50 | 50 | 50 | 50 | 50 | 25 | 50 | 25 | 25 | 50 | 25 |
| Incremento de escala provisionada regional | 50 | 50 | 50 | 50 | 25 | 50 | 50 | 50 | 50 | 50 | 50 | 25 | 50 | 25 | 25 | 50 | 25 |
| TPM de entrada por PTU | 2,400 | 1,200 | 1,200 | 2,400 | 7,900 | 3,400 | 3,400 | 3,400 | 4,750 | 4,750 | 4,750 | 23.750 | 3,000 | 14,900 | 59.400 | 3,000 | 5,400 |
| Relação saída-entrada | 6 | 6 | 6 | 6 | 6 | 8 | 8 | 8 | 8 | 8 | 8 | 8 | 4 | 4 | 4 | 4 | 4 |
| Valor-alvo de latência1 | 99% > 70 TPS | 99% > 50 TPS | 99% > 100 TPS | 99% > 50 TPS | 99% > 100 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 80 TPS | 99% > 80 TPS | 99% > 90 TPS | 99% > 100 TPS | 99% > 80 TPS | 99% > 90 TPS |
1 Calculado como a latência de pedido p50 por cada 5 minutos. TPS = tokens por segundo.
Modelos anteriores do Azure OpenAI
| Topic | gpt-4o | gpt-4o-mini | O3-mini | o1 |
|---|---|---|---|---|
| Implantação mínima provisionada da zona de dados global e regional | 15 | 15 | 15 | 15 |
| Incremento de escala global e nas zonas de dados provisionadas | 5 | 5 | 5 | 5 |
| Mínima implantação regional provisionada | 50 | 25 | 25 | 25 |
| Incremento de escala provisionada regional | 50 | 25 | 25 | 50 |
| TPM de entrada por PTU | 2,500 | 37,000 | 2,500 | 230 |
| Relação saída-entrada | 4 | 4 | 4 | 4 |
| Valor-alvo de latência1 | 99% > 25 TPS | 99% > 33 TPS | 99% > 66 TPS | 99% > 25 TPS |
1 Calculado como a latência média dos pedidos por minuto ao longo do mês. TPS = tokens por segundo.
Modelos Foundry vendidos pela Azure
Esta secção lista outros Modelos Foundry vendidos pela Azure, não incluindo o OpenAI do Azure nos Modelos Foundry listados nas tabelas anteriores.
| Topic | Llama-3.3-70B-Instruct | DeepSeek-R1 | DeepSeek-V3-0324 |
|---|---|---|---|
| Implantação mínima provisionada da zona de dados global e regional | 100 | 100 | 100 |
| Incremento de escala global e nas zonas de dados provisionadas | 100 | 100 | 100 |
| Mínima implantação regional provisionada | NA | NA | NA |
| Incremento de escala provisionada regional | NA | NA | NA |
| TPM de entrada por PTU | 8,450 | 4,000 | 4,000 |
| Relação saída-entrada | 41 | 4 | 4 |
| Valor alvo de latência2 | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS |
1 Para o Llama-3.3-70B-Instruct, um token de saída conta como quatro tokens de entrada para o seu limite de utilização. Esta razão difere da razão de preços padrão global entre tokens de entrada e saída. Veja Modelos com uma relação saída-entrada não padrão e preços do modelo Llama.
2 Calculado como a latência média dos pedidos por minuto ao longo do mês. TPS = tokens por segundo.
Fogos de artifício nos modelos do Microsoft Foundry
Os seguintes modelos Fireworks do Microsoft Foundry suportam throughput provisionado tanto da Zona de Dados Global como da Zona de Dados dos EUA.
| Topic | DeepSeek v3.1 | DeepSeek v3.2 | DeepSeek V4 Flash | DeepSeek V4 Pro | Gemma 4 26B A4B IT | Gemma 4 31B IT | GLM-4.7 | GLM 5 | GLM-5.1 | GLM 5.2 | GPT-OSS-120B | Kimi K2 Instruct 0905 | Pensamento Kimi K2 | Kimi K2.5 | Kimi K2.6 | Código Kimi K2.7 | MiniMax M2.5 | Ministral 3 3B Instruct 2512 | Nemotron Super 120B | Qwen 3.5 9B | Qwen 3.5 35B A3B | Qwen 3.5 112B A10B | Qwen 3.5 397B | Qwen 3.6 27B | Qwen 3.6 35B A3B |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Implantação mínima | 200 | 300 | 100 | 400 | 200 | 200 | 200 | 300 | 400 | 400 | 40 | 200 | 200 | 200 | 200 | 200 | 400 | 40 | 100 | 40 | 40 | 100 | 100 | 40 | 40 |
| Incremento de escala | 100 | 150 | 50 | 200 | 100 | 100 | 100 | 150 | 200 | 200 | 20 | 100 | 100 | 100 | 100 | 100 | 200 | 20 | 50 | 20 | 20 | 50 | 50 | 20 | 20 |
| TPM de entrada por PTU | 2,100 | 3,000 | 2,800 | 200 | 5,400 | 2200 | 6000 | 600 | 900 | 300 | 13,500 | 2,500 | 1,400 | 1,060 | 4,000 | 2.000 | 5.300 | 25,400 | 4,850 | 10 700 | 17,800 | 5,600 | 4.250 | 7,700 | 31,000 |
| Valor-alvo de latência1 | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS | 99% > 50 TPS |
1 Calculado como a latência média dos pedidos por minuto ao longo do mês. TPS = tokens por segundo.
Appendix
Cada linha nas tabelas corresponde a um dos seguintes parâmetros:
| Parâmetro | Description |
|---|---|
| Zona global e de dados com implantação mínima aprovisionada | O número mínimo de PTUs que pode implementar para os tipos de implementação Global Provisioned ou Data Zone Provisioned. Por exemplo, o gpt-5.2 exige uma implementação mínima de 15 PTUs. |
| Incremento global e de escala provisionada por zonas de dados | O incremento de PTU pelo qual pode aumentar ou diminuir uma implementação aprovisionada globalmente ou aprovisionada por zona de dados. Continuando com o exemplo do gpt-5.2, um incremento de 5 significa que as implantações podem ser dimensionadas em 15, 20, 25, e assim sucessivamente. |
| Implementação mínima aprovisionada regional | O menor número de PTUs que pode ser implementado para uma implementação provisionada regional. Por exemplo, o gpt-5.2 exige um desdobramento regional provisionado mínimo de 50 PTUs. |
| Incremento da escala regional de provisões | O incremento da PTU para implantações regionais provisionadas. Continuando com o exemplo do gpt-5.2, um incremento de 50 significa que as implementações podem ter dimensões de 50, 100, 150 e assim sucessivamente. |
| TPM de entrada por PTU | O número máximo de tokens de entrada por minuto (TPM) que uma PTU suporta. Use este valor ao estimar PTUs. |
| Relação saída-entrada | O peso aplicado aos tokens de saída ao calcular os requisitos de PTU. Este valor reflete a razão global de preço padrão do modelo entre os tokens de saída e de entrada, com exceções para alguns modelos. Por exemplo, um rácio de 8 significa que um token de saída conta como oito tokens de entrada para efeitos do limite de TPM do modelo. Consulte os preços do Azure OpenAI, os preços do modelo Llama e os preços do modelo DeepSeek para consultar os preços atuais. |
| Valor alvo de latência | A latência esperada das solicitações no nível de utilização de PTU indicado. Expresso sob a forma de um limiar percentílico — por exemplo, "99% > 50 TPS" significa que 99% dos pedidos são processados a uma velocidade superior a 50 tokens por segundo. |