Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Esta página descreve o pagamento por token com prioridade para APIs de Foundation Model com pagamento por token, incluindo como funciona e como enviar pedidos prioritários.
O que é o pagamento prioritário por token?
Pagamento prioritário por token, também designado por modo prioritário, é uma funcionalidade de pagamento por token para aplicações em tempo real sensíveis à latência. Quando envia um pedido com o parâmetro service_tier definido como "priority", o Azure Databricks dá prioridade a esse pedido em relação ao tráfego padrão em regime de melhor esforço com pagamento por token no mesmo modelo. Isto mantém a disponibilidade mais consistente durante períodos de grande tráfego.
O pagamento prioritário por token é opcional em cada pedido, pelo que pode enviar pedidos prioritários e normais para o mesmo modelo. Não requer compromisso de capacidade e é faturado a uma taxa por token superior aos pedidos padrão de pagamento por token.
O Databricks recomenda o modo prioritário quando:
- Precisa de desempenho e disponibilidade mais consistentes do que o pay-per-token padrão, mas ainda não está pronto para se comprometer com uma capacidade dedicada.
- As suas aplicações de produção exigem maior disponibilidade.
Modelos suportados
Os seguintes modelos pay-per-token suportam o modo de prioridade. Para enviar um pedido prioritário, use o nome do endpoint do modelo com o parâmetro service_tier definido como "priority".
Importante
O pagamento prioritário por token está disponível para os modelos OpenAI e Google Gemini através dos Serviços ADI, disponibilizados pela Databricks. Para aceder a estes modelos parceiros no seu ambiente Azure Databricks, consulte Serviços ADI.
Modelos de código aberto
| Provider | Model | Nome do ponto final | Notes |
|---|---|---|---|
| Alibaba Nuvem | Qwen3.5 122B A10B | databricks-qwen35-122b-a10b |
|
Como se comporta o pay-per-token prioritário
Considere o seguinte comportamento antes de usar o pagamento prioritário por token:
- Desempenho e disponibilidade consistentes. O pay-per-token com prioridade foi concebido para manter a disponibilidade estável sob carga. Não garante um tempo específico até ao primeiro token ou um objetivo de latência de ponta a ponta. Os pedidos prioritários visam uma maior disponibilidade do que os pedidos padrão de pagamento por token. O Azure Databricks define disponibilidade num nível como o número de pedidos bem-sucedidos dividido pelo total de pedidos admitidos nesse nível.
- Capacidade de melhor esforço. O modo prioritário não reserva capacidade e não há compromisso de capacidade.
- Reverter para o pagamento padrão por token. Se a capacidade prioritária estiver totalmente esgotada, os pedidos são processados com a disponibilidade padrão de pagamento por token e faturados às taxas padrão de pagamento por token.
- Prémio por token. Os pedidos prioritários são faturados a uma taxa por token mais alta do que os pedidos padrão de pagamento por token.
Tarifação prioritária por token em comparação com débito aprovisionado
O pagamento prioritário por token e o débito aprovisionado destinam-se ambos a cargas de trabalho de produção, mas implicam compromissos diferentes:
| Consideração | Pagamento prioritário por token | Capacidade de processamento provisionada |
|---|---|---|
| Capacity | Melhor esforço, partilhado. | Capacidade dedicada e reservada. |
| Compromisso | Nenhum. Ative por pedido. | Requer um endpoint provisionado. |
| Availability | Mais consistente do que o pay-per-token padrão sob carga. | Previsível, baseado na capacidade reservada. |
| Billing | Por token, a um preço superior ao pay-per-token padrão. | Baseado em unidades modelo provisionadas. |
Enviar um pedido de prioridade
Para utilizar o modo de prioridade, defina o parâmetro service_tier para "priority" para cada pedido. O exemplo seguinte utiliza o cliente OpenAI:
from databricks_openai import DatabricksOpenAI
client = DatabricksOpenAI()
response = client.chat.completions.create(
model="databricks-model-name",
messages=[
{
"role": "user",
"content": "What is a mixture of experts model?",
}
],
max_tokens=256,
service_tier="priority",
)
Consulte a referência da API REST do modelo Foundation para a sintaxe dos parâmetros e Use Foundation models para mais opções de consulta.
Limites de capacidade
Cada cluster suporta um número máximo total de tokens por minuto entre todos os locatários. O Azure Databricks define um limite por inquilino durante a integração para que um único inquilino não possa consumir toda a capacidade do cluster. Se a sua carga de trabalho exigir mais capacidade do que o limite por locatário permite, contacte a sua equipa de conta da Databricks.
Para mais limites das APIs do Foundation Model, consulte limites e quotas das APIs do Foundation Model.