Pagamento prioritário por token para APIs de modelo de base

Esta página descreve o pagamento por token com prioridade para APIs de Foundation Model com pagamento por token, incluindo como funciona e como enviar pedidos prioritários.

O que é o pagamento prioritário por token?

Pagamento prioritário por token, também designado por modo prioritário, é uma funcionalidade de pagamento por token para aplicações em tempo real sensíveis à latência. Quando envia um pedido com o parâmetro service_tier definido como "priority", o Azure Databricks dá prioridade a esse pedido em relação ao tráfego padrão em regime de melhor esforço com pagamento por token no mesmo modelo. Isto mantém a disponibilidade mais consistente durante períodos de grande tráfego.

O pagamento prioritário por token é opcional em cada pedido, pelo que pode enviar pedidos prioritários e normais para o mesmo modelo. Não requer compromisso de capacidade e é faturado a uma taxa por token superior aos pedidos padrão de pagamento por token.

O Databricks recomenda o modo prioritário quando:

  • Precisa de desempenho e disponibilidade mais consistentes do que o pay-per-token padrão, mas ainda não está pronto para se comprometer com uma capacidade dedicada.
  • As suas aplicações de produção exigem maior disponibilidade.

Modelos suportados

Os seguintes modelos pay-per-token suportam o modo de prioridade. Para enviar um pedido prioritário, use o nome do endpoint do modelo com o parâmetro service_tier definido como "priority".

Importante

O pagamento prioritário por token está disponível para os modelos OpenAI e Google Gemini através dos Serviços ADI, disponibilizados pela Databricks. Para aceder a estes modelos parceiros no seu ambiente Azure Databricks, consulte Serviços ADI.

Modelos de código aberto

Provider Model Nome do ponto final Notes
Alibaba Nuvem Qwen3.5 122B A10B databricks-qwen35-122b-a10b
  • Este modelo está disponível em pré-visualização. Contacta as equipas da tua conta para capacitação.
  • Disponível apenas na westeurope região.

Como se comporta o pay-per-token prioritário

Considere o seguinte comportamento antes de usar o pagamento prioritário por token:

  • Desempenho e disponibilidade consistentes. O pay-per-token com prioridade foi concebido para manter a disponibilidade estável sob carga. Não garante um tempo específico até ao primeiro token ou um objetivo de latência de ponta a ponta. Os pedidos prioritários visam uma maior disponibilidade do que os pedidos padrão de pagamento por token. O Azure Databricks define disponibilidade num nível como o número de pedidos bem-sucedidos dividido pelo total de pedidos admitidos nesse nível.
  • Capacidade de melhor esforço. O modo prioritário não reserva capacidade e não há compromisso de capacidade.
  • Reverter para o pagamento padrão por token. Se a capacidade prioritária estiver totalmente esgotada, os pedidos são processados com a disponibilidade padrão de pagamento por token e faturados às taxas padrão de pagamento por token.
  • Prémio por token. Os pedidos prioritários são faturados a uma taxa por token mais alta do que os pedidos padrão de pagamento por token.

Tarifação prioritária por token em comparação com débito aprovisionado

O pagamento prioritário por token e o débito aprovisionado destinam-se ambos a cargas de trabalho de produção, mas implicam compromissos diferentes:

Consideração Pagamento prioritário por token Capacidade de processamento provisionada
Capacity Melhor esforço, partilhado. Capacidade dedicada e reservada.
Compromisso Nenhum. Ative por pedido. Requer um endpoint provisionado.
Availability Mais consistente do que o pay-per-token padrão sob carga. Previsível, baseado na capacidade reservada.
Billing Por token, a um preço superior ao pay-per-token padrão. Baseado em unidades modelo provisionadas.

Enviar um pedido de prioridade

Para utilizar o modo de prioridade, defina o parâmetro service_tier para "priority" para cada pedido. O exemplo seguinte utiliza o cliente OpenAI:

from databricks_openai import DatabricksOpenAI

client = DatabricksOpenAI()

response = client.chat.completions.create(
    model="databricks-model-name",
    messages=[
      {
        "role": "user",
        "content": "What is a mixture of experts model?",
      }
    ],
    max_tokens=256,
    service_tier="priority",
)

Consulte a referência da API REST do modelo Foundation para a sintaxe dos parâmetros e Use Foundation models para mais opções de consulta.

Limites de capacidade

Cada cluster suporta um número máximo total de tokens por minuto entre todos os locatários. O Azure Databricks define um limite por inquilino durante a integração para que um único inquilino não possa consumir toda a capacidade do cluster. Se a sua carga de trabalho exigir mais capacidade do que o limite por locatário permite, contacte a sua equipa de conta da Databricks.

Para mais limites das APIs do Foundation Model, consulte limites e quotas das APIs do Foundation Model.

Recursos adicionais