파운데이션 모델 API용 토큰당 우선 과금

이 페이지에서는 파운데이션 모델 API의 토큰당 과금에 대한 우선순위 과금과 그 작동 방식, 그리고 우선순위 요청을 보내는 방법을 설명합니다.

우선순위 토큰당 과금이란?

우선 순위 모드라고도 하는 우선 순위 토큰당 종량제는 대기 시간이 중요한 실시간 애플리케이션에 대한 토큰당 종량제 기능입니다. service_tier 매개 변수를 "priority"(으)로 설정하여 요청을 보내면 Azure Databricks는 동일한 모델의 표준 best-effort 토큰당 과금 트래픽보다 해당 요청을 먼저 수락합니다. 이렇게 하면 트래픽이 많은 기간 동안 가용성이 더 일관되게 유지됩니다.

우선순위 토큰당 과금은 각 요청마다 선택적으로 적용되므로, 동일한 모델에 우선순위 요청과 표준 요청을 모두 보낼 수 있습니다. 용량 약정이 필요하지 않으며 표준 토큰당 종량제 요청보다 더 높은 토큰당 요금으로 청구됩니다.

Databricks는 다음과 같은 경우 우선 순위 모드를 권장합니다.

  • 표준 토큰당 종량제보다 더 일관된 성능과 가용성이 필요하지만 전용 용량에 커밋할 준비가 되지 않았습니다.
  • 프로덕션 애플리케이션에는 더 높은 가용성이 필요합니다.

지원되는 모델

토큰당 우선 순위 지불은 Databricks에서 제공하는 ADI 서비스를 통해 OpenAI 및 Google Gemini 모델에 사용할 수 있습니다. Azure Databricks 환경에서 이러한 모델에 액세스하려면 ADI Services 참조하세요.

토큰당 우선순위 과금의 작동 방식

우선 순위 종량제 토큰을 사용하기 전에 다음 동작을 고려합니다.

  • 일관된 성능 및 가용성 우선 순위 토큰당 종량제는 부하 상태에서 가용성을 일관되게 유지하도록 설계되었습니다. 첫 토큰 생성 시간이나 종단 간 지연 시간에 대한 특정 목표를 보장하지는 않습니다. 우선 순위 요청은 표준 토큰당 종량제 요청보다 높은 가용성을 대상으로 합니다. Azure Databricks 계층에서 가용성을 성공한 요청 수로 해당 계층에서 인정된 총 요청 수로 나눈 값으로 정의합니다.
  • 최상의 용량. 우선 순위 모드는 용량을 예약하지 않으며 용량 약정이 없습니다. 보장된 용량의 경우 프로비전된 처리량을 사용합니다.
  • 표준 토큰당 종량제로 대체합니다. 우선 순위 용량이 완전히 구독된 경우 요청은 표준 토큰당 종량제 가용성으로 제공되며 토큰당 표준 지불 요금으로 청구됩니다.
  • 토큰당 프리미엄입니다. 우선 순위 요청은 표준 토큰당 종량제 요청보다 토큰당 더 높은 비율로 청구됩니다.

프로비전된 처리량에 비해 토큰당 우선 순위 지불

우선순위 토큰당 과금과 프로비저닝된 처리량은 모두 프로덕션 워크로드를 대상으로 하지만, 서로 다른 트레이드오프가 있습니다:

고려 사항 우선순위 토큰당 과금 프로비전된 처리량
Capacity 최선의 노력, 공유. 전용으로 예약된 용량.
헌신 None. 요청마다 동의합니다. 프로비전된 엔드포인트가 필요합니다.
가용성 부하가 있는 표준 토큰당 종량제보다 일관성이 높습니다. 예약된 용량을 기반으로 예측 가능합니다.
Billing 토큰당, 표준 토큰당 과금보다 더 높은 요금이 적용됩니다. 프로비전된 모델 단위를 기반으로 합니다.

우선 순위 요청 보내기

우선 순위 모드를 사용하려면 요청별로 매개 변수 service_tier 를 설정합니다"priority". 다음 예제에서는 OpenAI 클라이언트를 사용합니다.

from databricks_openai import DatabricksOpenAI

client = DatabricksOpenAI()

response = client.chat.completions.create(
    model="databricks-model-name",
    messages=[
      {
        "role": "user",
        "content": "What is a mixture of experts model?",
      }
    ],
    max_tokens=256,
    service_tier="priority",
)

매개 변수 구문에 대한 Foundation 모델 REST API 참조 를 참조하고 추가 쿼리 옵션을 보려면 기본 모델을 사용합니다 .

용량 한도

각 클러스터는 모든 테넌트에서 분당 최대 총 토큰 수를 지원합니다. Azure Databricks 단일 테넌트가 모든 클러스터 용량을 사용할 수 없도록 온보딩하는 동안 테넌트당 제한을 설정합니다. 워크로드에 테넌트당 한도가 허용하는 것보다 더 많은 용량이 필요한 경우 프로비전된 처리량을 요청합니다.

더 많은 파운데이션 모델 API 제한은 Foundation Model API 제한 및 할당량을 참조하세요.

추가 리소스