이 페이지에서는 파운데이션 모델 API의 토큰당 과금에 대한 우선순위 과금과 그 작동 방식, 그리고 우선순위 요청을 보내는 방법을 설명합니다.
우선순위 토큰당 과금이란?
우선 순위 모드라고도 하는 우선 순위 토큰당 종량제는 대기 시간이 중요한 실시간 애플리케이션에 대한 토큰당 종량제 기능입니다.
service_tier 매개 변수를 "priority"(으)로 설정하여 요청을 보내면 Azure Databricks는 동일한 모델의 표준 best-effort 토큰당 과금 트래픽보다 해당 요청을 먼저 수락합니다. 이렇게 하면 트래픽이 많은 기간 동안 가용성이 더 일관되게 유지됩니다.
우선순위 토큰당 과금은 각 요청마다 선택적으로 적용되므로, 동일한 모델에 우선순위 요청과 표준 요청을 모두 보낼 수 있습니다. 용량 약정이 필요하지 않으며 표준 토큰당 종량제 요청보다 더 높은 토큰당 요금으로 청구됩니다.
Databricks는 다음과 같은 경우 우선 순위 모드를 권장합니다.
- 표준 토큰당 종량제보다 더 일관된 성능과 가용성이 필요하지만 전용 용량에 커밋할 준비가 되지 않았습니다.
- 프로덕션 애플리케이션에는 더 높은 가용성이 필요합니다.
지원되는 모델
토큰당 우선 순위 지불은 Databricks에서 제공하는 ADI 서비스를 통해 OpenAI 및 Google Gemini 모델에 사용할 수 있습니다. Azure Databricks 환경에서 이러한 모델에 액세스하려면 ADI Services 참조하세요.
토큰당 우선순위 과금의 작동 방식
우선 순위 종량제 토큰을 사용하기 전에 다음 동작을 고려합니다.
- 일관된 성능 및 가용성 우선 순위 토큰당 종량제는 부하 상태에서 가용성을 일관되게 유지하도록 설계되었습니다. 첫 토큰 생성 시간이나 종단 간 지연 시간에 대한 특정 목표를 보장하지는 않습니다. 우선 순위 요청은 표준 토큰당 종량제 요청보다 높은 가용성을 대상으로 합니다. Azure Databricks 계층에서 가용성을 성공한 요청 수로 해당 계층에서 인정된 총 요청 수로 나눈 값으로 정의합니다.
- 최상의 용량. 우선 순위 모드는 용량을 예약하지 않으며 용량 약정이 없습니다. 보장된 용량의 경우 프로비전된 처리량을 사용합니다.
- 표준 토큰당 종량제로 대체합니다. 우선 순위 용량이 완전히 구독된 경우 요청은 표준 토큰당 종량제 가용성으로 제공되며 토큰당 표준 지불 요금으로 청구됩니다.
- 토큰당 프리미엄입니다. 우선 순위 요청은 표준 토큰당 종량제 요청보다 토큰당 더 높은 비율로 청구됩니다.
프로비전된 처리량에 비해 토큰당 우선 순위 지불
우선순위 토큰당 과금과 프로비저닝된 처리량은 모두 프로덕션 워크로드를 대상으로 하지만, 서로 다른 트레이드오프가 있습니다:
| 고려 사항 | 우선순위 토큰당 과금 | 프로비전된 처리량 |
|---|---|---|
| Capacity | 최선의 노력, 공유. | 전용으로 예약된 용량. |
| 헌신 | None. 요청마다 동의합니다. | 프로비전된 엔드포인트가 필요합니다. |
| 가용성 | 부하가 있는 표준 토큰당 종량제보다 일관성이 높습니다. | 예약된 용량을 기반으로 예측 가능합니다. |
| Billing | 토큰당, 표준 토큰당 과금보다 더 높은 요금이 적용됩니다. | 프로비전된 모델 단위를 기반으로 합니다. |
우선 순위 요청 보내기
우선 순위 모드를 사용하려면 요청별로 매개 변수 service_tier 를 설정합니다"priority". 다음 예제에서는 OpenAI 클라이언트를 사용합니다.
from databricks_openai import DatabricksOpenAI
client = DatabricksOpenAI()
response = client.chat.completions.create(
model="databricks-model-name",
messages=[
{
"role": "user",
"content": "What is a mixture of experts model?",
}
],
max_tokens=256,
service_tier="priority",
)
매개 변수 구문에 대한 Foundation 모델 REST API 참조 를 참조하고 추가 쿼리 옵션을 보려면 기본 모델을 사용합니다 .
용량 한도
각 클러스터는 모든 테넌트에서 분당 최대 총 토큰 수를 지원합니다. Azure Databricks 단일 테넌트가 모든 클러스터 용량을 사용할 수 없도록 온보딩하는 동안 테넌트당 제한을 설정합니다. 워크로드에 테넌트당 한도가 허용하는 것보다 더 많은 용량이 필요한 경우 프로비전된 처리량을 요청합니다.
더 많은 파운데이션 모델 API 제한은 Foundation Model API 제한 및 할당량을 참조하세요.