Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
На этой странице описываются ограничения и квоты для рабочих нагрузок API модели Databricks Foundation.
API модели Databricks Foundation применяют ограничения скорости, чтобы обеспечить надежную производительность и справедливое распределение ресурсов для всех пользователей. Эти ограничения зависят от уровня платформы рабочей области, типа базовой модели и способа развертывания базовой модели.
Ограничения скорости конечной точки для оплаты за токен
Конечные точки с оплатой за токены регулируются ограничениями на основе токенов и запросов. Ограничения скорости обработки данных на основе токенов регулируют максимальное количество токенов, которые могут быть обработаны в минуту, и применяются отдельно для входных и выходных токенов.
- Токены ввода в минуту (ITPM) — максимальное количество входных токенов (из ваших запросов), которые можно обрабатывать в 60-секундном интервале. Ограничение скорости ITPM управляет пропускной способностью входных маркеров конечной точки.
- Маркеры вывода в минуту (OTPM) — максимальное количество выходных маркеров (из ответов модели), которое можно создать в 60-секундном окне. Ограничение скорости OTPM управляет пропускной способностью выходных маркеров конечной точки.
- Запросы в час: максимальное количество запросов или запросов, которые могут обрабатываться в течение 60 минут. Для рабочих приложений с устойчивыми шаблонами использования Databricks рекомендует подготовленные конечные точки пропускной способности, которые обеспечивают гарантированную емкость.
Отслеживание и применение ограничений
Самое строгое ограничение скорости (ITPM, OTPM, QPH) применяется в любое время. Например, даже если вы не достигли предела ITPM, вы по-прежнему будете ограничены скоростью, если превышено ограничение QPH или OTPM. По достижении ограничения ITPM или OTPM последующие запросы получают ошибку 429, указывающую на получение слишком большого количества запросов. Это сообщение сохраняется до сброса окна ограничения скорости.
Databricks отслеживает и применяет лимиты скорости токенов в минуту (TPM) с помощью следующих функций:
| Функция | Сведения |
|---|---|
| Учет токенов и предварительная проверка |
|
| Пиковая мощность и сглаживание |
|
Ниже приведен пример того, как выполняется проверка перед приемом и процесс обратного зачисления.
# Request with max_tokens specified
request = {
"prompt": "Write a story about...", # 10 input tokens
"max_tokens": 500 # System reserves 500 output tokens
}
# Pre-admission check:
# - Verifies 10 tokens against ITPM limit
# - Reserves 500 tokens against OTPM limit
# - If either would exceed limits, returns 429 immediately
# If admitted, actual response uses only 350 tokens
# The system credits back 150 tokens (500 - 350) to your OTPM allowance
# These 150 tokens are immediately available for other requests
Ограничения скорости по модели
В следующих таблицах приведены лимиты скорости ITPM, OTPM и QPH для конечных точек Foundation Model API с оплатой за токен для рабочих пространств уровня платформы Enterprise workspace:
Замечание
Для моделей, поддерживающих зарезервированную пропускную способность, создайте конечную точку с зарезервированной пропускной способностью, если лимиты оплаты за токены не соответствуют требованиям вашего сценария использования.
Уровни квот токенов для партнерской модели
Лестница квот на токены для модели партнёра имеет три пронумерованных уровня. Подходящие партнёрские модели последнего поколения начинаются с уровня Tier 1. Эти квотные уровни отделены от уровня платформы вашего рабочего пространства.
| Уровень квоты | Ограничение ITPM | Ограничение OTPM | Availability |
|---|---|---|---|
| Уровень 1 | 1,000,000 | 100,000 | Применяется автоматически к подходящим моделям партнёров последних поколений; можно запросить, если это не стандартно; |
| Уровень 2 | 5 000 000 | 500,000 | Доступно через процесс запроса квоты |
| Уровень 3 | 10,000,000 | 1,000,000 | Доступно через процесс запроса квоты |
Настраиваемые лимиты токенов требуют проверки ёмкости со стороны Databricks и находятся вне этих трёх уровней. Уровни квот на токены меняют только лимиты ITPM и OTPM; ограничения RPS, QPS, RPH и QPH остаются специфичными для модели. Предыдущий стартовый лимит в 200 000 ITPM / 20 000 OTPM не является пронумерованным уровнем. Модели партнёров старого поколения, исключения, зависящие от модели, и открытые модели сохраняют стандартные значения, показанные в следующих таблицах.
| Большие языковые модели | Ограничение ITPM | Ограничение OTPM | Ограничение QPH |
|---|---|---|---|
| Gemini 3.1 Flash Lite | 200,000 | 20,000 | 360 000 |
| Qwen3.5 122B A10B (общедоступная предварительная версия) | 1,000,000 | 100,000 | 360 000 |
| Qwen3-Next 80B A3B Instruct (бета-версия) | 1,000,000 | 100,000 | 360 000 |
| GPT OSS 120B | 1,000,000 | 100,000 | 360 000 |
| GPT OSS 20B | 1,000,000 | 100,000 | 360 000 |
| Джемма 3 12B | 1,000,000 | 100,000 | 360 000 |
| Лама 4 Маверрик | 1,000,000 | 100,000 | 360 000 |
| Лама 3.3 70B Инструктаж | 1,000,000 | 100,000 | 360 000 |
| Llama 3.1 8B Инструкция | 1,000,000 | 100,000 | 360 000 |
| OpenJev (Qwen3.5 4B) | 2,000,000 | 40,000 | 7 200 |
| DeepSeek V4.1 Flash | 2,000,000 | 40,000 | 7 200 |
| модели Anthropic Claude | Ограничение ITPM | Ограничение OTPM | Ограничение QPH |
|---|---|---|---|
| Клод Фейбл 5.1 | 1,000,000 | 100,000 | 360 000 |
| Клод Фейбл 5 | 1,000,000 | 100,000 | 360 000 |
| Клод Хайку 4.5 | 200,000 | 20,000 | 360 000 |
| Claude Opus 5 | 1,000,000 | 100,000 | 360 000 |
| Claude Opus 5.5 | 1,000,000 | 100,000 | 360 000 |
| Клод Опус 4.8 | 200,000 | 20,000 | 360 000 |
| Клод Опус 4.7 | 200,000 | 20,000 | 360 000 |
| Клод Опус 4.6 | 200,000 | 20,000 | 360 000 |
| Клод Opus 4.5 | 200,000 | 20,000 | 360 000 |
| Клод Opus 4.1 | 200,000 | 20,000 | 360 000 |
| Сонет Клода 5 | 1,000,000 | 100,000 | 360 000 |
| Claude Sonnet 5.5 | 1,000,000 | 100,000 | 360 000 |
| Сонет Клода 4.6 | 200,000 | 20,000 | 360 000 |
| Клод Соннет 4.5 | 200,000 | 20,000 | 360 000 |
| Клод Соннет 4 | 200,000 | 20,000 | 360 000 |
| Внедрение моделей | Ограничение ITPM | Ограничение OTPM | Ограничение QPH |
|---|---|---|---|
| Qwen3-Embedding-0.6B | N/A | N/A | 2,160,000 |
| GTE large (en) | N/A | N/A | 540,000 |
| BGE Large (en) | N/A | N/A | 2,160,000 |
Рекомендации по управлению лимитами транзакций в минуту
Шаг 1. Следить за использованием токенов
Отслеживайте количество входных и выходных маркеров отдельно в приложениях:
# Example: Track token usage
response = model.generate(prompt)
input_tokens = response.usage.prompt_tokens
output_tokens = response.usage.completion_tokens
total_tokens = response.usage.total_tokens
# Check against limits
if input_tokens > ITPM_LIMIT or output_tokens > OTPM_LIMIT:
# Implement backoff strategy
pass
Шаг 2. Реализация логики повторных попыток
Добавьте экспоненциальный откат при возникновении ошибок ограничения скорости:
import time
import random
def retry_with_exponential_backoff(
func,
initial_delay: float = 1,
exponential_base: float = 2,
jitter: bool = True,
max_retries: int = 10,
):
"""Retry a function with exponential backoff."""
num_retries = 0
delay = initial_delay
while num_retries < max_retries:
try:
return func()
except Exception as e:
if "rate_limit" in str(e) or "429" in str(e):
num_retries += 1
if jitter:
delay *= exponential_base * (1 + random.random())
else:
delay *= exponential_base
time.sleep(delay)
else:
raise e
raise Exception(f"Maximum retries {max_retries} exceeded")
Шаг 3. Оптимизация использования токенов
- Свести к минимуму длину запроса: используйте краткие, хорошо структурированные запросы
-
Контроль длины выходных данных: используйте
max_tokensпараметр для ограничения размера ответа -
Явно задать max_tokens для Claude Sonnet 4: всегда указывайте
max_tokensпри использовании Claude Sonnet 4, чтобы избежать ограничения по умолчанию в 1000 токенов. - Эффективное пакетирование: группировать связанные запросы, если это возможно, при сохранении в пределах ограничений
Шаг 4. Рассмотрите возможность выбора модели
- Меньшие модели для задач с большим объёмом: используйте такие модели, как GPT OSS 20B, для задач, требующих высокой пропускной способности.
- Крупные модели для сложных задач: зарезервируйте GPT OSS 120B для задач, требующих максимальных возможностей.
Мониторинг и устранение неполадок
Отслеживайте шаблоны использования маркеров, чтобы оптимизировать производительность:
# Example: Log token usage for monitoring
import logging
logger = logging.getLogger(__name__)
def log_token_usage(response):
usage = response.usage
logger.info(f"Input tokens: {usage.prompt_tokens}")
logger.info(f"Output tokens: {usage.completion_tokens}")
logger.info(f"Total tokens: {usage.total_tokens}")
# Alert if approaching limits
if usage.prompt_tokens > ITPM_LIMIT * 0.8:
logger.warning("Approaching ITPM limit")
if usage.completion_tokens > OTPM_LIMIT * 0.8:
logger.warning("Approaching OTPM limit")
Обработка ошибок ограничения скорости
При превышении ограничений скорости API возвращает ошибку 429 Too Many Requests :
{
"error": {
"message": "Rate limit exceeded: ITPM limit of 1,000,000 tokens reached",
"type": "rate_limit_exceeded",
"code": 429,
"limit_type": "input_tokens_per_minute",
"limit": 1000000,
"current": 1000150,
"retry_after": 15
}
}
Ответ на ошибку включает:
-
limit_type: какой предел был превышен (ITPM, OTPM, QPS или QPH) -
limit: настроенное значение ограничения -
current: текущее использование -
retry_after: предлагаемое время ожидания в секундах
Распространенные проблемы и решения
| Проблема | Solution |
|---|---|
| Частые ошибки 429 | Реализуйте экспоненциальную задержку, уменьшите частоту запросов и запросите увеличение лимита частоты запросов. |
| Достигнуто ограничение ITPM | Оптимизация длины запроса |
| Ограничение OTPM достигнуто | Использование max_tokens для ограничения длины ответа |
| Достигнуто ограничение QPH | Равномерное распределение запросов с течением времени |
Ограничения подготовленной пропускной способности
Для производственных рабочих нагрузок, требующих более высоких пределов, зарезервированные конечные точки пропускной способности предоставляют:
- Нет ограничений TPM: емкость обработки на основе подготовленных ресурсов
- Более высокие ограничения скорости: до 200 запросов в секунду на рабочую область
- Прогнозируемая производительность. Выделенные ресурсы обеспечивают согласованную задержку
Ограничения на токены вывода
В следующей таблице перечислены ограничения выходных маркеров для каждой поддерживаемой модели:
| Модель | Ограничение токена на вывод |
|---|---|
| GPT OSS 120B | 25,000 |
| GPT OSS 20B | 25,000 |
| Джемма 3 12B | 8,192 |
| Лама 4 Маверрик | 8,192 |
| Лама 3.1 70B | 8,192 |
| Лама 3.1 8B | 8,192 |
Дополнительные ограничения
Ниже приведены ограничения для рабочих нагрузок с выделенной пропускной способностью:
- Чтобы развернуть модель Meta Llama из
system.aiкаталога Unity, необходимо выбрать соответствующую версию инструкции . Базовые версии моделей Meta Llama не поддерживаются для развертывания из каталога Unity. См. статью "Развертывание подготовленных конечных точек пропускной способности". - Для рабочих нагрузок с зарезервированной пропускной способностью, использующих Llama 4 Maverick:
- Поддержка этой модели для подготовленных рабочих нагрузок пропускной способности доступна в общедоступной предварительной версии.
- Автомасштабирование не поддерживается.
- Панели метрик не поддерживаются.
- Разделение трафика не поддерживается в конечной точке, которая обслуживает Llama 4 Maverick. Вы не можете обслуживать несколько моделей в конечной точке, которая обслуживает Llama 4 Maverick.
Региональная доступность и обработка данных
Сведения о доступности региона модели, размещенной в Databricks, см. в обзоре модели Foundation.
Сведения об обработке и местонахождении данных см. в разделе "Обработка и размещение данных".
Ограничения по ресурсам и нагрузкам для основных моделей и внешних моделей
В следующих таблицах перечислены ограничения ресурсов и полезных данных для конечных точек, обслуживающих базовые модели и внешние модели.
| Функция | Степень детализации | Ограничение |
|---|---|---|
| Размер полезной нагрузки | По запросу | 4 МБ |
| Размер запроса и ответа | По запросу | Любой запрос или ответ более 1 МБ не будет зарегистрирован. |
| Число запросов в секунду (QPS) | В расчете на рабочую область | 200 |
| Длительность выполнения модели | По запросу | 597 секунд |
| Задержка накладных расходов | По запросу | Менее 50 миллисекунда |