Ограничения и квоты api модели Foundation

На этой странице описываются ограничения и квоты для рабочих нагрузок API модели Databricks Foundation.

API модели Databricks Foundation применяют ограничения скорости, чтобы обеспечить надежную производительность и справедливое распределение ресурсов для всех пользователей. Эти ограничения зависят от уровня платформы рабочей области, типа базовой модели и способа развертывания базовой модели.

Ограничения скорости конечной точки для оплаты за токен

Конечные точки с оплатой за токены регулируются ограничениями на основе токенов и запросов. Ограничения скорости обработки данных на основе токенов регулируют максимальное количество токенов, которые могут быть обработаны в минуту, и применяются отдельно для входных и выходных токенов.

  • Токены ввода в минуту (ITPM) — максимальное количество входных токенов (из ваших запросов), которые можно обрабатывать в 60-секундном интервале. Ограничение скорости ITPM управляет пропускной способностью входных маркеров конечной точки.
  • Маркеры вывода в минуту (OTPM) — максимальное количество выходных маркеров (из ответов модели), которое можно создать в 60-секундном окне. Ограничение скорости OTPM управляет пропускной способностью выходных маркеров конечной точки.
  • Запросы в час: максимальное количество запросов или запросов, которые могут обрабатываться в течение 60 минут. Для рабочих приложений с устойчивыми шаблонами использования Databricks рекомендует подготовленные конечные точки пропускной способности, которые обеспечивают гарантированную емкость.

Отслеживание и применение ограничений

Самое строгое ограничение скорости (ITPM, OTPM, QPH) применяется в любое время. Например, даже если вы не достигли предела ITPM, вы по-прежнему будете ограничены скоростью, если превышено ограничение QPH или OTPM. По достижении ограничения ITPM или OTPM последующие запросы получают ошибку 429, указывающую на получение слишком большого количества запросов. Это сообщение сохраняется до сброса окна ограничения скорости.

Databricks отслеживает и применяет лимиты скорости токенов в минуту (TPM) с помощью следующих функций:

Функция Сведения
Учет токенов и предварительная проверка
  • Подсчет входных маркеров: входные маркеры подсчитываются из вашего фактического запроса, сделанного в момент выполнения запроса.
  • Оценка выходных маркеров. Если вы указали max_tokens в запросе, Databricks использует это значение для оценки и резервирования емкости выходных маркеров до того, как запрос будет принят для обработки.
  • Проверка перед приемом: Databricks проверяет, превысит ли запрос ограничения ITPM или OTPM перед началом обработки. Если max_tokens вызовет превышение ограничений OTPM, Databricks немедленно отклоняет запрос с ошибкой 429.
  • Фактические и предполагаемые выходные данные: после создания ответа учитываются фактические выходные маркеры. Важно отметить, что если фактическое использование токенов меньше зарезервированного max_tokens, Databricks возвращает разницу обратно в лимит квоты, что делает эти токены немедленно доступными для других запросов.
  • max_tokens не указано: если не указать max_tokens, Databricks использует настройки по умолчанию, а фактическое количество токенов уточняется после генерации. Примечание. Claude Sonnet 4 специально по умолчанию использует 1000 выходных маркеров, если max_tokens не задано, возвращая причину завершения "длина" при достижении. Это не максимальная длина контекста модели.
Пиковая мощность и сглаживание
  • Буфер всплеска: ограничение скорости включает небольшой буфер для размещения коротких всплесков трафика выше номинальной скорости.
  • Скользящее окно: Потребление токенов отслеживается с помощью алгоритма скользящего окна, что обеспечивает более плавное ограничение скорости по сравнению со строгими минутными границами.
  • Алгоритм токенов ведра: Databricks использует реализацию ведра токенов, которая позволяет использовать некоторую возможность всплеска при сохранении среднего ограничения скорости с течением времени.

Ниже приведен пример того, как выполняется проверка перед приемом и процесс обратного зачисления.

# Request with max_tokens specified
request = {
    "prompt": "Write a story about...",  # 10 input tokens
    "max_tokens": 500  # System reserves 500 output tokens
}

# Pre-admission check:
# - Verifies 10 tokens against ITPM limit
# - Reserves 500 tokens against OTPM limit
# - If either would exceed limits, returns 429 immediately

# If admitted, actual response uses only 350 tokens
# The system credits back 150 tokens (500 - 350) to your OTPM allowance
# These 150 tokens are immediately available for other requests

Ограничения скорости по модели

В следующих таблицах приведены лимиты скорости ITPM, OTPM и QPH для конечных точек Foundation Model API с оплатой за токен для рабочих пространств уровня платформы Enterprise workspace:

Замечание

Для моделей, поддерживающих зарезервированную пропускную способность, создайте конечную точку с зарезервированной пропускной способностью, если лимиты оплаты за токены не соответствуют требованиям вашего сценария использования.

Уровни квот токенов для партнерской модели

Лестница квот на токены для модели партнёра имеет три пронумерованных уровня. Подходящие партнёрские модели последнего поколения начинаются с уровня Tier 1. Эти квотные уровни отделены от уровня платформы вашего рабочего пространства.

Уровень квоты Ограничение ITPM Ограничение OTPM Availability
Уровень 1 1,000,000 100,000 Применяется автоматически к подходящим моделям партнёров последних поколений; можно запросить, если это не стандартно;
Уровень 2 5 000 000 500,000 Доступно через процесс запроса квоты
Уровень 3 10,000,000 1,000,000 Доступно через процесс запроса квоты

Настраиваемые лимиты токенов требуют проверки ёмкости со стороны Databricks и находятся вне этих трёх уровней. Уровни квот на токены меняют только лимиты ITPM и OTPM; ограничения RPS, QPS, RPH и QPH остаются специфичными для модели. Предыдущий стартовый лимит в 200 000 ITPM / 20 000 OTPM не является пронумерованным уровнем. Модели партнёров старого поколения, исключения, зависящие от модели, и открытые модели сохраняют стандартные значения, показанные в следующих таблицах.

Большие языковые модели Ограничение ITPM Ограничение OTPM Ограничение QPH
Gemini 3.1 Flash Lite 200,000 20,000 360 000
Qwen3.5 122B A10B (общедоступная предварительная версия) 1,000,000 100,000 360 000
Qwen3-Next 80B A3B Instruct (бета-версия) 1,000,000 100,000 360 000
GPT OSS 120B 1,000,000 100,000 360 000
GPT OSS 20B 1,000,000 100,000 360 000
Джемма 3 12B 1,000,000 100,000 360 000
Лама 4 Маверрик 1,000,000 100,000 360 000
Лама 3.3 70B Инструктаж 1,000,000 100,000 360 000
Llama 3.1 8B Инструкция 1,000,000 100,000 360 000
OpenJev (Qwen3.5 4B) 2,000,000 40,000 7 200
DeepSeek V4.1 Flash 2,000,000 40,000 7 200
модели Anthropic Claude Ограничение ITPM Ограничение OTPM Ограничение QPH
Клод Фейбл 5.1 1,000,000 100,000 360 000
Клод Фейбл 5 1,000,000 100,000 360 000
Клод Хайку 4.5 200,000 20,000 360 000
Claude Opus 5 1,000,000 100,000 360 000
Claude Opus 5.5 1,000,000 100,000 360 000
Клод Опус 4.8 200,000 20,000 360 000
Клод Опус 4.7 200,000 20,000 360 000
Клод Опус 4.6 200,000 20,000 360 000
Клод Opus 4.5 200,000 20,000 360 000
Клод Opus 4.1 200,000 20,000 360 000
Сонет Клода 5 1,000,000 100,000 360 000
Claude Sonnet 5.5 1,000,000 100,000 360 000
Сонет Клода 4.6 200,000 20,000 360 000
Клод Соннет 4.5 200,000 20,000 360 000
Клод Соннет 4 200,000 20,000 360 000
Внедрение моделей Ограничение ITPM Ограничение OTPM Ограничение QPH
Qwen3-Embedding-0.6B N/A N/A 2,160,000
GTE large (en) N/A N/A 540,000
BGE Large (en) N/A N/A 2,160,000

Рекомендации по управлению лимитами транзакций в минуту

Шаг 1. Следить за использованием токенов

Отслеживайте количество входных и выходных маркеров отдельно в приложениях:

# Example: Track token usage
response = model.generate(prompt)
input_tokens = response.usage.prompt_tokens
output_tokens = response.usage.completion_tokens
total_tokens = response.usage.total_tokens

# Check against limits
if input_tokens > ITPM_LIMIT or output_tokens > OTPM_LIMIT:
    # Implement backoff strategy
    pass

Шаг 2. Реализация логики повторных попыток

Добавьте экспоненциальный откат при возникновении ошибок ограничения скорости:

import time
import random

def retry_with_exponential_backoff(
    func,
    initial_delay: float = 1,
    exponential_base: float = 2,
    jitter: bool = True,
    max_retries: int = 10,
):
    """Retry a function with exponential backoff."""

    num_retries = 0
    delay = initial_delay

    while num_retries < max_retries:
        try:
            return func()
        except Exception as e:
            if "rate_limit" in str(e) or "429" in str(e):
                num_retries += 1

                if jitter:
                    delay *= exponential_base * (1 + random.random())
                else:
                    delay *= exponential_base

                time.sleep(delay)
            else:
                raise e

    raise Exception(f"Maximum retries {max_retries} exceeded")

Шаг 3. Оптимизация использования токенов

  • Свести к минимуму длину запроса: используйте краткие, хорошо структурированные запросы
  • Контроль длины выходных данных: используйте max_tokens параметр для ограничения размера ответа
  • Явно задать max_tokens для Claude Sonnet 4: всегда указывайте max_tokens при использовании Claude Sonnet 4, чтобы избежать ограничения по умолчанию в 1000 токенов.
  • Эффективное пакетирование: группировать связанные запросы, если это возможно, при сохранении в пределах ограничений

Шаг 4. Рассмотрите возможность выбора модели

  • Меньшие модели для задач с большим объёмом: используйте такие модели, как GPT OSS 20B, для задач, требующих высокой пропускной способности.
  • Крупные модели для сложных задач: зарезервируйте GPT OSS 120B для задач, требующих максимальных возможностей.

Мониторинг и устранение неполадок

Отслеживайте шаблоны использования маркеров, чтобы оптимизировать производительность:

# Example: Log token usage for monitoring
import logging

logger = logging.getLogger(__name__)

def log_token_usage(response):
    usage = response.usage
    logger.info(f"Input tokens: {usage.prompt_tokens}")
    logger.info(f"Output tokens: {usage.completion_tokens}")
    logger.info(f"Total tokens: {usage.total_tokens}")

    # Alert if approaching limits
    if usage.prompt_tokens > ITPM_LIMIT * 0.8:
        logger.warning("Approaching ITPM limit")
    if usage.completion_tokens > OTPM_LIMIT * 0.8:
        logger.warning("Approaching OTPM limit")

Обработка ошибок ограничения скорости

При превышении ограничений скорости API возвращает ошибку 429 Too Many Requests :

{
  "error": {
    "message": "Rate limit exceeded: ITPM limit of 1,000,000 tokens reached",
    "type": "rate_limit_exceeded",
    "code": 429,
    "limit_type": "input_tokens_per_minute",
    "limit": 1000000,
    "current": 1000150,
    "retry_after": 15
  }
}

Ответ на ошибку включает:

  • limit_type: какой предел был превышен (ITPM, OTPM, QPS или QPH)
  • limit: настроенное значение ограничения
  • current: текущее использование
  • retry_after: предлагаемое время ожидания в секундах

Распространенные проблемы и решения

Проблема Solution
Частые ошибки 429 Реализуйте экспоненциальную задержку, уменьшите частоту запросов и запросите увеличение лимита частоты запросов.
Достигнуто ограничение ITPM Оптимизация длины запроса
Ограничение OTPM достигнуто Использование max_tokens для ограничения длины ответа
Достигнуто ограничение QPH Равномерное распределение запросов с течением времени

Ограничения подготовленной пропускной способности

Для производственных рабочих нагрузок, требующих более высоких пределов, зарезервированные конечные точки пропускной способности предоставляют:

  • Нет ограничений TPM: емкость обработки на основе подготовленных ресурсов
  • Более высокие ограничения скорости: до 200 запросов в секунду на рабочую область
  • Прогнозируемая производительность. Выделенные ресурсы обеспечивают согласованную задержку

Ограничения на токены вывода

В следующей таблице перечислены ограничения выходных маркеров для каждой поддерживаемой модели:

Модель Ограничение токена на вывод
GPT OSS 120B 25,000
GPT OSS 20B 25,000
Джемма 3 12B 8,192
Лама 4 Маверрик 8,192
Лама 3.1 70B 8,192
Лама 3.1 8B 8,192

Дополнительные ограничения

Ниже приведены ограничения для рабочих нагрузок с выделенной пропускной способностью:

  • Чтобы развернуть модель Meta Llama из system.ai каталога Unity, необходимо выбрать соответствующую версию инструкции . Базовые версии моделей Meta Llama не поддерживаются для развертывания из каталога Unity. См. статью "Развертывание подготовленных конечных точек пропускной способности".
  • Для рабочих нагрузок с зарезервированной пропускной способностью, использующих Llama 4 Maverick:
    • Поддержка этой модели для подготовленных рабочих нагрузок пропускной способности доступна в общедоступной предварительной версии.
    • Автомасштабирование не поддерживается.
    • Панели метрик не поддерживаются.
    • Разделение трафика не поддерживается в конечной точке, которая обслуживает Llama 4 Maverick. Вы не можете обслуживать несколько моделей в конечной точке, которая обслуживает Llama 4 Maverick.

Региональная доступность и обработка данных

Сведения о доступности региона модели, размещенной в Databricks, см. в обзоре модели Foundation.

Сведения об обработке и местонахождении данных см. в разделе "Обработка и размещение данных".

Ограничения по ресурсам и нагрузкам для основных моделей и внешних моделей

В следующих таблицах перечислены ограничения ресурсов и полезных данных для конечных точек, обслуживающих базовые модели и внешние модели.

Функция Степень детализации Ограничение
Размер полезной нагрузки По запросу 4 МБ
Размер запроса и ответа По запросу Любой запрос или ответ более 1 МБ не будет зарегистрирован.
Число запросов в секунду (QPS) В расчете на рабочую область 200
Длительность выполнения модели По запросу 597 секунд
Задержка накладных расходов По запросу Менее 50 миллисекунда

Дополнительные ресурсы