Отслеживание использования модели

На этой странице описывается мониторинг использования служб шлюза искусственного интеллекта Unity с помощью системной таблицы отслеживания использования.

Таблица отслеживания использования автоматически фиксирует сведения о запросах и ответах для сервиса модели, регистрируя ключевые метрики, такие как использование токенов и задержка. Данные в этой таблице можно использовать для мониторинга пользователей, отслеживания затрат и получения аналитических сведений о производительности и потреблении службы моделей.

Отслеживание использования также учитывает запросы ai_query к сервисам моделей, предоставляемым Databricks.

Администраторы учетных записей и рабочих областей могут просматривать консолидированный обзор использования ИИ на странице ИИ в Центре управления.

Requirements

Pricing

Отслеживание использования — это оплачиваемая функция Unity AI Gateway. Azure Databricks взимает плату за использование, которое он вносит в system.ai_gateway.usage таблицу. См. цены на Unity AI Gateway.

Запросите таблицу использования

Шлюз ИИ Unity записывает данные об использовании в системную таблицу system.ai_gateway.usage . Вы можете просмотреть таблицу в пользовательском интерфейсе или запросить таблицу из Databricks SQL или записной книжки.

Note

По умолчанию для просмотра или выполнения запросов к таблице system.ai_gateway.usage требуются обе роли администратора: администратора аккаунта и администратора metastore. Администраторы могут управлять доступом к системным таблицам для контроля разрешений пользователей, групп и принципов сервиса.

Чтобы просмотреть таблицу в пользовательском интерфейсе, щелкните ссылку на таблицу отслеживания использования на странице службы модели, чтобы открыть таблицу в обозревателе каталогов.

Чтобы запросить таблицу из Databricks SQL или записной книжки:

SELECT * FROM system.ai_gateway.usage;

Tip

Код Genie (режим агента) может сделать это для вас. Попробуйте следующий пример запроса:

Query the system.ai_gateway.usage table to analyze AI Gateway usage showing request count and total tokens, grouped by endpoint name for the last 7 days.

Встроенная панель мониторинга использования

Note

Некоторые рабочие области пока не показывают выпадающий список Управление. В этих рабочих областях вместо этого используйте отдельные кнопки Создать панель мониторинга, Просмотреть панель мониторинга и Обновить на странице Unity AI Gateway.

Создание встроенной панели использования

Администраторы учетных записей могут создавать встроенную панель мониторинга использования шлюза искусственного интеллекта Unity для мониторинга использования, отслеживания затрат и получения аналитических сведений о производительности и потреблении службы моделей. На странице шлюза искусственного интеллекта Unity щелкните "Управление " в правом верхнем углу и нажмите кнопку "Создать панель мониторинга использования". Хранилище, на котором выполняются запросы панели мониторинга, выбирается автоматически.

Note

Создание панели мониторинга доступно только администраторам учетной записи, поскольку для этого требуются разрешения SELECT на таблицу system.ai_gateway.usage. Данные панели мониторинга подлежат usage политикам хранения таблицы. См. Какие системные таблицы доступны?.

Когда доступна более новая версия встроенной панели мониторинга использования, администраторы учетных записей могут щелкнуть "Обновить" строку версии панели мониторинга в раскрывающемся списке "Управление " на странице шлюза ИИ Unity.

Для управления панелью мониторинга можно использовать следующие параметры конфигурации панели мониторинга:

  • Область: выберите область действия панели мониторинга в учетной записи или рабочей области.
  • Разрешения. Выберите, выполняются ли запросы с помощью разрешений владельца панели мониторинга или разрешений каждого средства просмотра. См. Что такое разрешения общего доступа к данным.
  • Автоматическое обновление. При включении этого параметра панель мониторинга обновляется автоматически, когда новая версия становится доступной, а администратор учетной записи посещает страницу шлюза ИИ Unity.

Параметры панели обновления ai-gateway

Когда панель мониторинга обновляется до версии 0.3 или выше, расписание автоматически создается для обновления панели мониторинга каждые 6 часов. При необходимости этот график можно отключить на панели мониторинга Lakeview. См . статью "Создание расписания".

Просмотр панели мониторинга использования

Чтобы просмотреть панель мониторинга, щелкните "Управление" в правом верхнем углу страницы шлюза ИИ Unity, а затем щелкните "Панель мониторинга использования". Панель мониторинга откроется на новой вкладке. Встроенная панель мониторинга обеспечивает полную видимость использования службы модели шлюза ИИ Unity, производительности и стоимости. В него входят несколько страниц для отслеживания запросов, расхода токенов, метрик задержки, частоты ошибок, структуры затрат, трафика внешних MCP-серверов и активности агента для написания кода.

Панель мониторинга использования ai-gateway

Панель мониторинга предоставляет аналитику между рабочими областями по умолчанию. Все страницы панели мониторинга можно фильтровать по диапазону дат и идентификатору рабочей области.

  • Вкладка "Обзор". Отображает высокоуровневые метрики использования, включая объем ежедневных запросов, тенденции использования маркеров с течением времени, основные пользователи по потреблению маркеров и общее количество уникальных пользователей. Используйте эту вкладку, чтобы получить быстрый снимок общего действия шлюза искусственного интеллекта Unity и определить наиболее активных пользователей и моделей.
  • Вкладка "Производительность": отслеживает ключевые показатели производительности, включая процентили задержки (P50, P90, P95, P99), время на первый байт, частоту ошибок и распределение кода состояния HTTP. Эта вкладка используется для мониторинга работоспособности службы моделей и выявления узких мест производительности или проблем с надежностью.
  • Вкладка "Использование": отображает подробные разбивки по службам моделей, рабочей области и инициатору запросов. На этой вкладке показаны структуры использования токенов, распределение запросов и коэффициенты попадания в кэш.
  • Вкладка "Наблюдаемость затрат": отображает разбивку затрат по службе моделей, целевой модели, пользователю, тегам служб и тегам запроса. Эта вкладка также содержит предполагаемые затраты для внешних моделей. См. стоимость Unity AI Gateway.
  • Вкладка внешнего сервера MCP: показывает объем запросов, частоту ошибок, пользователей и подключений, а также тенденции ежедневного использования для внешнего трафика сервера MCP.
  • Вкладка "Агенты кода". Отслеживает действия из интегрированных агентов программирования, включая Cursor, Claude Code, Gemini CLI и Codex CLI. На этой вкладке показаны такие метрики, как активные дни, сеансы программирования, фиксации и строки кода, добавленные или удаленные для мониторинга использования средств разработчика. Дополнительные сведения см. на панели мониторинга агента программирования .

Схема таблицы использования

Таблица system.ai_gateway.usage имеет следующую схему:

Название столбца Тип Описание Пример
account_id СТРУНА Идентификатор учетной записи. 11d77e21-5e05-4196-af72-423257f74974
workspace_id СТРУНА Идентификатор рабочей области. 1653573648247579
request_id СТРУНА Уникальный идентификатор запроса. b4a47a30-0e18-4ae3-9a7f-29bcb07e0f00
invocation_id СТРУНА Уникальный идентификатор для каждого отдельного вызова вывода. Несколько вызовов могут использовать один и тот же request_id, например проверки ограничений или многошаговые вызовы агента. Используйте invocation_id для их отличия. c0a8012e-9f3b-4d21-8a7e-1b2c3d4e5f60
schema_version ЦЕЛОЕ ЧИСЛО Версия схемы журнала использования. 1
endpoint_id СТРУНА Уникальный идентификатор сервиса модели Unity AI Gateway. 43addf89-d802-3ca2-bd54-fe4d2a60d58a
endpoint_name СТРУНА Имя службы модели шлюза искусственного интеллекта Unity. databricks-gpt-5-2
endpoint_tags MAP Теги, настроенные в службе моделей во время создания или обновления. Они применяются ко всем запросам к службе модели и полезны для классификации служб по командам, центру затрат или проекту. {"team": "engineering"}
endpoint_metadata STRUCT Метаданные службы модели, включая creator, , creation_timelast_updated_time, destinationsи inference_tablefallbacks. {"creator": "user.name@email.com", "creation_time": "2026-01-06T12:00:00.000Z", ...}
event_time TIMESTAMP Метка времени, когда был получен запрос. 2026-01-20T19:48:08.000+00:00
latency_ms LONG Общая задержка в миллисекундах. 300
time_to_first_byte_ms LONG Время первого байта в миллисекундах. 300
destination_type СТРУНА Тип назначения (например, внешняя модель или базовая модель). PAY_PER_TOKEN_FOUNDATION_MODEL
destination_name СТРУНА Имя целевой модели или поставщика. databricks-gpt-5-2
destination_id СТРУНА Уникальный идентификатор назначения. 507e7456151b3cc89e05ff48161efb87
destination_model СТРУНА Конкретная модель, используемая для запроса. GPT-5.2
requester СТРУНА Идентификатор пользователя или субъекта-службы, который сделал запрос. user.name@email.com
requester_type СТРУНА Тип запрашивающего объекта (пользователь, субъект-служба или группа пользователей). USER
ip_address СТРУНА IP-адрес запрашивающего. 1.2.3.4
url СТРУНА URL-адрес запроса. https://<workspace-url>/ai-gateway/mlflow/v1/chat/completions
user_agent СТРУНА Агент пользователя запрашивающего. OpenAI/Python 2.13.0
api_type СТРУНА Тип вызова API (например, чат, завершение или внедрение). mlflow/v1/chat/completions
request_tags MAP Предоставленные пользователем теги, отправленные с отдельными запросами с помощью заголовка Databricks-Ai-Gateway-Request-Tags HTTP. Используйте теги запросов для атрибутов использования определенных проектов, команд, сред или конечных пользователей. См. запросы тегов для отслеживания использования и запросов тегов для отслеживания использования. {"project": "chatbot", "team": "ml-platform"}
invocation_metadata STRUCT Системные метаданные о вызове вывода. Содержит source, службу или путь, которые инициировали вызов. {"source": "EXTERNAL_CLIENT"}
input_tokens LONG Количество входных токенов. 100
output_tokens LONG Количество выходных токенов. 100
total_tokens LONG Общее количество токенов (входные и выходные данные). 200
token_details STRUCT Подробные сведения о разбивке маркеров, включая cache_read_input_tokens, cache_creation_input_tokensи output_reasoning_tokens. {"cache_read_input_tokens": 100, ...}
response_content_type СТРУНА Тип контента ответа. application/json
status_code INT HTTP-код статуса ответа. 200
routing_information STRUCT Сведения о маршрутизации для аварийных попыток. Содержит массив attempts, включающий priority, action, destination, destination_id, status_code, error_code, latency_ms, start_time и end_time для каждой модели, испытуемой во время запроса. {"attempts": [{"priority": "1", ...}]}

Запросы тегов для отслеживания использования

Теги запроса — это настраиваемые пары "ключ — значение", которые инициатор вызова добавляет к каждому отдельному запросу. Используйте теги запросов для использования атрибутов по проекту, команде, среде, конечному пользователю или любому другому измерению, соответствующему вашей организации. Теги запросов регистрируются в таблицу system.ai_gateway.usage и могут использоваться для фильтрации, статистической обработки и анализа данных об использовании.

Чтобы пометить отдельные запросы, добавьте HTTP-заголовок Databricks-Ai-Gateway-Request-Tags с JSON-объектом, сопоставляющим строковые ключи строковым значениям. Теги запросов записываются в столбец request_tags в таблице использования и в таблицах вывода.

Примеры настройки тегов запросов с помощью REST API, OpenAI SDK и пакета SDK Anthropic см. в разделе Tag-запросы для отслеживания использования.

Например, можно агрегировать использование по проекту с помощью тегов запросов:

SELECT
  request_tags['project'] AS project,
  COUNT(*) AS request_count,
  SUM(total_tokens) AS total_tokens
FROM system.ai_gateway.usage
WHERE request_tags['project'] IS NOT NULL
GROUP BY request_tags['project']
ORDER BY total_tokens DESC;

Limitations

  • Unity AI Gateway не отслеживает использование токенов для непотоковых ответов, не являющихся эмбеддингами, размером более 1 МиБ.

Дополнительные ресурсы