Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
ОТНОСИТСЯ К: ценовая категория AI Gateway (предварительная версия)
Important
Уровень AI Gateway в настоящее время доступен в общедоступной предварительной версии. Во время публичного предварительного просмотра уровень AI Gateway доступен в следующих регионах:
- США — Восток США 2
- Европа - Швеция Центральная
В этом быстром старте вы создаёте экземпляр уровня AI Gateway (предварительный просмотр), добавляете модель чата, вызываете шлюз, создаёте ключ доступа во время выполнения и просматриваете телеметрию.
Уровень AI Gateway от Azure API Management — это выделенный уровень для рабочих нагрузок ИИ. Он поддерживает управление трафиком к моделям — от Microsoft Foundry, Azure OpenAI, AWS Bedrock, Google Vertex, OpenAI, Anthropic или других провайдеров — а также инструментов, созданных на основе существующих MCP-серверов, определений OpenAPI или коннекторов. Уровень AI Gateway подготавливается быстро, обычно в течение минуты.
Время на выполнение: около 20-30 минут. Вы создаёте: один шлюз, одну модель чата, один ключ доступа во время выполнения и один успешный запрос на завершение чата.
Note
Тариф AI Gateway доступен в виде общедоступной предварительной версии. Функции предпросмотра предоставляются без соглашения об уровне обслуживания и не должны использоваться для производственных нагрузок, если только ваша организация не принимает условия предпросмотра.
Prerequisites
- Учетная запись Azure с Microsoft Entra ID. Доступ к предварительному просмотру уровня AI Gateway в настоящее время ограничен пользователями Azure, которые входят с Microsoft Entra ID.
- Подписка на Azure и разрешение создавать ресурсы в группе ресурсов (например, роль участника).
- Доступ хотя бы к одному поддерживаемому поставщику моделей, например, к развернутой модели в Microsoft Foundry или Azure OpenAI.
- Если вашему провайдеру нужен API-ключ, пусть этот ключ будет доступен.
- Чтобы вызвать шлюз, используйте curl (без установки) или OpenAI SDK — Python 3.9 или новее, или Node.js 18 и новее, вместе с пакетом
openai.
1. Войдите в портал уровня AI Gateway
Портал уровня AI Gateway — это отдельный веб-опыт, вы не используете портал Azure.
- Зайдите в портал уровня AI Gateway по адресу
ai.gateway.azure.com. - Выберите «Войти» и аутентифицируйтесь с помощью Microsoft Entra ID.
Используйте портал для управления моделями, серверами MCP, ключами доступа во время выполнения, политиками и мониторингом на основе разрешений вашего Entra ID. Клиенты среды выполнения не входят на портал — они обращаются к шлюзу с помощью ключей доступа среды выполнения, которые вы создадите позже.
2. Создайте шлюз
В портале выберите Создать шлюз. Чтобы использовать уже существующий шлюз, выберите его и перейдите к следующему шагу.
Введите Имя. Имя становится частью конечной точки среды выполнения:
https://<gateway>.azure-api.netВыберите свою подписку и поддерживаемый регион предварительного просмотра (East US 2 или Sweden Central).
Опционально установить группу ресурсов в разделе Продвинутый режим. По умолчанию портал создаёт его для вас.
Нажмите кнопку "Создать". Активация обычно занимает меньше минуты.
Шлюз — это выделенный ресурс в вашей подписке Azure. Вы не выбираете ёмкость и не добавляете масштабные единицы перед добавлением моделей. Для автоматизации версия API управления предпросмотром выглядит 2026-05-01-preview; запросы во время выполнения используют имя хоста шлюза, а не Azure Resource Manager.
3. Добавить модель
Самый быстрый способ создать модель — импортировать её из аккаунтов Microsoft Foundry.
В разделе «Домой» настройте шлюз, выберите опцию «Начать» или откройте страницу настройки прямо на
/settings/startмаршруте.
Выберите одну или несколько подписок для сканирования. По желанию используйте фильтр группы ресурсов для сузения результатов.
Изучите обнаруженные аккаунты. Развертывания группируются по их родительскому аккаунту Foundry (ресурсу Azure). Выбор осуществляется отдельно для каждой учётной записи: при выборе учётной записи мастер импортирует все развёртывания моделей.
Выберите метод аутентификации на сервере для этого импорта:
-
По ключу (по умолчанию). Шлюз хранит API-ключ учетной записи и передает его в заголовке
api-key. Волшебник забирает ключ во время импорта. - Управляемая идентификация (Microsoft Entra ID). Шлюз аутентифицируется с помощью управляемой идентичности. Если у шлюза нет управляемой идентичности, мастер активирует системную идентификацию. Если она уже существует, вы выбираете, какую идентичность использовать. Мастер присваивает идентичности роль пользователя Foundry на каждом выбранном аккаунте.
-
По ключу (по умолчанию). Шлюз хранит API-ключ учетной записи и передает его в заголовке
Выберите Импортировать.
Когда вы выбираете «Импорт», мастер запускает проверку требований для каждого выбранного аккаунта перед созданием чего-либо. Эта проверка подтверждает, что аутентификация настроена корректно и что имена моделей не конфликтуют с моделями, уже существующими на шлюзе. Учетные записи, прошедшие проверку, импортируются; учетные записи, не прошедшие проверку, пропускаются со встроенным предупреждением, а остальной процесс продолжается.
Чтобы подключить провайдера, не входящего в Foundry (AWS Bedrock, Google Vertex, OpenAI или Anthropic), выберите «Добавить пользовательскую модель». См. Управление моделями и инструментами.
Клиенты передают имя модели в поле model в запросах, совместимых с OpenAI. Этот быстрый старт использует gpt-5.6-sol; заменить его на зарегистрированную модель.
Tip
Чтобы попробовать модель сразу, откройте страницу Discover и выберите модель для вызова её в встроенной игровой площадке. Playground использует встроенный ключ шлюза, чтобы вы могли исследовать и тестировать добавленные модели или инструменты перед созданием ключа доступа во время выполнения.
4. Позвоните в шлюз
Шлюз открывает API, поддерживаемый бэкенд-моделью. Модели от совместимых с OpenAI провайдеров — таких как Microsoft Foundry, Azure OpenAI, AWS Bedrock, Google Vertex и OpenAI — обслуживаются на совместимом с OpenAI конечной точке. Настройте любой клиент OpenAI на использование базового URL шлюза, отправьте заголовок api-key и передайте имя модели в поле model. Модели Anthropic вместо этого используют API Anthropic Messages; см. Управление моделями и инструментами.
Для быстрого теста используйте встроенный ключ шлюза — тот же ключ, что и на игровой площадке Discover. Скопируйте его со страницы «Ключи », где встроенный ключ перечислен вместе с API-ключами, предоставляющими доступ во время выполнения ко всем активам в шлюзе. Для своих приложений создайте ключ доступа во время выполнения (см. следующий раздел).
Установите эти значения один раз:
export AI_GATEWAY_BASE_URL="https://<gateway>.azure-api.net/default/models/openai/v1"
export AI_GATEWAY_API_KEY="<gateway-key>"
Tip
Скопируйте точный базовый URL с обзорной страницы вашего шлюза, а не собирайте его вручную.
Сделайте первый звонок с выбранным клиентом:
curl "$AI_GATEWAY_BASE_URL/chat/completions" \
-H "Content-Type: application/json" \
-H "api-key: $AI_GATEWAY_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"messages": [
{ "role": "system", "content": "You are a helpful assistant." },
{ "role": "user", "content": "Give me three benefits of using an AI gateway." }
]
}'
Чтобы транслировать токены в виде событий, отправленных сервером, добавьте "stream": true в тело запроса.
Каждый ответ от /chat/completions конечной точки использует формат OpenAI Chat Completions, независимо от того, какой провайдер поддерживает эту модель.
Нестриминговый звонок возвращает завершение чата:
{
"id": "chatcmpl-...",
"object": "chat.completion",
"model": "gpt-5.6-sol",
"choices": [
{
"index": 0,
"message": { "role": "assistant", "content": "1. Centralized governance ...\n2. ...\n3. ..." },
"finish_reason": "stop"
}
],
"usage": { "prompt_tokens": 24, "completion_tokens": 61, "total_tokens": 85 }
}
При включённом стриминге шлюз возвращает chat.completion.chunk события:
{
"id": "chatcmpl-...",
"object": "chat.completion.chunk",
"model": "gpt-5.6-sol",
"choices": [
{ "index": 0, "delta": { "content": "Hello" }, "finish_reason": null }
]
}
Тот же базовый URL также обслуживает API ответов OpenAI по адресу /responses.
Если запрос не выполняется, шлюз возвращает стандартный HTTP-код:
| Status | Значение | Что требуется проверить |
|---|---|---|
| 400 | Недопустимый запрос | Проверьте тело запроса. |
| 400 | Блокируется по безопасности контента или IP-фильтром, либо отклоняется бэкендом | Политика безопасности контента может заблокировать подсказку или ответ; также проверьте политику IP-фильтров. Для управляемой идентичности назначите роль пользователя Foundry идентификатору шлюза на серверном ресурсе. См. раздел «Использовать управляемую идентичность для бэкенд-аутентификации». |
| 401 | Отсутствующий или некорректный ключ доступа во время выполнения | Передайте ключ в заголовке api-key и подтвердите, что ключ активен. |
| 404 | Неизвестная модель | Убедитесь, что model значение совпадает с названием модели на странице моделей . |
| 429 | Ограничено политикой ограничения скорости или серверной частью | Ознакомьтесь с политиками ограничения скорости для токенов и запросов и учитывайте заголовок ответа Retry-After. |
| 5xx | Ошибка бэкенде | Убедитесь, что бэкенд-провайдер работает корректно и учетные данные провайдера действительны. |
SDK OpenAI вызывают типизированные исключения для этих кодов статуса, поэтому ваша существующая обработка ошибок работает:
from openai import AuthenticationError, RateLimitError, APIStatusError
try:
response = client.chat.completions.create(
model="gpt-5.6-sol",
messages=[{"role": "user", "content": "Hello"}],
)
except AuthenticationError:
... # 401 — check the api-key header and that the key is active
except RateLimitError:
... # 429 — back off and honor the Retry-After header
except APIStatusError as e:
... # inspect e.status_code for 400, 403, 404, or 5xx
5. Создайте ключ доступа во время выполнения
Приложения аутентифицируются на шлюзе с помощью ключа доступа во время выполнения вместо встроенного ключа. Создайте отдельный ключ для каждого приложения и среды.
- Выберите ключи.
- Выберите Создание ключа API.
- Введите имя, например
quickstart-client. - Нажмите кнопку "Создать".
- Скопируйте значение ключа и храните его в безопасности. Вы также можете посмотреть его позже на странице Ключи .
Создайте ключи доступа для среды выполнения на уровне шлюза. Эти ключи дают доступ ко всем моделям и инструментам в шлюзе. Относись к ним как к секретам. Храните ключи в секретном хранилище приложений, регулярно меняйте их и отзывайте ключи, которые больше не нужны. Чтобы вызвать шлюз с помощью ключа доступа во время выполнения, установите AI_GATEWAY_API_KEY его значение в ранее показанных вызовах.
6. См. телеметрию
Уровень AI Gateway выпускает метрики использования токена OpenTelemetry. Чтобы увидеть их, сначала настройте назначение телеметрии, а затем отправьте запросы:
- Настройте телеметрический пункт для шлюза, например Application Insights. См. Управление, безопасность и эксплуатация.
- Отправьте один или несколько запросов через шлюз, как показано ранее в разделе «Вызов шлюзу».
- Откройте адрес телеметрии, чтобы проверить использование токенов. Если вы используете Application Insights, портал предоставляет встроенную панель потребления токенов.
Поскольку телеметрия появляется только после подключения к пункту назначения, настройте мониторинг до того, как на него полагаться. В настоящее время передаётся только одна метрика — использование токенов; журналы, трассировки и другие метрики для моделей и инструментов скоро появятся. Абоненты используют ключи доступа на уровне шлюза, чтобы вы могли отслеживать трафик, не раскрывая учетные данные провайдера для клиентских приложений. Чтобы настроить пункт назначения телеметрии, см. Управление, безопасность и эксплуатация.
Очистите ресурсы
Когда закончишь, удаляй все ресурсы, которые тебе больше не нужны. Удалите экземпляр уровня AI Gateway, тестовые развертывания поставщика и ключи доступа среды выполнения, которые вы создали исключительно для оценки.