啟用 Microsoft Foundry 模型的優先處理

優先級處理提供低延遲效能,並具備隨用付費的彈性。 本文將啟用模型部署的優先處理,確認哪一服務層級處理了您的請求,並監控相關成本。

先決條件

  • Azure訂閱 - 免費創建一個。
  • 已部署部署類型為 GlobalStandard 或 DataZoneStandard 模型的 Microsoft Foundry 專案。
  • 模型版本2025-12-01或更新版本。

主要使用案例

  • 穩定且低延遲 ,提供反應靈敏的使用者體驗。
  • 按使用量付費的簡單性,無需長期承諾。
  • 受益於可調整且具成本效益之效能的營業時間或突發流量。 可選擇性地,您可以將優先處理與配置吞吐量單元(PTU)結合,以達到穩態容量與成本優化。

延遲目標

下表列出每個支援優先處理模型的 延遲目標值 。 延遲目標值以每5分鐘的p50請求延遲計算,並以百分位門檻表示。 例如,「每秒 99% > 50 個代幣(TPS)」表示 99% 請求以超過 50 個代幣/秒處理。

模型 延遲目標值
gpt-6.1-sol, 2026-09-29 99% > 50 TPS
gpt-6-sol,2026-09-22 99% > 80 TPS
GPT-5.6-Terra,2026-07-09 99% > 70 TPS
gpt-5.6-sol,2026-07-09 99% > 80 TPS
GPT-5.5,2026-04-24 99% > 50 TPS
GPT-5.4-MINI,2026-03-17 99% > 100 TPS
GPT-5.4, 2026-03-051 99% > 50 TPS
GPT-5.2,2025-12-11 99% > 50 TPS
GPT-5.1,2025-11-13 99% > 50 TPS
GPT-4.1,2025-04-141 99% > 80 TPS

1 此模型的長背景,也就是估計超過 128k 個提示權杖的請求會被降級為標準處理,並依標準層收費。

依部署類型的優先處理可用性

優先處理可在全球標準部署或資料區標準(美國)部署中啟用。 價格資訊請參見 the Azure OpenAI 定價頁面。

全球標準模型的可用性

區域 gpt-6-sol, 2026-09-22 GPT-5.6-Terra,2026-07-09 gpt-5.6-sol, 2026-07-09 GPT-5.5,2026-04-24 GPT-5.4-MINI,2026-03-17 GPT-5.4,2026-03-05 GPT-5.2,2025-12-11 GPT-5.1,2025-11-13 GPT-4.1,2025-04-14
australiaeast ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
巴西南部 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
加拿大中央 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
加拿大東部 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
centralus ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
伊斯特斯 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
eastus2 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
francecentral ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
德國-西中部 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
義大利北方 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
日本東部 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
koreacentral ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
northcentralus ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
北歐 - - - ✅ ✅ ✅ - - -
挪威東部 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
波蘭中央 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
南非北方 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
southcentralus ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
東南亞 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
南印度 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
spaincentral ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
swedencentral ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
瑞士北部 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
switzerlandwest ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
uaenorth ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
UKSOUTH ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
西歐 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
westus ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅
westus3 ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅ ✅

在部署層級啟用優先處理

您可以在部署層級和 (選用) 要求層級啟用優先處理。

註

優先處理可在全球標準或資料區標準(美國)部署中啟用。 優先處理使用與標準處理相同的配額。

在 Microsoft Foundry 入口網站中,建立部署時,請在部署細節頁面上開啟 Priority processing 切換,或透過編輯部署細節來更新已部署模型的設定。

截圖顯示如何在 Foundry 入口網站部署模型時啟用優先處理功能。

註

如果你偏好使用程式碼在部署層級啟用優先處理,可以透過 REST API service_tier 設定以下屬性 "properties" : {"service_tier" : "priority"}來部署: 。 屬性允許的值 service_tier 為 default 和 priority。 default 意味著標準處理,而 priority 啟用優先處理。

一旦模型部署設定為使用優先處理,你就可以開始向模型發送請求。

查看使用指標

你可以在 Azure 入口網站的 Azure 監視器 區塊查看資源的使用率指標。

要查看標準處理與優先處理處理的請求量,依原始請求中服務層級(標準或優先級)分配:

  1. 登入 https://portal.azure.com。
  2. 到你的 Azure OpenAI 資源,從左側導覽中選擇 Metrics 選項。
  3. 在指標頁面,新增 Azure OpenAI 請求指標。 你也可以選擇其他指標,如 Azure OpenAI 延遲、Azure OpenAI 使用率 等。
  4. 選擇 新增過濾器 以選擇優先處理請求的標準部署。
  5. 選擇 「套用分割」 以依 ServiceTierRequest 與 ServiceTierResponse 將值分割。

Azure 入口網站中資源的指標頁面上優先處理利用率的截圖。

欲了解更多關於監控您部署的資訊,請參閱 Azure OpenAI 監控。

監控成本

您可以在 Azure 入口網站的成本分析頁面中,透過部署名稱和計費標籤篩選,查看優先權與標準請求的成本細分如下:

  1. 請前往Azure入口網站的成本分析頁面。
  2. (可選)依資源篩選。
  3. 要依部署名稱篩選:新增計費篩選器。標籤> 選擇 部署 設為值,然後選擇您的部署名稱。

 Azure入口中資源成本分析頁面上的優先處理利用率截圖。

有關優先處理價格的資訊,請參閱 Azure OpenAI 服務 價格概覽。

啟用請求層級的優先處理

Important

自 2026 年 9 月 25 日起,向不支援 Flex 處理的模型提出請求時,會回傳 HTTP 400 錯誤,並附帶 invalid_request_error。 Foundry 不會自動從 flex 回退到標準處理。 在發送請求前,請確認你的模型是否支援 Flex 處理。 如果標準處理可接受,則設service_tier為default 有關支援模型及備用指引,請參閱使用 Flex 處理與 Azure OpenAI 相關說明。

在請求層級啟用優先處理是 可選的。 聊天完成 API 和回應 API 都有一個可選屬性 service_tier ,指定在提供請求時要使用的處理類型。 以下範例說明如何在回應請求中設定service_tier為 。priority

curl -X POST https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AZURE_OPENAI_AUTH_TOKEN" \
  -d '{
     "model": "gpt-4.1",
     "input": "This is a test",
     "service_tier": "priority"
    }'

使用 service_tier 屬性來覆寫部署層級設定。 在標準和優先處理中,service_tier 可以取值為 auto、default 和 priority。

  • 如果你沒有設定屬性,它就會預設為 auto。

  • service_tier = auto 表示請求使用部署中設定的服務層級。

  • service_tier = default 表示請求使用所選車型的標準價格與性能。

  • service_tier = priority 表示請求使用優先處理服務層級。

下表概述了針對 service_tier、依據部署層級與請求層級設定的標準和優先路由。

部署層級設定 請求層級設定 經服務分層處理的請求
預設 自動,預設 標準
預設 優先事項 優先處理
優先事項 自動,優先順序 優先處理
優先事項 預設 標準

限制

  • 目前該服務不支援區域標準部署及歐盟資料區標準部署。

  • 在以下情境下,服務可能會將部分優先權請求重新導向至標準處理*:

    • 如果您的優先處理每分鐘詞元在短時間內快速增加,導致觸及調升速率限制。 目前,上升速率限制定義為在不到 15 分鐘內以每分鐘超過 50% 語彙基元的速度增加流量。
    • 在請求量尖峰時段,進行優先處理。
    • 對延遲 目標表中列出的特定模型發送長上下文請求。

    提示

    如果您經常遇到上升速率限制,請考慮購買 PTU 來代替優先處理。

    * 服務帳單請求由標準服務層級以標準費率處理。 標準服務層級處理的請求包含 service_tier = default 在回應中,而優先處理層級處理的請求則包含 service_tier = priority 在回應中。

故障排除

問題 成因 解決方法
請求降級為標準等級 以下情況之一:
- 流量在 15 分鐘內增加超過每分鐘 50% 的詞元,因而觸及調升速率限制。
- 在優先處理要求高峰期間送出的要求。
- 長上下文請求被發送給列在延遲目標表中的特定模型。
- 若遇過斜坡速率限制,請逐步增加流量。
- 考慮購買PTU以維持穩態容量。