Note
Foundry 中的管理運算目前處於預覽階段。 此預覽版本沒有服務等級協定,不建議將其用於生產工作負載。 某些功能可能不被支援或功能受限。 欲了解更多資訊,請參閱 Microsoft Azure 預覽版補充使用條款。
受管運算(預覽)是 Microsoft Foundry 中的一種部署類型,能在專用 GPU 容量上承載開源模型,無需配置虛擬機器、操作 Kubernetes 叢集、建構容器映像,或擁有模型服務執行時。 Microsoft 擁有 GPU 拓撲、執行時、容器映像與安全修補。 你可以選擇適合你工作負載的模型、部署範本、加速器家族和擴展行為。
受管運算使用與 Foundry 中其他部署類型的相同的 Foundry 資源、專案、端點、認證、網路設定、SDK、可觀察性及計費介面。 部署使用受管理計算的模型後,應用程式代碼與其他 Foundry 模型相同;只有部署名稱會變。
本文說明 Foundry 中的受管型運算部署類型、你所使用的概念(模型實例、部署範本、加速器族、執行時)、可部署的目錄、推論端點、擴展、計費與配額、存取控制,以及目前的限制。 有關逐步部署說明,請參見 「部署帶有受管理運算的開源模型」。
受管控運算在 Foundry 中的定位
Foundry 提供三種部署類型。 託管運算是用於專用 GPU 容量的開源模型部署類型。
| 部署類型 | 它的用途 | Billing | 最適合用於 |
|---|---|---|---|
| 標準按詞元付費 | Azure 銷售的 Foundry 模型 | 每個輸入和輸出詞元 | 開始使用的最低摩擦路徑;無需容量規劃的裝載模型高載流量。 |
| 預配置的吞吐量 | Azure 販售的 Foundry 模型 | 預留吞吐量單位 | Azure 銷售的特定 Foundry 模型負載可預測且持續,延遲穩定。 |
| 受控計算 | Foundry 目錄中的開源與社群模型 | 每小時每個加速器系列 | 在專用 GPU 上架設開源模型,搭配 Foundry 管理的執行環境、私有網路,以及與其他部署類型的相同 SDK。 |
這三種部署類型共用同一個 Foundry 端點、相同的認證模式(Microsoft Entra ID 與金鑰)、相同的 SDK、相同的可觀察面,以及單一帳單。 你可以在同一個 Foundry 專案中混合三種部署類型,並從同一個客戶端程式碼呼叫它們。
關鍵概念
本節涵蓋在使用 Foundry 管理式運算部署前,需理解的關鍵概念。
模型實例
模型實例是受管運算中的部署單位。 你不會選擇虛擬機 SKU,也不會設定節點大小;相反地,你用模型描述工作負載,Foundry 則選擇下面的 GPU 拓撲。 一個實例可能會使用一個或多個加速器,視模型和你選擇的部署範本而定。 你可以透過改變模型實例的數量( capacity 部署 SKU 上的值)來擴展部署。
部署範本
部署範本是一種有名稱、版本化的資產,用來編碼特定模型應如何執行。 範本會釘選:
- 服務執行階段 (例如 vLLM 或 SGLang)。
- 每個執行個體的加速器系列和數量 (例如一個 H100 80 GB,或兩個 A100 80 GB)。
- 支援的上下文長度以及任何量化選項。
- 執行階段特定調整,例如工具呼叫和推理剖析器、評分路徑、健康情況探針、要求並行,以及任何模型特定的內容延伸設定。
當你寫腳本執行部署時,你會參考範本 ID,剩下的則由 Foundry 處理。 目錄中的每個模型通常都會隨附多個範本,用於在加速器系列、上下文長度,以及延遲與吞吐量之間權衡取捨。 例如,模型 qwen3-32b 並排展示四個範本:
| Template | Runtime | 加速器 | 上下文 |
|---|---|---|---|
qwen--qwen3-32b--40k-nvidia-a100 |
vLLM | 1 × A100 80 GB | 40 K |
qwen--qwen3-32b--40k-nvidia-h100 |
vLLM | 1 × H100 80 GB | 40 K |
qwen--qwen3-32b--128k-nvidia-2xa100 |
vLLM | 2 × A100 80 GB | 128 K |
qwen--qwen3-32b--128k-nvidia-2xh100 |
vLLM | 2 × H100 80 GB | 128 K |
選擇範本是你唯一能調整模型如何運作的選項。
加速器家族
託管運算部署針對的是 加速器家族,而非特定虛擬機 SKU。 受支持的家庭包括:
- NVIDIA A100 80 GB (
A100_80GB) - NVIDIA H100 80 GB (
H100_80GB) - AMD MI300X 192 GB (
MI_300_192GB)
配額會依各地區的各個加速器系列分別核配。
模型執行時間
受控運算會讓每個模型在由 Microsoft 建置、掃描、簽署及修補的提供服務執行階段上執行。 你不需要管理或重建容器。 執行階段產品組合會依據模型架構而定:
| Runtime | 用途 | 備註 |
|---|---|---|
| vLLM | 高輸送量 LLM 服務 | 連續批次處理、PagedAttention、張量平行處理、LoRA 熱交換。 大多數大型語言模型的預設。 |
| SGLang | 結構化輸出的 LLM 服務 | 適用於代理式和工具使用工作負載的 JSON、Regex 和文法受限產生。 |
| TensorRT-LLM | 經 NVIDIA 最佳化的大型語言模型推論服務 | 針對在延遲或吞吐量方面由 TRT-LLM 表現更佳的模型系列,提供低延遲的 NVIDIA 推論。 |
| NVIDIA NIM | NVIDIA 推論微服務 | 與 NIM API 相容的 TensorRT-LLM 後端,適用於 NVIDIA 發布的模型。 |
| 文本嵌入推論(TEI) | 嵌入、重排序器、分類器 | 加速器專用的核心用於嵌入與檢索熱路徑。 |
| llama.cpp | CPU 與小型 GPU 服務 | 相同 OpenAI 相容 API 後方的 GGUF 量化模型。 |
| HF-SERVE | 視覺、音訊、分割、其他 Transformers 原生管線 | Hugging Face 的多模型伺服器,用於 LLM 和內嵌快速路徑以外的模態。 |
執行時升級與 CVE 修補會自動套用於客戶的即時部署。 你不會重新部署模型來取得執行時更新。
支援的模型
你可以在 Foundry 中使用管理式運算,部署來自 Foundry 模型目錄中 Hugging Face 集合 的模型,這些模型是從登錄檔 azure-huggingface 提供。 這些模型具備以下屬性:
- 每週精選與更新。 Hugging Face 生態系的熱門模型會隨著社群發布而持續新增。 該目錄涵蓋文字、視覺、音頻及多模態模型(LLMs 及用於聊天與代理的視覺語言模型)、自動語音辨識(ASR)、語音翻譯、嵌入、分割及影像生成。
- 只用 SafeTensor,禁止不信任的程式碼。 收藏中的每一位模特兒都經過篩選。 需要在載入時執行第三方Python(
trust_remote_code模式)的儲存庫會被修復或排除。 - 預先配置的權重。 模型權重會從 Hugging Face 擷取一次,經過驗證後儲存在 Microsoft 管理的 Azure 儲存空間中,存放在模型服務區域。 容器映像檔存在於 Microsoft 管理的登錄檔中。 因此,受控運算部署不需要對 Hugging Face Hub 的對外網路存取——你可以將其部署在完全私有、沒有對外連線出口的網路中。
- 授權元資料已保留。 每張目錄模型卡都會記錄並顯示上游授權資訊。 授權審查會在策展流程期間,依據 Microsoft 的企業發行政策進行。
模型策展管線
Hugging Face 系列中的每一個模型都經過五階段的策展流程,才會出現在目錄中:
- 識別趨勢模型:Microsoft根據社群訊號、合作夥伴需求及客戶需求來識別趨勢模型。
-
合規與安全性篩選:每個型號都會接受授權審查與檢查,以確認
trust_remote_code模式與自訂可執行程式碼。 - 建置、掃描並發布執行時容器映像:由 Microsoft 建置,掃描 CVE,簽署後發佈至 Microsoft管理的登錄檔。
- 將權重上傳到安全的 Azure 儲存體:根據模型資訊卡進行驗證,並儲存在提供模型服務的區域中。
- 驗證與發佈:每個模型、執行時及加速器組合都會經過 API 合規性與效能測試,然後以一鍵部署路徑發佈至目錄。
推斷端點
將模型部署到受控計算會讓該模型可在相同的統一 Foundry 專案端點上進行推斷,該端點也供按詞元付費和佈建輸送量部署使用。
基底端點採用https://<account>.services.ai.azure.com模式。
端點路由
受控計算部署可在統一端點上透過兩種路由系列呼叫。 你選擇的路徑取決於底層模型和執行時是否公開了 OpenAI 相容的 API。
| 路由 | 路徑 | 適用對象 | 行為 |
|---|---|---|---|
| 受管理的部署路由 (OSS) | <endpoint>/managed-deployments/<deployment-name>/ |
所有管理式運算部署 | 適用於所有部署在託管運算上的模型,包括附帶自有 SDK 的客製化模型。 公開 /chat/completions 的模型,也可以透過此路由搭配 OpenAI SDK 呼叫,方法是將用戶端 base_url 指向此路徑。 |
| 與 OpenAI 相容的路由 | <endpoint>/openai/v1/ |
執行階段公開 OpenAI 相容 API 的受控計算部署 (例如 vLLM、SGLang、TensorRT-LLM、llama.cpp 服務聊天或內嵌) | OpenAI SDK 可透過設定base_url此路徑並在請求有效載荷欄位中傳遞部署名稱model來呼叫部署。 如果要求以某個部署名稱指向此路由,而該部署名稱所對應的底層模型或執行階段不支援 OpenAI 相容介面,執行階段會傳回 HTTP 404。 |
重點摘要:
- 每個受管運算部署都可透過
https://<account>.services.ai.azure.com/managed-deployments/<deployment-name>/路由存取 - 任何執行階段與 OpenAI 相容的部署,也可透過
https://<account>.services.ai.azure.com/openai/v1/路由存取。 - 當你想與其他 Foundry 部署分享客戶端程式碼時,建議使用 OpenAI 路線。
- 對於提供自訂 SDK 或非 OpenAI API 的模型,請採用託管部署路線。
Tip
聊天補全受控計算部署也可以加入 Foundry Agent 作為管理員連線模型,並透過 Foundry Responses API 搭配相同 OpenAI SDK 呼叫,使用與任何其他 Foundry 模型相同的驗證、端點和可觀測性。
端點認證
託管運算部署使用與 Foundry 端點其他部分相同的認證模式:
- Microsoft Entra ID(推薦)。 取得
https://ai.azure.com/.default範圍的權杖,並在Authorization標頭中將其作為持有人權杖傳遞。 若要使用 Entra ID 呼叫受控計算部署,呼叫身分識別需要在 Foundry 帳戶範圍上具有 Foundry User 角色。 OpenAI SDK 採用基於代幣模式,且DefaultAzureCredential無需任何特定管理型運算的設定。 - 帳號 API 金鑰。 將 Foundry 帳號金鑰傳給
Authorization: Bearer <key>。 OpenAI SDK 在你設定api_key參數時會自動以這種形式傳送金鑰。 金鑰在受管型運算部署中,與同一帳號上的按令牌付費及 PTU 部署所賦予的存取權限相同。
兩種認證選項都能在兩個端點路由上運作。 關於端對端用戶端程式碼範例(包含 OpenAI SDK 搭配 Entra ID 或 API 金鑰),請參見 Send a test request。
Scaling
你可以透過改變模型實例數量來擴展受管理的運算部署。 當你在部署 SKU 上設定 capacity 值時,Foundry 會相應調整 GPU 數量。 總 GPU 數等於模型實例數乘以你所選部署範本所定義的每個實例 GPU 數。 Foundry 不會要求你去設定節點大小或選擇虛擬機家族。
計費、配額與部署範圍
受管理的運算是按每個加速器每小時計費。 不同於以虛擬機器為基礎的基礎架構,在那種架構中,您租用的是整台 GPU 伺服器,且無論模型是否用到,都必須為伺服器中的每張 GPU 付費;受管理運算則是按模型實例收費。 Foundry 會根據實際需要的 GPU 數量(一、兩、四或八顆)來調整每個型號的大小,這樣你就不用花錢讓閒置的加速器放在工作負載旁邊。 部署費用為:
每個模型實例的加速器數量 × 模型實例數量 × 運行時數 × 每小時費率
每小時費率依加速器系列(A100、H100、MI300X)及部署範圍而異。 有關最新價格,請參閱Azure價格計算器。
部署範圍
管理運算(預覽版)目前支援 全域 部署,透過部署 SKU 名稱 GlobalManagedCompute設定。 全球部署能以最低速率提供最廣泛的加速器容量。
Quota
每個加速器家族透過 Foundry 配額流程,為每個區域授予管理計算配額。 管理運算配額與Azure虛擬機配額分開。 Azure VM 配額是針對特定區域虛擬機 SKU 的基礎設施即服務分配,而管理運算則是受管理的 PaaS 服務。 現有的 Azure VM 配額無法套用到受管理的運算部署。
關於查看使用情況、將成本歸屬於專案及申請配額的詳細資訊,請參見 Plan and Manage Cost for Microsoft Foundry 以及 Manage and increase quotas。
存取控制
管理運算採用 Foundry 的角色導向存取控制(RBAC)模型。 建立、讀取、更新和刪除受控計算部署所需的一組 Azure 資源提供者作業,已記錄在 Microsoft Foundry 的角色型存取控制 — 受控計算控制平面作業中,以及授與每個作業的內建角色。
一覽:
- 認知服務貢獻者 (或 Foundry 擁有者 / Foundry 帳戶擁有者)授權對受管理的運算部署進行完整的建立、讀取、更新及刪除權限。
- Cognitive Services User 和 Foundry User 會授與部署的唯讀存取權。
- Foundry Project Manager 授予部署及加速器使用資料的讀取權限,但無法建立或刪除。
在統一的 Foundry 端點上進行推論(資料平面)時,會遵循標準的 Foundry 模式,在 Foundry 帳戶範圍內指派 Foundry User,以便使用 Microsoft Entra ID 呼叫部署。
Limitations
管理運算目前處於 公開預覽階段。 在部署生產工作負載前請注意以下事項:
- Content filtering:內建的 Azure AI 內容安全 篩選器在公開預覽版中不包含在受管理的運算資料路徑中。 如果你需要請求層級或回應層級的過濾,請直接從應用程式呼叫 Azure AI 內容安全 APIS。
- 區域可用性:受控運算已推出,適用於全球範圍。 資料區部署及額外區域正在逐步推出——請參閱 一般可用性矩陣 以了解目前的覆蓋範圍。
- 定價:對於處於預覽階段的管理式運算部署,依加速器系列與地區而定的每小時費率、預留容量,以及承諾使用折扣仍在調整中。 有關最新費率,請參閱 Azure 價格計算器。