局部 AI 推論 是指在您或您的組織所控制的基礎設施上運行訓練好的 AI 模型的過程。 Windows Server 的主要情境是分散式推論:一台兼容 OpenAI 的模型伺服器運行於 Windows Server,遠端用戶端透過網路向其端點發送請求。 例如,Windows 11 工作站上的 Visual Studio Code 可以向伺服器發送提示並接收產生的輸出。
組織利用分散式推論讓多個客戶端能夠存取共享模型運算,同時控制請求與輸出的傳送路徑。 這種控制取決於端點位置、網路路徑、用戶端設定、模型擷取、診斷以及解決方案中的其他服務。
本文協助 Windows Server 管理員與開發者決定何時使用本地推論,並識別該選擇所需的基礎設施考量。
AI 推論在 Windows Server 上的運作方式
利用 Windows Server 上的本地 AI 推論,遠端應用程式與工具連接模型伺服器的網路位址,發送請求並接收回應。 客戶端不會在本地載入或執行模型。
這種拓撲結構賦予 Windows Server 獨特的角色。 伺服器集中管理運算與 GPU 容量、模型儲存與主機、網路存取、服務運作,以及多個用戶端的容量管理。 管理員操作共享服務及其基礎設施,開發人員則為端點的基底 URL、型號識別碼、支援的 API 及認證方式配置用戶端。
解法包含以下元素:
- 遠端用戶端:透過網路傳送提示或其他模型輸入的應用程式、開發工具或管理工具。 用戶端可在 Windows 11、Windows Server 或其他支援的平台上運行。
- 介面:定義請求與回應格式的 SDK 或 HTTP API。 許多共用執行階段都會提供與 OpenAI 相容的 API,例如。
- 模型伺服器與模型:以伺服器為導向的執行時,載入訓練好的模型、排程推理請求,並透過端點回傳輸出。
- Windows Server 基礎設施:支援並暴露共享工作負載的實體主機或虛擬機器、處理器、記憶體、儲存空間、GPU 資源、網路及管理工具。
端點實作一種或多種客戶端使用的 API 格式,但相容性並不代表每個端點都支援所有功能。 用戶端可能需要特定路由、模型識別碼、串流行為、工具或函式呼叫、認證方法或請求欄位。 在連接之前,請確認客戶端的需求和端點能力。
內嵌推論則有不同的邊界。 應用程式會在同一裝置上載入並執行模型,通常在應用程式流程中執行,而非呼叫模型伺服器。 Windows ML 提供此應用推論框架用於 ONNX 模型。 Foundry Local 也面向在裝置上執行的工作流程。 Foundry Local SDK 將執行時嵌入應用程式中,其命令列介面則在一台裝置上管理模型與本地服務。 這些選項可以在 Windows Server 硬體上執行,但它們本身並不提供一個分散式推論服務,讓管理員能集中管理多個客戶端。
選擇你的推論方法
根據推論執行地點、需要模型的客戶數量,以及執行時由誰操作來選擇方法。 使用 Windows Server 作為共享端點,集中管理模型與遠端用戶端的運算。 此方法增加了網路、安全性、容量及可用性需求。 或者,當一個應用程式或裝置應該擁有執行時與模型生命週期時,也可以在 Windows Server 中使用嵌入式或裝置推論。
| Approach | 最適用 | 操作模型 | 重要邊界 |
|---|---|---|---|
| Windows Server 端點 | 多個遠端應用程式或工具,消耗由中央營運團隊管理的模型服務 | Windows Server 上的模型伺服器擁有模型載入、請求排程、並行性及 API 的權限。 遠端用戶端使用其組織核准的端點基礎網址、型號識別碼及認證設定。 | 你選擇的產品決定執行時安裝、端點部署、API 支援及擴展特性。 本文假設終端存在且用戶端能抵達。 |
| Windows ML | 在同一裝置上執行 ONNX 模型的 Windows 應用程式 | 該應用程式使用 Windows 支援的 ONNX 執行環境,無論是作為共享系統元件,或與應用程式自成一體。 可選的執行提供者會使用可用的 CPU、GPU 或 NPU 資源。 | Windows ML 是一個應用程式推論框架,而非相容於 OpenAI 的模型服務端點。 執行提供者、驅動程式、硬體及模型需求各異。 |
| Foundry Local | 需要單一裝置、裝置內推論及精選模型目錄的應用程式與開發工作流程 | 應用程式通常在 SDK 中進行推理。 Foundry 本地 CLI 可管理模型及裝置上的本地服務。 | Foundry Local 可以在伺服器硬體上執行,但其設計並不針對多使用者伺服器推論。 它無法為多個同時連線的客戶端提供並行請求佇列處理、連續批次處理或高效率的 GPU 資源共享。 |
這些方法在整個組織中並不互斥。 一個應用程式可能透過 Windows ML 嵌入 ONNX 模型,開發者可能在單一工作站使用 Foundry Local,遠端開發工具與商業應用程式則可能使用Windows Server上的共用端點。 將每條路徑視為獨立的工作負載,擁有其獨特的模型、硬體、安全性及支援需求。
規劃 Windows Server 基礎架構以進行 AI 推論
模型架構、參數數量、量化、上下文長度、請求並行性及延遲目標決定所需的計算與記憶體。 有些機型運行於 CPU,而其他工作負載則受益於 GPU 加速。 GPU 並不是每個推論解決方案的必備條件。
對於實體 Windows Server 主機上的工作負載,執行環境可以使用 Windows Server 及硬體廠商支援的硬體與 API。 對於 Hyper-V 虛擬機中的工作負載,請選擇適當的 GPU 虛擬化選項。 Windows Server 的 GPU 加速計畫比較了主機直接存取、離散裝置指派(DDA)、GPU 分割以及 Windows 容器場景。 GPU 分割區可在 Windows Server 2025 或更新版本中提供,且是可選的基礎設施選項。
同時也規劃以下資源:
- 記憶體與 GPU 記憶體:考慮載入的模型、上下文與快取需求、並行請求,以及主機上的其他程序。
- 儲存:提供模型檔案、執行時套件、日誌及暫存資料的容量與存取控制。 即使推論在本地執行,模型擷取仍可能需要外部網路連線。
- 網路:對於共用端點,估算用戶端與端點之間的頻寬與延遲。 定義哪些網路和主機可以連線服務。
- 可用性與容量:決定當終端無法使用或已達滿員時,客戶端的行為。 在生產環境使用前,用具代表性的模型和請求驗證並行性和吞吐量。
在 Windows Server 上安全並操作 AI 推論
本地配置本身並不構成安全邊界。 定義提示、檢索資料、模型檔案、輸出、日誌及診斷必須遵守的邊界,然後對每個元件依此邊界進行驗證。
透過核准的 TLS 設定保護網路流量,驗證並授權客戶端,透過網路控制限制終端存取,並將憑證儲存在核准的秘密儲存庫中。 不要把憑證放在其他使用者能讀到的原始碼檔案或工具設定裡。 部署模型檔案前,請先審查模型授權與採購來源。
在依賴模型輸出之前,先驗證它。 對相關行動或決策維持適當的人為監督。
透過您已建立的管理工具管理 Windows Server 基礎架構,包括支援所需操作的 Windows Admin Center。 請依照執行時文件了解模型生命週期及端點特定操作。 至少,請計畫觀察端點健康狀況、請求延遲、吞吐量、故障、CPU 與記憶體使用率、GPU 利用率及記憶體使用率(如適用)以及儲存容量。 可用的指標和管理操作會隨執行時而異,因此本文並未規定單一可觀察性實作。
常見的本地 AI 推論情境
本地推論能支援開發者、管理員及應用程式的工作負載,同時將推論路徑保持在組織所選邊界內。
- 程式設計協助:將支援的開發工具(如 Windows 11 上的 Visual Studio Code)連接到 Windows Server 上的現有端點,以便進行程式碼說明、產生、審查或排除故障。 原始碼與提示會透過網路傳送至該端點,因此資料邊界中應包含網路路徑、端點及其運算元。
- 行政協助:將行政工具連接到能解釋或提出指令的模型。 執行前務必檢視產生的指令並了解其效果,尤其是當指令改變系統狀態時。
- 文件處理:使用應用程式以本地模型摘要、分類、擷取或索引文件。 應用程式仍負責授權來源文件及產生的輸出。
- 對話式應用程式:在現有應用程式中加入聊天或問答體驗。 應用程式可以將模型端點與授權的企業資料結合,但必須獨立於模型執行存取控制。