KI-Inferenz auf Windows Server

Lokale KI-Inferenz ist der Prozess, ein trainiertes KI-Modell auf Infrastruktur auszuführen, die Sie oder Ihre Organisation kontrollieren. Das primäre Windows Server-Szenario ist die verteilte Inferenz: Ein OpenAI-kompatibler Server läuft auf Windows Server, und entfernte Clients senden Anfragen über das Netzwerk an seinen Endpunkt. Zum Beispiel kann Visual Studio Code auf einer Windows 11-Workstation Prompts an den Server senden und generierte Ausgaben empfangen.

Organisationen verwenden verteilte Inferenz, um mehreren Kunden Zugriff auf Shared Model Compute zu geben, während sie steuern, wohin Anfragen und Ausgaben gelangen. Diese Steuerung hängt vom Endpunktstandort, dem Netzwerkpfad, der Client-Konfiguration, der Modellakquise, der Diagnostik und weiteren Diensten in der Lösung ab.

Dieser Artikel hilft Windows Server-Administratoren und Entwicklern dabei, zu entscheiden, wann lokale Inferenz verwendet werden soll, und die Infrastrukturaspekte für diese Wahl zu identifizieren.

Wie KI-Inferenz auf Windows Server funktioniert

Mit lokaler KI-Inferenz auf Windows Server verbinden entfernte Anwendungen und Tools sich mit der Netzwerkadresse des Modellservers, senden Anfragen und empfangen Antworten. Die Clients laden oder führen das Modell nicht lokal aus.

Diese Topologie gibt Windows Server eine eigene Rolle. Der Server zentralisiert Rechenleistung und GPU-Kapazität, Modellspeicher und -hosting, Netzwerkzugang, Serviceoperationen und Kapazitätsmanagement für mehrere Clients. Administratoren betreiben den gemeinsamen Dienst und seine Infrastruktur, während Entwickler Clients für die Basis-URL, Modellkennung, unterstützte API und Authentifizierungsmethode des Endpunkts konfigurieren.

Die Lösung enthält folgende Elemente:

  • Remote Client: Ein Anwendungs-, Entwicklungs- oder Verwaltungswerkzeug, das Prompts oder andere Modelleingaben über das Netzwerk sendet. Clients können auf Windows 11, Windows Server oder einer anderen unterstützten Plattform laufen.
  • Schnittstelle: Ein SDK oder HTTP-API, das Anfrage- und Antwortformate definiert. Viele gemeinsame Laufzeiten bieten beispielsweise OpenAI-kompatible APIs an.
  • Modellserver und Modell: Die serverorientierte Laufzeitumgebung, die ein trainiertes Modell lädt, Inferenzanfragen plant und Ausgaben über den Endpunkt zurückgibt.
  • Windows Server-Infrastruktur: Der physische Host oder virtuelle Machine, Prozessor, Speicher, Speicher, GPU-Ressourcen, Netzwerk und Management-Tools, die die gemeinsame Arbeitslast unterstützen und bereitstellen.

Ein Endpunkt implementiert ein oder mehrere API-Formate, die Clients verwenden, aber Kompatibilität bedeutet nicht, dass jeder Endpunkt jede Funktionalität unterstützt. Clients benötigen möglicherweise bestimmte Routen, Modellkennungen, Streaming-Verhalten, Werkzeug- oder Funktionsaufrufe, Authentifizierungsmethoden oder Anfragefelder. Bestätige sowohl die Client-Anforderungen als auch die Endpunkt-Fähigkeiten, bevor du sie verbindest.

Eingebettete Inferenz hat eine andere Grenze. Die Anwendung lädt und führt das Modell auf demselben Gerät aus, oft im Anwendungsprozess, anstatt einen Modellserver aufzurufen. Windows ML bietet dieses Anwendungsinferenz-Framework für ONNX-Modelle. Foundry Local richtet sich auch an On-Device Workflows. Das Foundry Local SDK bettet die Laufzeit in eine Anwendung ein, und seine Kommandozeilenschnittstelle verwaltet Modelle und einen lokalen Dienst auf einem Gerät. Diese Optionen können auf Windows Server-Hardware laufen, bieten aber für sich genommen keinen verteilten Inferenzdienst, den Administratoren zentral für mehrere Clients betreiben.

Wählen Sie Ihren Inferenzansatz

Wählen Sie einen Ansatz, der darauf basiert, wo die Inferenz ausgeführt wird, wie viele Kunden das Modell benötigen und wer die Laufzeit steuert. Nutzen Sie Windows Server als gemeinsamen Endpunkt, um Modelle und Rechenleistungen für entfernte Clients zu zentralisieren. Dieser Ansatz erhöht Anforderungen an Netzwerke, Sicherheit, Kapazität und Verfügbarkeit. Verwenden Sie alternativ eingebettete oder geräteinterne Rückschlüsse in Windows Server, wenn eine Anwendung oder ein Gerät den Laufzeit- und Modelllebenszyklus besitzen soll.

Approach Beste Passform Betriebsmodell Wichtige Grenzen
Windows Server Endpunkt Mehrere entfernte Anwendungen oder Werkzeuge, die einen Modelldienst nutzen, den ein zentrales Betriebsteam verwaltet Ein Modellserver auf Windows Server ist für das Laden des Modells, die Planung von Anfragen, die Nebenläufigkeit und die API zuständig. Entfernte Clients verwenden die Endpunkt-Basis-URL, Modellkennung und Authentifizierungseinstellungen, die ihre Organisation genehmigt. Das von Ihnen ausgewählte Produkt bestimmt die Laufzeitinstallation, die Bereitstellung des Endpunkts, die API-Unterstützung und die Skalierungseigenschaften. Dieser Artikel geht davon aus, dass der Endpunkt existiert und Clients ihn erreichen können.
Windows ML Windows-Anwendungen, die ONNX-Modelle auf demselben Gerät ausführen Die Anwendung verwendet das von Windows unterstützte ONNX Runtime, entweder als gemeinsames Systemelement oder als eigenständige Komponente in der Anwendung. Optionale Ausführungsanbieter nutzen verfügbare CPU-, GPU- oder NPU-Ressourcen. Windows ML ist ein Anwendungs-Inferenz-Framework, kein OpenAI-kompatibler modellorientierter Endpunkt. Anforderungen an Ausführungsanbieter, Treiber, Hardware und Modell variieren.
Foundry Local Anwendungen und Entwicklungsworkflows, die On-Device-Inferenz auf einem einzelnen Gerät und einen kuratierten Modellkatalog erfordern Die Anwendung führt typischerweise Inferenz während des Prozesses über das SDK aus. Die Foundry Local CLI kann Modelle und einen lokalen Dienst auf dem Gerät verwalten. Foundry Local kann auf Serverhardware laufen, aber sein Design zielt nicht auf Mehrbenutzer-Serverinferenz ab. Es bietet keine gleichzeitige Anfrage-Warteschlange, kontinuierliches Batching oder effizientes GPU-Sharing für viele gleichzeitige Clients.

Die Ansätze schließen sich nicht innerhalb einer Organisation aus. Eine Anwendung könnte ein ONNX-Modell über Windows ML einbetten, ein Entwickler könnte Foundry Local auf einer Workstation verwenden, und Remote-Entwicklungstools sowie Geschäftsanwendungen könnten einen gemeinsamen Endpunkt auf Windows Server verwenden. Behandeln Sie jeden Pfad als eigene Arbeitslast mit eigenem Modell, Hardware, Sicherheit und eigenen Supportanforderungen.

Plane die Windows Server-Infrastruktur für KI-Inferenz

Modellarchitektur, Parameteranzahl, Quantisierung, Kontextlänge, Anfragenebenläufigkeit und Latenzziele bestimmen den erforderlichen Rechen- und Speicherbereich. Einige Modelle laufen auf einer CPU, während andere Workloads von GPU-Beschleunigung profitieren. Eine GPU ist nicht für jede Inferenzlösung Voraussetzung.

Für eine Arbeitslast auf einem physischen Windows Server-Host kann die Laufzeit Hardware und APIs verwenden, die Windows Server und der Hardwareanbieter unterstützen. Für eine Arbeitslast in einer Hyper-V virtuellen Maschine wählen Sie eine geeignete GPU-Virtualisierungsoption. Die Planung der GPU-Beschleunigung in Windows Server vergleicht direkten Hostzugriff, diskrete Gerätezuweisung (DDA), GPU-Partitionierung und Windows-Containerszenarien. GPU-Partitionierung ist ab Windows Server 2025 verfügbar und ist eine optionale Infrastrukturoption.

Plane auch für diese Ressourcen:

  • Speicher und GPU-Speicher: Berücksichtigen das geladene Modell, Kontext- und Cache-Anforderungen, gleichzeitige Anfragen und andere Prozesse auf dem Host.
  • Speicher: Bereitstellung von Kapazitäts- und Zugriffskontrollen für Modelldateien, Laufzeitpakete, Logs und temporäre Daten. Die Modellakquise kann eine externe Netzwerkverbindung erfordern, selbst wenn die Inferenz lokal läuft.
  • Netzwerk: Für einen gemeinsamen Endpunkt schätzen Sie Bandbreite und Latenz zwischen Clients und Endpunkt. Definieren Sie, welche Netzwerke und Hosts den Dienst erreichen können.
  • Verfügbarkeit und Kapazität: Entscheiden Sie, wie sich die Clients verhalten, wenn das Endgerät nicht verfügbar ist oder mit voller Kapazität betrieben wird. Überprüfen Sie Parallelität und Durchsatz mit repräsentativen Modellen und Anforderungen vor der Verwendung in der Produktion.

Sichere und funktionierende KI-Inferenz auf Windows Server

Lokale Platzierung stellt für sich genommen keine Sicherheitsgrenze dar. Definieren Sie die Grenze, innerhalb der Eingaben, abgerufene Daten, Modelldateien, Ausgaben, Protokolle und Diagnosen bleiben müssen, und überprüfen Sie dann jede Komponente anhand dieser Grenze.

Schützen Sie den Netzwerkverkehr mit genehmigten TLS-Einstellungen, authentifizieren und autorisieren Sie Clients, beschränken Sie den Endpunktzugriff mit Netzwerkkontrollen und speichern Sie Zugangsdaten in einem genehmigten geheimen Speicher. Fügen Sie keine Zugangsdaten in Quelldateien oder Tool-Konfigurationen ein, die andere Nutzer lesen können. Überprüfen Sie Modelllizenzen und Beschaffungsquellen, bevor Sie Modelldateien bereitstellen.

Validiere die Modellausgabe, bevor du dich darauf verlässt. Angemessene menschliche Aufsicht über folgenschwere Handlungen oder Entscheidungen aufrechterhalten.

Verwalten Sie die Windows Server-Infrastruktur über Ihre etablierten Administrationstools, einschließlich des Windows Admin Center, wenn es die erforderlichen Operationen unterstützt. Folgen Sie der Laufzeitdokumentation für den Modelllebenszyklus und endpoint-spezifische Operationen. Mindestens sollten Sie die Endpunktgesundheit, Anfragelatenz, Durchsatz, Ausfälle, CPU- und Speichernutzung, GPU-Auslastung und -speichernutzung bei Bedarf sowie Speicherkapazität beobachten. Verfügbare Metriken und Managementoperationen variieren je nach Laufzeit, daher schreibt dieser Artikel keine einzige Observabilitätsimplementierung vor.

Häufige lokale KI-Inferenzszenarien

Lokale Inferenz kann Workloads von Entwicklern, Administratoren und Anwendungen unterstützen, während der Inferenzpfad innerhalb der von der Organisation gewählten Grenzen bleibt.

  • Codierungshilfe: Verbinden Sie ein unterstütztes Entwicklungstool, wie Visual Studio Code auf Windows 11, mit einem bestehenden Endpunkt auf Windows Server zur Codeerklärung, Erstellung, Überprüfung oder Fehlersuche. Quellcode und Prompts reisen über das Netzwerk zu diesem Endpunkt, daher beziehen sie den Netzwerkpfad, den Endpunkt und ihre Operatoren in die Datengrenze ein.
  • Administrative Unterstützung: Verbinden Sie ein Verwaltungswerkzeug mit einem Modell, das Befehle erklären oder vorschlagen kann. Überprüfe generierte Befehle und verstehe ihre Auswirkungen, bevor du sie ausführst, besonders wenn sie den Systemzustand ändern.
  • Dokumentenverarbeitung: Verwenden Sie eine Anwendung, um Dokumente mit einem lokalen Modell zusammenzufassen, zu klassifizieren, zu extrahieren oder zu indexieren. Die Anwendung bleibt verantwortlich für die Autorisierung zur Beschaffung von Dokumenten und zur generierten Ausgabe.
  • Konversationsanwendungen: Fügen Sie einer bestehenden Anwendung Chat- oder Fragebeantwortungserlebnisse hinzu. Die Anwendung kann einen Modellendpunkt mit autorisierten Unternehmensdaten kombinieren, muss jedoch Zugriffskontrollen unabhängig vom Modell durchsetzen.

Nächste Schritte für lokale KI-Inferenz auf Windows Server