AI-inferens på Windows Server

Lokal AI-inferens är processen att köra en tränad AI-modell på infrastruktur som du eller din organisation kontrollerar. Det primära Windows Server-scenariot är distribuerad inferens: en OpenAI-kompatibel modell för server körs på Windows Server, och fjärrklienter skickar förfrågningar till dess slutpunkt över nätverket. Till exempel kan Visual Studio Code på en Windows 11-arbetsstation skicka prompts till servern och ta emot genererad utdata.

Organisationer använder distribuerad inferens för att ge flera klienter tillgång till delad modellberäkning samtidigt som de kontrollerar vart förfrågningar och utdata färdas. Den kontrollen beror på slutpunktens plats, nätverksväg, klientkonfiguration, modellinsamling, diagnostik och andra tjänster i lösningen.

Den här artikeln hjälper Windows Server-administratörer och utvecklare att avgöra när lokal inferens ska användas och identifiera infrastrukturöverväganden för det valet.

Hur AI-inferens fungerar på Windows Server

Genom att använda lokal AI-inferens på Windows Server ansluter fjärrapplikationer och verktyg till modellserverns nätverksadress, skickar förfrågningar och tar emot svar. Klienterna laddar eller kör inte modellen lokalt.

Denna topologi ger Windows Server en särskild roll. Servern centraliserar beräknings- och GPU-kapacitet, modelllagring och hosting, nätverksåtkomst, servicedrift och kapacitetshantering för flera klienter. Administratörer driver den delade tjänsten och dess infrastruktur, medan utvecklare konfigurerar klienter för endpointens bas-URL, modellidentifierare, stödd API och autentiseringsmetod.

Lösningen innehåller dessa element:

  • Fjärrklient: Ett applikations-, utvecklingsverktyg eller administrativt verktyg som skickar prompts eller annan modellinmatning över nätverket. Klienter kan köras på Windows 11, Windows Server eller en annan stödd plattform.
  • Gränssnitt: Ett SDK eller HTTP-API som definierar format för förfrågningar och svar. Många delade runtimes exponerar till exempel OpenAI-kompatibla API:er.
  • Modellserver och modell: Den serverorienterade runtime som laddar en tränad modell, schemalägger inferensförfrågningar och returnerar utdata via slutpunkten.
  • Windows Server-infrastruktur: Den fysiska värddatorn eller den virtuella maskinen, processorn, minnet, lagringsresurserna, GPU-resurserna, nätverket och hanteringsverktygen som stöder och tillhandahåller den delade arbetslasten.

En endpoint implementerar ett eller flera API-format som klienter använder, men kompatibilitet betyder inte att varje endpoint stöder alla funktioner. Klienter kan kräva specifika rutter, modellidentifierare, strömningsbeteende, anrop av verktyg eller funktioner, autentiseringsmetoder eller förfrågningsfält. Bekräfta både klientkraven och endpointens kapacitet innan du kopplar ihop dem.

Inbäddad inferens har en annan gräns. Applikationen laddar och kör modellen på samma enhet, ofta i applikationsprocessen, istället för att anropa en modellserver. Windows ML tillhandahåller detta applikationsinferensramverk för ONNX-modeller. Foundry Local riktar sig också mot arbetsflöden på enheten. Foundry Local SDK integrerar körmiljön i en applikation, och dess kommandoradsgränssnitt hanterar modeller och en lokal tjänst på samma enhet. Dessa alternativ kan köras på Windows Server-hårdvara, men de tillhandahåller inte själva en distribuerad inferenstjänst som administratörer driver centralt för flera klienter.

Välj din inferensmetod

Välj en metod baserad på var inferensen körs, hur många klienter som behöver modellen och vem som hanterar körtiden. Använd Windows Server som en delad slutpunkt för att centralisera modeller och beräkningar för fjärrklienter. Detta tillvägagångssätt tillför krav på nätverk, säkerhet, kapacitet och tillgänglighet. Du kan också använda inbäddad inferens eller inferens på enheten i Windows Server när ett program eller en enhet ska hantera körningsmiljöns och modellens livscykel.

Metod Bästa passform Operativ modell Viktiga gränser
Windows Server-slutpunkt Flera fjärrapplikationer eller verktyg som använder en modelltjänst som ett centralt driftteam hanterar En modellserver på Windows Server äger modellladdning, schemaläggning av förfrågningar, samtidighet och API:et. Fjärrklienter använder endpoint-basens URL, modellidentifierare och autentiseringsinställningar som deras organisation godkänner. Produkten du väljer bestämmer körtidsinstallation, endpoint-distribution, API-stöd och skalningsegenskaper. Denna artikel antar att ändpunkten existerar och att klienter kan nå den.
Windows ML Windows-applikationer som kör ONNX-modeller på samma enhet Applikationen använder ONNX Runtime som Windows stödjer, antingen som en delad systemkomponent eller som självständig del av applikationen. Valfria exekveringsleverantörer använder tillgängliga CPU-, GPU- eller NPU-resurser. Windows ML är ett applikationsinferensramverk, inte en OpenAI-kompatibel modellserverande endpoint. Krav på exekveringsleverantör, drivrutin, hårdvara och modell varierar.
Foundry Local Applikationer och utvecklingsarbetsflöden som kräver inferens från en enhet, på enheten och en kurerad modellkatalog Applikationen kör vanligtvis inferens under processen via SDK:n. Foundry Local CLI kan hantera modeller och en lokal tjänst på enheten. Foundry Local kan köras på serverhårdvara, men det är inte utformat för serverinferens för flera användare. Den erbjuder inte samtidig köordning för förfrågningar, kontinuerlig batchning eller effektiv GPU-delning för många samtidiga klienter.

Metoderna utesluter inte varandra inom organisationen. En applikation kan bädda in en ONNX-modell via Windows ML, en utvecklare kan använda Foundry Local på en arbetsstation, och fjärrutvecklingsverktyg samt affärsapplikationer kan använda en delad slutpunkt på Windows Server. Behandla varje väg som en separat arbetsbelastning med egen modell, hårdvara, säkerhet och supportkrav.

Planera Windows Server-infrastruktur för AI-inferens

Modellarkitektur, parameterantal, kvantisering, kontextlängd, förfrågningssamtidighet och latensmål bestämmer den nödvändiga beräkningskraften och minnet. Vissa modeller körs på en CPU, medan andra arbetsbelastningar drar nytta av GPU-acceleration. Ett grafikkort är inte ett krav för varje inferenslösning.

För en arbetsbelastning på en fysisk Windows Server-värd kan runtimen använda maskinvara och API:er som Windows Server och maskinvaruleverantören har stöd för. För en arbetsbelastning i en Hyper-V virtuell maskin, välj ett lämpligt alternativ för GPU-virtualisering. Planen för GPU-acceleration i Windows Server jämför direkt värdåtkomst, diskret enhetstilldelning (DDA), GPU-partitionering och Windows-containerscenarier. GPU-partitionering finns tillgänglig i Windows Server 2025 eller senare och är ett valfritt alternativ för infrastruktur.

Planera också för dessa resurser:

  • Minne och GPU-minne: Ta hänsyn till den laddade modellen, kontext- och cachekrav, samtidiga förfrågningar och andra processer på värden.
  • Lagring: Tillhandahålla kapacitets- och åtkomstkontroller för modellfiler, runtime-paket, loggar och tillfällig data. Modellförvärv kan kräva en extern nätverksanslutning även när inferensen körs lokalt.
  • Nätverk: För en delad endpoint, uppskatta bandbredd och latens mellan klienter och endpoint. Definiera vilka nätverk och värdar som kan nå tjänsten.
  • Tillgänglighet och kapacitet: Bestäm hur klienterna beter sig när slutpunkten är otillgänglig eller körs på full kapacitet. Validera samtidighet och genomströmning med representativa modeller och förfrågningar innan produktionsanvändning.

Säkra och driv AI-inferens på Windows Server

Lokal placering ger ingen säkerhetsgräns i sig. Definiera gränsen som promptar, hämtade data, modelfiler, utdata, loggar och diagnostikdata måste hållas inom, och verifiera sedan varje komponent mot den gränsen.

Skydda nätverkstrafik med godkända TLS-inställningar, autentisera och auktorisera klienter, begränsa åtkomst till slutpunkter med nätverkskontroller och lagra inloggningsuppgifter i en godkänd hemlig lagring. Lägg inte in uppgifter i källfiler eller verktygskonfigurationer som andra användare kan läsa. Gå igenom modelllicenser och förvärvskällor innan du distribuerar modellfiler.

Validera modellutdata innan du förlitar dig på det. Upprätthåll lämplig mänsklig tillsyn för följdåtgärder eller beslut.

Hantera Windows Server-infrastrukturen via dina etablerade administrationsverktyg, inklusive Windows Admin Center när det stödjer nödvändiga operationer. Följ körtidsdokumentationen för modelllivscykel och endpoint-specifika operationer. Minst bör du planera att observera endpointens hälsa, förfrågningslatens, genomströmning, fel, CPU- och minnesanvändning, GPU-användning och minnesanvändning när det är tillämpligt, samt lagringskapacitet. Tillgängliga mätvärden och hanteringsoperationer varierar beroende på körtid, så denna artikel föreskriver inte en enda observabilitetsimplementation.

Vanliga scenarier för lokal AI-inferens.

Lokal inferens kan stödja arbetsbelastningar för utvecklare, administratörer och applikationer samtidigt som inferensvägen hålls inom organisationens valda gräns.

  • Kodningshjälp: Koppla ett stödd utvecklingsverktyg, såsom Visual Studio Code på Windows 11, till en befintlig endpoint på Windows Server för kodförklaring, generering, granskning eller felsökning. Källkod och promptar färdas över nätverket till den ändpunkten, så inkludera nätverksvägen, slutpunkten och dess operatörer i datagränsen.
  • Administrativ hjälp: Koppla ett administrativt verktyg till en modell som kan förklara eller föreslå kommandon. Gå igenom genererade kommandon och förstå deras effekter innan du kör dem, särskilt när de ändrar systemstatus.
  • Dokumentbehandling: Använd en applikation för att sammanfatta, klassificera, extrahera eller indexera dokument med en lokal modell. Applikationen ansvarar fortfarande för behörighetskontroll av källdokument och genererade utdata.
  • Konversationsapplikationer: Lägg till chatt- eller frågesvarsupplevelser till en befintlig applikation. Applikationen kan kombinera en modellslutpunkt med företagsdata som den har behörighet till, men den måste tillämpa åtkomstkontroller oberoende av modellen.

Nästa steg för lokal AI-inferens på Windows Server