AI-inferentie op Windows Server

Lokale AI-inferentie is het proces waarbij een getraind AI-model wordt uitgevoerd op infrastructuur die jij of je organisatie beheert. Het primaire scenario van Windows Server is gedistribueerde inferentie: een OpenAI-compatibel modelserver draait op Windows Server, en externe clients sturen verzoeken naar zijn eindpunt via het netwerk. Zo kan Visual Studio Code op een Windows 11-werkstation prompts naar de server sturen en gegenereerde output ontvangen.

Organisaties gebruiken gedistribueerde inferentie om meerdere klanten toegang te geven tot gedeelde modelberekening, terwijl ze bepalen waar verzoeken en output naartoe gaan. Die controle hangt af van de eindpuntlocatie, het netwerkpad, de clientconfiguratie, modelacquisitie, diagnostiek en andere diensten in de oplossing.

Dit artikel helpt Windows Server-beheerders en ontwikkelaars te beslissen wanneer lokale inferentie gebruikt en de infrastructuuroverwegingen voor die keuze te identificeren.

Hoe AI-inferentie werkt op Windows Server

Met lokale AI-inferentie op Windows Server verbinden externe applicaties en tools zich met het netwerkadres van de modelserver, verzenden verzoeken en ontvangen antwoorden. De clients laden of draaien het model niet lokaal.

Deze topologie geeft Windows Server een eigen rol. De server centraliseert rekenkracht en GPU-capaciteit, modelopslag en hosting, netwerktoegang, serviceoperaties en capaciteitsbeheer voor meerdere clients. Beheerders beheren de gedeelde dienst en de infrastructuur ervan, terwijl ontwikkelaars clients configureren voor de basis-URL van het eindpunt, modelidentificatie, ondersteunde API en authenticatiemethode.

De oplossing bevat deze elementen:

  • Remote client: Een applicatie, ontwikkeltool of administratief hulpmiddel dat prompts of andere modelinvoer over het netwerk stuurt. Clients kunnen draaien op Windows 11, Windows Server of een ander ondersteund platform.
  • Interface: Een SDK of HTTP API die verzoek- en responsformaten definieert. Veel gedeelde runtimes maken bijvoorbeeld OpenAI-compatibele API's bloot.
  • Modelserver en model: De servergerichte runtime die een getraind model laadt, inferentieverzoeken plant en output via het eindpunt terugstuurt.
  • Windows Server-infrastructuur: De fysieke host of virtuele machine, processor, geheugen, opslag, GPU-resources, netwerk en beheertools die de gedeelde werklast ondersteunen en blootstellen.

Een endpoint implementeert één of meer API-formaten die clients gebruiken, maar compatibiliteit betekent niet dat elk endpoint elke functionaliteit ondersteunt. Clients kunnen specifieke routes, modelidentificaties, streaminggedrag, tool- of functieaanroepen, authenticatiemethoden of verzoekvelden nodig hebben. Controleer zowel de clientvereisten als de endpointmogelijkheden voordat je ze verbindt.

Ingebedde inferentie kent een andere grens. De applicatie laadt en draait het model op hetzelfde apparaat, vaak in het applicatieproces, in plaats van een modelserver aan te roepen. Windows ML biedt dit applicatie-inferentieframework voor ONNX-modellen. Foundry Local richt zich ook op workflows op het apparaat. De Foundry Local SDK integreert de runtime in een applicatie, en de commandoregelinterface beheert modellen en een lokale dienst op één apparaat. Deze opties kunnen op Windows Server-hardware draaien, maar bieden op zichzelf geen gedistribueerde inferentiedienst die beheerders centraal beheren voor meerdere clients.

Kies je inferentiebenadering

Kies een aanpak op basis van waar inferentie loopt, hoeveel klanten het model nodig hebben en wie de runtime beheert. Gebruik Windows Server als gedeeld eindpunt om modellen en rekenkracht voor externe clients te centraliseren. Deze aanpak voegt netwerk-, beveiligings-, capaciteits- en beschikbaarheidseisen toe. Alternatief kun je embedded of on-device inferentie gebruiken in Windows Server wanneer een applicatie of apparaat eigenaar zou moeten zijn van de runtime- en modellevenscyclus.

Approach Beste pasvorm Operationeel model Belangrijke grenzen
Windows Server endpoint Meerdere externe applicaties of tools die een modelservice gebruiken die door een centraal operationeel team wordt beheerd Een modelserver op Windows Server bezit het laden van het model, het scheduleren van verzoeken, gelijktijdigheid en de API. Externe clients gebruiken de endpoint-basis-URL, modelidentificatie en authenticatie-instellingen die hun organisatie goedkeurt. Het product dat je kiest bepaalt runtime-installatie, endpoint-implementatie, API-ondersteuning en schaalkenmerken. Dit artikel gaat ervan uit dat het eindpunt bestaat en dat clients het kunnen bereiken.
Windows ML Windows-applicaties die ONNX-modellen op hetzelfde apparaat draaien De applicatie gebruikt de ONNX Runtime die Windows ondersteunt, hetzij als gedeeld systeemcomponent of als zelfstandig onderdeel van de applicatie. Optionele uitvoeringsproviders gebruiken beschikbare CPU-, GPU- of NPU-bronnen. Windows ML is een applicatie-inferentieframework, geen OpenAI-compatibel model-serving endpoint. Vereisten voor uitvoeringsprovider, driver, hardware en model verschillen.
Foundry Local Applicaties en ontwikkelworkflows die inferentie op één apparaat, op het apparaat zelf, en een zorgvuldig samengestelde catalogus met modellen vereisen De applicatie voert doorgaans inference in process uit via de SDK. De Foundry Local CLI kan modellen en een lokale dienst op het apparaat beheren. Foundry Local kan draaien op serverhardware, maar het ontwerp richt zich niet op multi-user serverinferentie. Het biedt geen gelijktijdige wachtrijvorming voor aanvragen, continue batchverwerking of efficiënte deling van GPU-capaciteit voor veel gelijktijdige cliënten.

De benaderingen sluiten elkaar niet uit binnen een organisatie. Een applicatie kan een ONNX-model inbedden via Windows ML, een ontwikkelaar kan Foundry Local op één werkstation gebruiken, en externe ontwikkeltools en zakelijke applicaties kunnen een gedeeld eindpunt op Windows Server gebruiken. Behandel elk pad als een aparte werklast met een eigen model, hardware, beveiliging en ondersteuningsvereisten.

Plan Windows Server-infrastructuur voor AI-inferentie

Modelarchitectuur, parameteraantal, kwantisatie, contextlengte, verzoekgelijktijdigheid en latentiedoelen bepalen de benodigde rekenkracht en geheugen. Sommige modellen draaien op een CPU, terwijl andere workloads profiteren van GPU-versnelling. Een GPU is niet een vereiste voor elke inferentieoplossing.

Voor een werklast op een fysieke Windows Server-host kan de runtime hardware en API's gebruiken die Windows Server en de hardwareleverancier ondersteunen. Voor een werklast in een Hyper-V virtuele machine selecteer je een geschikte GPU-virtualisatieoptie. Plan voor GPU-versnelling in Windows Server vergelijkt directe hosttoegang, Discrete Device Assignment (DDA), GPU-partitionering en Windows-containerscenario's. GPU-partitionering is beschikbaar in Windows Server 2025 of later en is een optionele infrastructuurkeuze.

Plan ook voor deze bronnen:

  • Geheugen en GPU-geheugen: Houd rekening met het geladen model, context- en cachevereisten, gelijktijdige verzoeken en andere processen op de host.
  • Opslag: Bied capaciteits- en toegangscontroles voor modelbestanden, runtime-pakketten, logs en tijdelijke data. Modelacquisitie kan een externe netwerkverbinding vereisen, zelfs wanneer de inferentie lokaal wordt uitgevoerd.
  • Netwerk: Voor een gedeeld eindpunt schat je de bandbreedte en latentie tussen clients en het eindpunt. Definieer welke netwerken en hosts de dienst kunnen bereiken.
  • Beschikbaarheid en capaciteit: Bepaal hoe clients zich gedragen wanneer het eindpunt niet beschikbaar is of op volle capaciteit werkt. Valideer gelijktijdigheid en doorvoer met representatieve modellen en verzoeken vóór productiegebruik.

Beveilig en beheer AI-inferentie op Windows Server

Lokale plaatsing biedt op zichzelf geen beveiligingsgrens. Definieer de grens waarbinnen prompts, opgehaalde gegevens, modelbestanden, uitvoer, logbestanden en diagnostische gegevens moeten blijven, en toets vervolgens elk onderdeel aan die grens.

Bescherm netwerkverkeer met goedgekeurde TLS-instellingen, authenticeer en autoriseer clients, beperk de toegang tot eindpunten met netwerkbesturingen en sla inloggegevens op in een goedgekeurde geheime opslag. Plaats geen inloggegevens in bronbestanden of toolconfiguraties die andere gebruikers kunnen lezen. Bekijk modellicenties en acquisitiebronnen voordat je modelbestanden uitrolt.

Valideer de uitvoer van het model voordat je erop vertrouwt. Houd passende menselijke controle voor gevolglijke handelingen of beslissingen.

Beheer de Windows Server-infrastructuur via je gevestigde beheertools, inclusief Windows Admin Center wanneer het de vereiste bewerkingen ondersteunt. Volg de runtime-documentatie voor modellevenscyclus en endpoint-specifieke operaties. Minimaal moet je rekening houden met de gezondheid van het eindpunt, verzoeklatentie, doorvoer, storingen, CPU- en geheugengebruik, GPU-gebruik en geheugengebruik indien van toepassing, en opslagcapaciteit. Beschikbare metrics en beheeroperaties variëren per runtime, dus dit artikel schrijft geen enkele observability-implementatie voor.

Veelvoorkomende lokale AI-inferentiescenario's

Lokale inferentie kan de workloads van ontwikkelaars, beheerders en applicaties ondersteunen, terwijl het inferentiepad binnen de door een organisatie gekozen grens blijft.

  • Codehulp: Verbind een ondersteund ontwikkelprogramma, zoals Visual Studio Code op Windows 11, met een bestaand eindpunt op Windows Server voor code-uitleg, generatie, beoordeling of probleemoplossing. Broncode en prompts gaan over het netwerk naar dat eindpunt, dus neem het netwerkpad, het eindpunt en de beheerders ervan op in de data-afbakening.
  • Administratieve hulp: Verbind een administratief hulpmiddel met een model dat commando's kan uitleggen of voorstellen. Bekijk gegenereerde commando's en begrijp hun effecten voordat je ze uitvoert, vooral wanneer ze van systeemstatus veranderen.
  • Documentverwerking: Gebruik een applicatie om documenten samen te vatten, classificeren, extraheren of indexeren met een lokaal model. De applicatie blijft verantwoordelijk voor de autorisatie om documenten te sourcen en de output te genereren.
  • Conversatieapplicaties: Voeg chat- of vragen-antwoordervaringen toe aan een bestaande applicatie. De applicatie kan een modeleindpunt combineren met geautoriseerde bedrijfsgegevens, maar moet toegangscontroles onafhankelijk van het model afdwingen.

Volgende stappen voor lokale AI-inferentie op Windows Server