Inferenza AI su Windows Server

L'inferenza locale di IA è il processo di esecuzione di un modello AI addestrato su infrastrutture che tu o la tua organizzazione controllate. Lo scenario principale di Windows Server è l'inferenza distribuita: un modello server compatibile con OpenAI gira su Windows Server e i client remoti inviano richieste al proprio endpoint tramite la rete. Ad esempio, Visual Studio Code su una workstation Windows 11 può inviare prompt al server e ricevere output generati.

Le organizzazioni utilizzano l'inferenza distribuita per dare a più client accesso al calcolo condiviso del modello controllando al contempo dove viaggiano richieste e output. Questo controllo dipende dalla posizione dell'endpoint, dal percorso di rete, dalla configurazione del client, dall'acquisizione del modello, dalla diagnostica e da altri servizi presenti nella soluzione.

Questo articolo aiuta amministratori e sviluppatori di Windows Server a decidere quando utilizzare l'inferenza locale e a individuare le considerazioni infrastrutturali per tale scelta.

Come funziona l'inferenza AI su Windows Server

Utilizzando l'inferenza AI locale su Windows Server, applicazioni e strumenti remoti si collegano all'indirizzo di rete del server modello, inviano richieste e ricevono risposte. I client non caricano né eseguono il modello in locale.

Questa topologia conferisce a Windows Server un ruolo distinto. Il server centralizza la capacità di calcolo e la capacità GPU, l'archiviazione e l'hosting dei modelli, l'accesso alla rete, le operazioni dei servizi e la gestione della capacità per più clienti. Gli amministratori gestiscono il servizio condiviso e la sua infrastruttura, mentre gli sviluppatori configurano i client per l'URL base dell'endpoint, l'identificatore del modello, l'API supportata e il metodo di autenticazione.

La soluzione contiene questi elementi:

  • Client remoto: un'applicazione, uno strumento di sviluppo o uno strumento amministrativo che invia prompt o altri input di modello attraverso la rete. I client possono funzionare su Windows 11, Windows Server o un'altra piattaforma supportata.
  • Interfaccia: Un SDK o un'API HTTP che definisce i formati di richiesta e risposta. Molti runtime condivisi espongono, ad esempio, API compatibili con OpenAI.
  • Server di modelli e modello: Il runtime basato su server che carica un modello addestrato, pianifica le richieste di inferenza e restituisce l'output tramite l'endpoint.
  • Infrastruttura Windows Server: L'host fisico o macchina virtuale, processore, memoria, storage, risorse GPU, rete e strumenti di gestione che supportano ed espongono il carico di lavoro condiviso.

Un endpoint implementa uno o più formati API utilizzati dai client, ma la compatibilità non significa che ogni endpoint supporti ogni funzionalità. I client potrebbero richiedere percorsi specifici, identificatori di modello, comportamento di streaming, chiamate di strumenti o funzioni, metodi di autenticazione o campi di richiesta. Conferma sia i requisiti del client che le capacità dell'endpoint prima di collegarli.

L'inferenza incorporata ha un confine diverso. L'applicazione carica ed esegue il modello sullo stesso dispositivo, spesso nel processo applicativo, invece di chiamare un server modello. Windows ML fornisce questo framework di inferenza applicativa per i modelli ONNX. Foundry Local mira anche ai flussi di lavoro on-device. Il Foundry Local SDK incorpora l'runtime in un'applicazione, e la sua interfaccia a riga di comando gestisce i modelli e un servizio locale su un dispositivo. Queste opzioni possono funzionare su hardware di Windows Server, ma da sole non forniscono un servizio di inferenza distribuito che gli amministratori gestiscano centralmente per più client.

Scegli il tuo approccio di inferenza

Scegli un approccio basato su dove viene eseguita l'inferenza, quanti client hanno bisogno del modello e chi gestisce il runtime. Usa Windows Server come endpoint condiviso per centralizzare i modelli e calcolare per client remoti. Questo approccio aggiunge requisiti di rete, sicurezza, capacità e disponibilità. In alternativa, usa l'inferenza integrata o sul dispositivo in Windows Server quando un'applicazione o un dispositivo deve gestire il runtime e il ciclo di vita del modello.

Avvicinarsi Soluzione ottimale Modello operativo Confini importanti
endpoint di Windows Server Molteplici applicazioni o strumenti remoti che consumano un servizio modello gestito da un team operativo centrale Un server di modelli in Windows Server gestisce il caricamento dei modelli, la pianificazione delle richieste, la gestione della concorrenza e l'API. I client remoti utilizzano l'URL base dell'endpoint, l'identificatore del modello e le impostazioni di autenticazione approvate dalla loro organizzazione. Il prodotto che scegli determina l'installazione in runtime, il deployment degli endpoint, il supporto API e le caratteristiche di scala. Questo articolo presuppone che l'endpoint esista e che i clienti possano raggiungerlo.
Windows ML Applicazioni Windows che eseguono modelli ONNX sullo stesso dispositivo L'applicazione utilizza il runtime ONNX supportato da Windows, sia come componente di sistema condiviso sia come autosufficiente con l'applicazione. I fornitori di esecuzione opzionali utilizzano risorse disponibili per CPU, GPU o NPU. Windows ML è un framework di inferenza applicativa, non un endpoint di modellazione compatibile con OpenAI. I requisiti del provider di esecuzione, del driver, dell'hardware e del modello variano.
Foundry Local Applicazioni e flussi di lavoro di sviluppo che richiedono inferenza eseguita localmente su un singolo dispositivo e un catalogo selezionato di modelli L'applicazione tipicamente esegue inferenza in processo tramite l'SDK. La CLI locale di Foundry può gestire modelli e un servizio locale sul dispositivo. Foundry Local può essere eseguito su hardware per server, ma non è progettato per l'inferenza multiutente su server. Non offre coda di richieste concorrenti, batching continuo o condivisione efficiente della GPU per molti client simultanei.

Gli approcci non sono mutuamente esclusivi all'interno di un'organizzazione. Un'applicazione potrebbe incorporare un modello ONNX tramite Windows ML, uno sviluppatore potrebbe usare Foundry Local su una workstation, e strumenti di sviluppo remoto e applicazioni aziendali potrebbero utilizzare un endpoint condiviso su Windows Server. Tratta ogni percorso come un carico di lavoro separato con il proprio modello, hardware, sicurezza e requisiti di supporto.

Pianificare l'infrastruttura di Windows Server per l'inferenza AI

L'architettura del modello, il conteggio dei parametri, la quantizzazione, la lunghezza del contesto, la concorrenza delle richieste e i target di latenza determinano il calcolo e la memoria necessari. Alcuni modelli funzionano su CPU, mentre altri carichi di lavoro beneficiano dell'accelerazione GPU. Una GPU non è un prerequisito per ogni soluzione di inferenza.

Per un carico di lavoro su un host Windows Server fisico, l'runtime può utilizzare hardware e API supportati da Windows Server e dal fornitore hardware. Per un carico di lavoro in una macchina virtuale Hyper-V, seleziona un'opzione di virtualizzazione GPU appropriata. Il piano per l'accelerazione GPU in Windows Server confronta l'accesso diretto all'host, l'assegnazione discreta dei dispositivi (DDA), la partizionazione GPU e gli scenari dei container di Windows. La partizionazione GPU è disponibile in Windows Server 2025 o versioni successive ed è una scelta opzionale dell'infrastruttura.

Pianifica anche queste risorse:

  • Memoria e memoria GPU: Tenere conto del modello caricato, del contesto e dei requisiti di cache, delle richieste concorrenti e degli altri processi sull'host.
  • Archiviazione: Fornire controlli di capacità e accesso per file modello, pacchetti runtime, log e dati temporanei. L'acquisizione del modello può richiedere una connessione di rete esterna anche quando l'inferenza viene eseguita localmente.
  • Rete: Per un endpoint condiviso, stima la larghezza di banda e la latenza tra client e endpoint. Definisci quali reti e host possono raggiungere il servizio.
  • Disponibilità e capacità: decidere come si comportano i clienti quando l'endpoint non è disponibile o funziona alla massima capacità. Validare la concorrenza e la velocità di trasmissione con modelli rappresentativi e richieste prima dell'uso in produzione.

Proteggi e gestisci l'inferenza IA su Windows Server

Il posizionamento locale non fornisce un confine di sicurezza da solo. Definisci il perimetro entro il quale devono rimanere i prompt, i dati recuperati, i file del modello, gli output, i log e i dati diagnostici, quindi verifica ogni componente rispetto a tale perimetro.

Proteggere il traffico di rete con impostazioni TLS approvate, autenticare e autorizzare i client, limitare l'accesso agli endpoint con controlli di rete e memorizzare le credenziali in uno store segreto approvato. Non inserire credenziali nei file sorgente o nelle configurazioni degli strumenti che altri utenti possano leggere. Esamina le licenze modello e le fonti di acquisizione prima di distribuire i file modello.

Verifica l'output del modello prima di fare affidamento su di esso. Mantenere un'adeguata supervisione umana per azioni o decisioni rilevanti.

Gestisci l'infrastruttura di Windows Server tramite gli strumenti amministrativi già registrati, incluso Windows Admin Center quando supporta le operazioni richieste. Segui la documentazione di runtime per il ciclo di vita del modello e le operazioni specifiche per endpoint. Al minimo, pianifica di osservare la salute degli endpoint, la latenza delle richieste, la produttività, i guasti, l'uso di CPU e memoria, l'utilizzo della GPU e della memoria quando applicabile, e la capacità di archiviazione. Le metriche disponibili e le operazioni di gestione variano a seconda dell'esecuzione, quindi questo articolo non prescrive un'unica implementazione di osservabilità.

Scenari comuni di inferenza di IA locale

L'inferenza locale può supportare carichi di lavoro di sviluppatori, amministratori e applicazioni mantenendo il percorso di inferenza all'interno del confine scelto dall'organizzazione.

  • Assistenza alla programmazione: collega uno strumento di sviluppo supportato, come Visual Studio Code su Windows 11, a un endpoint esistente su Windows Server per spiegazioni, generazione, revisione o risoluzione dei problemi del codice. Il codice sorgente e i prompt viaggiano attraverso la rete fino a quell'endpoint, quindi includono il percorso di rete, l'endpoint e i suoi operatori nel confine dei dati.
  • Assistenza amministrativa: collega uno strumento amministrativo a un modello che possa spiegare o proporre comandi. Rivedi i comandi generati e comprendi i loro effetti prima di eseguirli, soprattutto quando cambiano lo stato del sistema.
  • Elaborazione documenti: Utilizzare un'applicazione per riassumere, classificare, estrarre o indicizzare documenti con un modello locale. L'applicazione rimane responsabile dell'autorizzazione ai documenti fonte e ai risultati generati.
  • Applicazioni conversazionali: Aggiungi esperienze di chat o di domanda-risposta a un'applicazione esistente. L'applicazione può combinare un endpoint modello con dati aziendali autorizzati, ma deve applicare controlli di accesso indipendentemente dal modello.

Prossimi passi per l'inferenza AI locale su Windows Server