Inferencia de IA en Windows Server

La inferencia local de IA es el proceso de ejecutar un modelo de IA entrenado sobre infraestructuras que tú o tu organización controláis. El escenario principal de Windows Server es la inferencia distribuida: un servidor modelo compatible con OpenAI funciona en Windows Server, y los clientes remotos envían peticiones a su punto final a través de la red. Por ejemplo, Visual Studio Code en una estación de trabajo con Windows 11 puede enviar avisos al servidor y recibir la salida generada.

Las organizaciones utilizan la inferencia distribuida para dar acceso a múltiples clientes a la computación compartida del modelo, controlando a la vez hacia dónde viajan las solicitudes y las salidas. Ese control depende de la ubicación del endpoint, la ruta de red, la configuración del cliente, la adquisición de modelos, el diagnóstico y otros servicios en la solución.

Este artículo ayuda a administradores y desarrolladores de Windows Server a decidir cuándo usar la inferencia local e identificar las consideraciones de infraestructura para esa elección.

Cómo funciona la inferencia de IA en Windows Server

Mediante inferencia local de IA en Windows Server, las aplicaciones y herramientas remotas se conectan a la dirección de red del servidor modelo, envían solicitudes y reciben respuestas. Los clientes no cargan ni ejecutan el modelo localmente.

Esta topología otorga a Windows Server un papel distinto. El servidor centraliza la capacidad de cómputo y GPU, el almacenamiento y alojamiento de modelos, el acceso a la red, las operaciones de servicios y la gestión de capacidad para múltiples clientes. Los administradores operan el servicio compartido y su infraestructura, mientras que los desarrolladores configuran a los clientes para la URL base del endpoint, el identificador del modelo, la API compatible y el método de autenticación.

La solución contiene estos elementos:

  • Cliente remoto: Una aplicación, herramienta de desarrollo o herramienta administrativa que envía prompts u otra entrada de modelo a través de la red. Los clientes pueden ejecutarse en Windows 11, Windows Server u otra plataforma compatible.
  • Interfaz: Un SDK o API HTTP que define formatos de solicitud y respuesta. Por ejemplo, muchos entornos compartidos exponen APIs compatibles con OpenAI.
  • Servidor de modelos y modelo: El entorno de ejecución orientado al servidor que carga un modelo entrenado, programa las solicitudes de inferencia y devuelve la salida a través del punto de conexión.
  • Infraestructura de Windows Server: El anfitrión físico o máquina virtual, procesador, memoria, almacenamiento, recursos de la GPU, red y herramientas de gestión que soportan y exponen la carga de trabajo compartida.

Un endpoint implementa uno o más formatos de API que usan los clientes, pero la compatibilidad no significa que todos los endpoints soporten todas las capacidades. Los clientes pueden requerir rutas específicas, identificadores de modelo, comportamiento de streaming, llamadas a herramientas o funciones, métodos de autenticación o campos de solicitud. Confirma tanto los requisitos del cliente como las capacidades del endpoint antes de conectarlos.

La inferencia incrustada tiene un límite diferente. La aplicación carga y ejecuta el modelo en el mismo dispositivo, a menudo en el proceso de la aplicación, en lugar de llamar a un servidor modelo. Windows ML proporciona este marco de inferencia de aplicaciones para modelos ONNX. Foundry Local también está dirigido a flujos de trabajo dentro del dispositivo. El SDK local de Foundry integra el tiempo de ejecución en una aplicación, y su interfaz de línea de comandos gestiona modelos y un servicio local en un dispositivo. Estas opciones pueden ejecutarse en hardware de Windows Server, pero por sí solas no proporcionan un servicio de inferencia distribuido que los administradores operen de forma centralizada para varios clientes.

Elige tu enfoque de inferencia

Elige un enfoque basado en dónde se ejecuta la inferencia, cuántos clientes necesitan el modelo y quién opera el tiempo de ejecución. Utiliza Windows Server como punto final compartido para centralizar modelos y calcular para clientes remotos. Este enfoque añade requisitos de red, seguridad, capacidad y disponibilidad. Como alternativa, use inferencia integrada o en dispositivo en Windows Server cuando una aplicación o dispositivo deba asumir la gestión del entorno de ejecución y del ciclo de vida del modelo.

Approach Mejor ajuste Modelo operativo Límites importantes
Punto final de Windows Server Múltiples aplicaciones o herramientas remotas que consumen un servicio modelo que gestiona un equipo central de operaciones Un servidor modelo en Windows Server se encarga de la carga de modelos, la planificación de peticiones, la concurrencia y la API. Los clientes remotos utilizan la URL base del endpoint, el identificador del modelo y la configuración de autenticación que su organización aprueba. El producto que selecciones determina la instalación en tiempo de ejecución, el despliegue en endpoints, el soporte de API y las características de escalabilidad. Este artículo asume que el endpoint existe y que los clientes pueden acceder a él.
Windows ML Aplicaciones de Windows que ejecutan modelos ONNX en el mismo dispositivo La aplicación utiliza el Runtime ONNX que Windows soporta, ya sea como componente compartido del sistema o como autónomo con la aplicación. Los proveedores de ejecución opcionales utilizan recursos disponibles de CPU, GPU o NPU. Windows ML es un marco de inferencia de aplicaciones, no un punto final compatible con OpenAI para servir modelos. Los requisitos de proveedor de ejecución, controlador, hardware y modelo varían.
Foundry Local Aplicaciones y flujos de trabajo de desarrollo que requieren inferencia en un solo dispositivo y un catálogo de modelos seleccionado La aplicación normalmente ejecuta inferencia en proceso a través del SDK. La CLI local de Foundry puede gestionar modelos y un servicio local en el dispositivo. Foundry Local puede funcionar en hardware de servidor, pero su diseño no apunta a la inferencia de servidores multiusuario. No ofrece puesta en cola de solicitudes simultáneas, procesamiento por lotes continuo ni uso compartido eficiente de la GPU para numerosos clientes simultáneos.

Los enfoques no son mutuamente excluyentes en una organización. Una aplicación puede incrustar un modelo ONNX a través de Windows ML, un desarrollador puede usar Foundry Local en una estación de trabajo, y herramientas de desarrollo remoto y aplicaciones empresariales pueden usar un punto final compartido en Windows Server. Trata cada ruta como una carga de trabajo separada con su propio modelo, hardware, seguridad y requisitos de soporte.

Planificar la infraestructura de Windows Server para la inferencia de IA

La arquitectura del modelo, el número de parámetros, la cuantización, la duración del contexto, la concurrencia de solicitudes y los objetivos de latencia determinan el cálculo y la memoria requeridos. Algunos modelos funcionan con CPU, mientras que otros trabajos se benefician de la aceleración por GPU. Una GPU no es un requisito previo para todas las soluciones de inferencia.

Para una carga de trabajo en un host físico de Windows Server, el entorno de ejecución puede usar hardware y APIs que Windows Server y el fabricante de hardware soportan. Para una carga de trabajo en una máquina virtual Hyper-V, selecciona una opción adecuada de virtualización de GPU. El plan para la aceleración de GPU en Windows Server compara el acceso directo al host, la asignación discreta de dispositivos (DDA), la partición de GPU y los escenarios de contenedores de Windows. La partición de GPU está disponible en Windows Server 2025 o versiones posteriores y es una opción opcional de infraestructura.

También planifica estos recursos:

  • Memoria y memoria GPU: Ten en cuenta el modelo cargado, los requisitos de contexto y caché, las solicitudes concurrentes y otros procesos en el host.
  • Almacenamiento: Proporcionar controles de capacidad y acceso para archivos modelo, paquetes en tiempo de ejecución, registros y datos temporales. La adquisición de modelos puede requerir una conexión de red externa incluso cuando la inferencia se ejecuta localmente.
  • Red: Para un punto final compartido, estima el ancho de banda y la latencia entre los clientes y el endpoint. Define qué redes y hosts pueden acceder al servicio.
  • Disponibilidad y capacidad: Decide cómo se comportan los clientes cuando el endpoint no está disponible o está funcionando a plena capacidad. Validar la concurrencia y el rendimiento con modelos representativos y solicitudes antes de su uso en producción.

Asegurar y operar la inferencia de IA en Windows Server

La colocación local no proporciona un límite de seguridad por sí solo. Define el límite dentro del cual deben permanecer las indicaciones, los datos recuperados, los archivos del modelo, las salidas, los registros y los diagnósticos, y luego verifica cada componente con respecto a ese límite.

Proteger el tráfico de red con la configuración TLS aprobada, autenticar y autorizar clientes, restringir el acceso a los endpoints con controles de red y almacenar credenciales en un almacén secreto aprobado. No pongas credenciales en archivos fuente ni configuraciones de herramientas que otros usuarios puedan leer. Revisa licencias de modelo y fuentes de adquisición antes de desplegar archivos de modelos.

Valida la salida del modelo antes de depender de él. Mantener una supervisión humana adecuada para las acciones o decisiones importantes.

Gestiona la infraestructura de Windows Server a través de tus herramientas de administración establecidas, incluyendo Windows Admin Center cuando soporte las operaciones necesarias. Sigue la documentación del entorno de ejecución para el ciclo de vida del modelo y las operaciones específicas de cada extremo. Como mínimo, planifica observar el estado del endpoint, la latencia de las solicitudes, el rendimiento, fallos, el uso de CPU y memoria, el uso de GPU y memoria cuando corresponda, y la capacidad de almacenamiento. Las métricas disponibles y las operaciones de gestión varían según el tiempo de ejecución, por lo que este artículo no prescribe una única implementación de observabilidad.

Escenarios comunes de inferencia local de IA

La inferencia local puede soportar cargas de trabajo de desarrolladores, administradores y aplicaciones manteniendo la ruta de inferencia dentro del límite seleccionado por la organización.

  • Asistencia de programación: Conecta una herramienta de desarrollo compatible, como Visual Studio Code en Windows 11, a un endpoint existente en Windows Server para explicación, generación, revisión o resolución de problemas de código. El código fuente y los prompts viajan por la red hasta ese punto final, por lo que incluyen la ruta de red, el punto final y sus operadores en el límite de datos.
  • Asistencia administrativa: Conecta una herramienta administrativa a un modelo que pueda explicar o proponer órdenes. Revisa los comandos generados y entiende sus efectos antes de ejecutarlos, especialmente cuando cambian el estado del sistema.
  • Procesamiento de documentos: Utiliza una aplicación para resumir, clasificar, extraer o indexar documentos con un modelo local. La aplicación sigue siendo responsable de la autorización para obtener documentos y generar resultados.
  • Aplicaciones conversacionales: Añade experiencias de chat o respuestas a preguntas a una aplicación existente. La aplicación puede combinar un punto final de modelo con datos empresariales autorizados, pero debe aplicar controles de acceso de forma independiente al modelo.

Próximos pasos para la inferencia local de IA en Windows Server