Windows Server에서의 AI 추론

로컬 AI 추론은 귀하나 조직이 관리하는 인프라에서 학습된 AI 모델을 실행하는 과정입니다. 주요 Windows Server 시나리오는 분산 추론입니다: OpenAI 호환 모델 서버가 Windows Server에서 실행되고, 원격 클라이언트가 네트워크를 통해 그 엔드포인트에 요청을 보냅니다. 예를 들어, Windows 11 워크스테이션의 Visual Studio Code는 서버에 프롬프트를 보내고 생성된 출력을 받을 수 있습니다.

조직은 분산 추론을 사용하여 여러 클라이언트가 공유 모델 컴퓨팅에 접근할 수 있도록 하고, 요청과 출력이 어디로 이동하는지 제어합니다. 이 제어는 엔드포인트 위치, 네트워크 경로, 클라이언트 구성, 모델 획득, 진단 및 솔루션 내 기타 서비스에 따라 달라집니다.

이 글은 Windows Server 관리자와 개발자가 로컬 추론을 언제 사용할지 결정하고, 그 선택에 따른 인프라 고려사항을 파악하는 데 도움을 줍니다.

Windows Server에서 AI 추론이 어떻게 작동하는가

Windows Server의 로컬 AI 추론을 사용하여 원격 애플리케이션과 도구가 모델 서버의 네트워크 주소에 연결하고, 요청을 보내며, 응답을 받습니다. 클라이언트는 모델을 로컬에서 로드하거나 실행하지 않습니다.

이 토폴로지는 Windows Server에 독특한 역할을 부여합니다. 서버는 여러 클라이언트를 위해 컴퓨트 및 GPU 용량, 모델 저장 및 호스팅, 네트워크 접근, 서비스 운영, 용량 관리를 중앙 집중화합니다. 관리자는 공유 서비스와 그 인프라를 운영하고, 개발자는 엔드포인트의 기본 URL, 모델 식별자, 지원되는 API, 인증 방법에 대해 클라이언트를 구성합니다.

해법은 다음과 같은 요소들을 포함합니다:

  • 원격 클라이언트: 네트워크를 통해 프롬프트나 기타 모델 입력을 전송하는 애플리케이션, 개발 도구 또는 관리 도구입니다. 클라이언트는 Windows 11, Windows Server 또는 다른 지원 플랫폼에서 실행할 수 있습니다.
  • 인터페이스: 요청 및 응답 형식을 정의하는 SDK 또는 HTTP API입니다. 많은 공유 런타임은 예를 들어 OpenAI 호환 API를 노출합니다.
  • 모델 서버 및 모델: 학습된 모델을 로드하고 추론 요청을 스케줄링하며 엔드포인트를 통해 출력을 반환하는 서버 지향 런타임입니다.
  • Windows Server 인프라: 공유 워크로드를 지원하고 노출하는 물리적 호스트 또는 가상 머신, 프로세서, 메모리, 저장소, GPU 자원, 네트워크 및 관리 도구입니다.

엔드포인트는 클라이언트가 사용하는 하나 이상의 API 형식을 구현하지만, 호환성이 모든 엔드포인트가 모든 기능을 지원하는 것을 의미하는 것은 아닙니다. 클라이언트는 특정 경로, 모델 식별자, 스트리밍 동작, 도구 또는 함수 호출, 인증 방법 또는 요청 필드를 요구할 수 있습니다. 연결 전에 클라이언트 요구사항과 엔드포인트 기능을 모두 확인하세요.

내재 추론은 다른 경계를 가집니다. 애플리케이션은 모델 서버를 호출하는 대신 동일한 장치에서 모델을 로드하고 실행하며, 종종 애플리케이션 프로세스에서 실행합니다. Windows ML은 ONNX 모델에 대한 이 애플리케이션 추론 프레임워크를 제공합니다. Foundry Local은 온디바이스 워크플로우도 대상으로 합니다. Foundry 로컬 SDK는 애플리케이션에 런타임을 내장하고, 명령줄 인터페이스로 하나의 장치에서 모델과 로컬 서비스를 관리합니다. 이 옵션들은 Windows Server 하드웨어에서 실행할 수 있지만, 관리자가 중앙에서 여러 클라이언트를 위해 운영하는 분산 추론 서비스를 단독으로 제공하지는 않습니다.

추론 방식을 선택하세요

추론이 어디서 실행되는지, 모델에 필요한 클라이언트 수, 런타임을 누가 운영하는지에 따라 접근법을 선택하세요. 원격 클라이언트를 위해 모델을 중앙 집중화하고 계산하는 데 Windows Server를 공유 엔드포인트로 활용하세요. 이 접근법은 네트워크, 보안, 용량 및 가용성 요구사항을 추가합니다. 또는 한 애플리케이션이나 장치가 런타임과 모델 수명 주기를 소유해야 할 때 Windows Server에서 임베디드 또는 온디바이스 추론을 사용할 수도 있습니다.

Approach 가장 적합한 경우 운영 모델 중요한 경계
Windows Server 엔드포인트 중앙 운영팀이 관리하는 모델 서비스를 소비하는 여러 원격 애플리케이션 또는 도구들 Windows Server의 모델 서버는 모델 로딩, 요청 스케줄링, 동시성 및 API를 소유합니다. 원격 클라이언트는 조직에서 승인한 엔드포인트 기본 URL, 모델 식별자 및 인증 설정을 사용합니다. 선택한 제품은 런타임 설치, 엔드포인트 배포, API 지원, 확장 특성을 결정합니다. 이 글은 엔드포인트가 존재하고 클라이언트가 접근할 수 있다고 가정합니다.
Windows ML 동일한 장치에서 ONNX 모델을 실행하는 Windows 애플리케이션 이 애플리케이션은 Windows가 지원하는 ONNX 런타임을 공유된 시스템 구성 요소로 사용하거나 애플리케이션과 독립적으로 결합합니다. 선택적 실행 제공자는 사용 가능한 CPU, GPU, 또는 NPU 자원을 사용합니다. Windows ML은 애플리케이션 추론 프레임워크이지, OpenAI 호환 모델 서빙 엔드포인트가 아닙니다. 실행 제공자, 드라이버, 하드웨어, 모델 요구사항은 다양합니다.
Foundry Local 단일 장치 내 추론과 엄선된 모델 카탈로그가 필요한 애플리케이션 및 개발 워크플로우 애플리케이션은 일반적으로 SDK를 통해 추론을 진행 중에 실행합니다. Foundry Local CLI는 모델과 장치 내 로컬 서비스를 관리할 수 있습니다. Foundry Local은 서버 하드웨어에서 실행할 수 있지만, 설계는 다중 사용자 서버 추론을 목표로 하지 않습니다. 동시 요청 대기열, 연속 배치, 효율적인 GPU 공유를 여러 클라이언트에 제공하지 않습니다.

이 두 접근법은 조직 내에서 상호 배타적이지 않습니다. 한 애플리케이션은 Windows ML을 통해 ONNX 모델을 임베딩할 수 있고, 개발자는 한 워크스테이션에서 Foundry Local을 사용하며, 원격 개발 도구와 비즈니스 애플리케이션은 Windows Server의 공유 엔드포인트를 사용할 수 있습니다. 각 경로를 별도의 모델, 하드웨어, 보안 및 지원 요구사항을 가진 별도의 워크로드로 취급하세요.

AI 추론을 위한 Windows Server 인프라 계획

모델 아키텍처, 매개변수 수, 양자화, 컨텍스트 길이, 요청 동시성, 지연 목표가 필요한 계산 및 메모리를 결정합니다. 일부 모델은 CPU로 실행되고, 다른 워크로드는 GPU 가속의 이점을 누립니다. 모든 추론 해법에 GPU가 필수는 아닙니다.

물리적 Windows Server 호스트의 작업부에는 Windows Server와 하드웨어 벤더가 지원하는 하드웨어와 API를 사용할 수 있습니다. Hyper-V 가상 머신에서 작업 부하가 발생할 경우, 적절한 GPU 가상화 옵션을 선택하세요. Windows Server의 GPU 가속 계획은 직접 호스트 접근, 개별 장치 할당(DDA), GPU 파티셔닝, Windows 컨테이너 시나리오를 비교합니다. GPU 파티셔닝은 Windows Server 2025 이상에서 제공되며, 인프라 선택으로 선택됩니다.

또한 다음 자료들도 계획하세요:

  • 메모리 및 GPU 메모리: 로드된 모델, 컨텍스트 및 캐시 요구사항, 동시 요청, 기타 프로세스 등을 고려합니다.
  • 스토리지: 모델 파일, 런타임 패키지, 로그, 임시 데이터에 대한 용량 및 접근 제어 기능을 제공합니다. 모델 획득은 추론이 로컬에서 실행되더라도 외부 네트워크 연결이 필요할 수 있습니다.
  • 네트워크: 공유 엔드포인트의 경우, 클라이언트와 엔드포인트 간의 대역폭과 지연 시간을 추정합니다. 어떤 네트워크와 호스트가 서비스에 접속할 수 있는지 정의하세요.
  • 가용성 및 용량: 엔드포인트가 사용 불가능하거나 용량이 초과된 상태에서 클라이언트가 어떻게 행동하는지 결정하세요. 운영 전에 대표적인 모델과 요청으로 동시성과 처리량을 검증하세요.

Windows Server에서 AI 추론을 안전하게 하고 작동시키기

지역 배치만으로는 보안 경계가 형성되지 않습니다. 프롬프트, 검색된 데이터, 모델 파일, 출력, 로그, 진단 자료가 반드시 그 안에 있어야 하는 경계를 정의하고, 그 경계에 따라 모든 구성 요소를 검증합니다.

승인된 TLS 설정으로 네트워크 트래픽을 보호하고, 클라이언트를 인증하고 승인하며, 네트워크 제어로 엔드포인트 접근을 제한하고, 승인된 비밀 저장소에 자격 증명을 저장합니다. 다른 사용자가 읽을 수 있는 소스 파일이나 도구 설정에 자격 증명을 넣지 마세요. 모델 파일을 배포하기 전에 모델 라이선스와 획득 소스를 검토하세요.

모델 출력에 의존하기 전에 반드시 검증하세요. 중대한 행동이나 결정에 대해 적절한 인간의 감독을 유지하세요.

필요한 작업을 지원하는 경우 Windows Admin Center를 포함한 기존에 사용하던 관리 도구를 통해 Windows Server 인프라를 관리하세요. 모델 수명주기 및 엔드포인트별 연산에 대해서는 런타임 문서를 준수하세요. 최소한 엔드포인트 상태, 요청 지연, 처리량, 실패, CPU 및 메모리 사용량, GPU 활용률 및 메모리 사용량(해당되는 경우), 저장 용량을 관찰할 계획입니다. 사용 가능한 지표와 관리 작업은 실행 시간에 따라 다르므로, 이 글은 단일 관측성 구현을 규정하지 않습니다.

일반적인 로컬 AI 추론 시나리오

로컬 추론은 개발자, 관리자, 애플리케이션 워크로드를 지원하면서 조직이 선택한 경계 내에서 추론 경로를 유지할 수 있습니다.

  • 코딩 지원: Windows 11의 Visual Studio Code와 같은 지원 개발 도구를 Windows Server의 기존 엔드포인트에 연결하여 코드 설명, 생성, 검토 또는 문제 해결을 수행합니다. 소스 코드와 프롬프트는 네트워크를 통해 해당 엔드포인트로 이동하므로, 네트워크 경로, 엔드포인트 및 그 운영자를 데이터 경계에 포함하세요.
  • 행정 지원: 관리자 도구를 명령어를 설명하거나 제안할 수 있는 모델에 연결하세요. 생성된 명령어를 실행하기 전에 복습하고 그 효과를 이해하세요, 특히 시스템 상태가 바뀔 때는 더욱 그렇습니다.
  • 문서 처리: 애플리케이션을 사용하여 문서를 요약, 분류, 추출 또는 로컬 모델로 색인화합니다. 애플리케이션은 문서 출처와 생성된 결과물에 대한 권한 부여를 계속 담당합니다.
  • 대화형 애플리케이션: 기존 애플리케이션에 채팅 또는 질문 답변 경험을 추가하세요. 애플리케이션은 모델 엔드포인트와 승인된 기업 데이터를 결합할 수 있지만, 모델과 독립적으로 접근 제어를 강제해야 합니다.

Windows Server에서 로컬 AI 추론의 다음 단계