Important
- Foundry 로컬 CLI는 미리 보기로 제공됩니다. 공개 미리 보기 릴리스는 활성 배포 중인 기능에 대한 초기 access 제공합니다.
- GA(일반 공급) 전에는 기능, 방식 및 프로세스가 변경되거나 기능이 제한될 수 있습니다.
이 문서에서는 Foundry CLI(로컬 명령줄 인터페이스)에 대한 포괄적인 참조를 제공합니다. CLI는 모델을 관리하고, 로컬 서버를 제어하고, 로컬 캐시를 유지 관리하는 데 도움이 되도록 명령을 논리적 범주로 구성합니다.
사전 요구 사항
- Foundry Local을 설치합니다.
- CLI를
foundry사용할 수 있는 로컬 터미널입니다. - 최초 다운로드(실행 제공자 및 모델)를 위해 인터넷 연결이 있는지 확인하십시오.
- Azure RBAC: 해당 없음(로컬로 실행).
- Windows Intel NPU가 있는 경우 최적의 NPU 가속을 위해 인텔 NPU 드라이버 설치합니다.
Foundry 로컬 설치
운영 체제에 대한 패키지 관리자를 사용하여 Foundry Local을 설치합니다.
-
Windows: 터미널을 열고 다음을 실행합니다.
winget install Microsoft.FoundryLocal -
macOS: 터미널을 열고 다음을 실행합니다.
또는 foundry 샘플 GitHub 리포지토리에서 설치 관리자를 다운로드합니다.brew tap microsoft/foundrylocal brew install foundrylocal
설치를 확인합니다.
foundry --version
소프트웨어를 설치할 수 있는 관리자 권한이 있는지 확인합니다.
Tip
설치 후 서비스 연결 오류가 표시되면(예: Request to local service failed) 을 실행합니다 foundry server restart.
빠른 확인
다음 명령을 실행하여 CLI가 설치되고 서비스에 연결할 수 있는지 확인합니다.
CLI 도움말 표시:
foundry --help이 명령은 사용량 정보와 사용 가능한 명령 그룹 목록을 출력합니다.
참조: 개요
서버 상태를 확인합니다.
foundry 서버 상태 '''
이 명령은 Foundry 로컬 디먼이 실행 중인지 여부를 출력하고 로컬 엔드포인트를 포함합니다.
참조: 서버 명령
개요
기본 제공 도움말을 사용하여 명령 및 옵션을 탐색합니다.
CLI는 명령을 다음 그룹으로 구성합니다.
-
모델:
model,cache -
Run:
run,chat,completetranscribe -
서버:
server -
설치:
config -
도움말:
statusreport
다음 표에서는 최상위 명령을 요약합니다.
| Command | 설명 |
|---|---|
foundry model |
로컬 모델을 검색, 검사, 다운로드, 로드 및 언로드합니다. |
foundry chat <model> |
대화형 로컬 채팅 세션을 시작합니다. |
foundry complete <model> <prompt> |
하나의 상태 비주성 텍스트 완성을 생성합니다. |
foundry run <model> |
채팅 또는 전사에 대한 자동 라우팅을 사용하여 모델을 실행합니다. |
foundry server |
로컬 Foundry 디먼을 시작, 중지, 다시 시작, 검사 및 문제 해결합니다. |
foundry cache |
다운로드한 모델 캐시 항목을 검사하고 관리합니다. |
foundry config |
영구 Foundry CLI 설정을 보고 편집합니다. |
foundry status |
시스템, 서비스, 모델 및 연결 진단을 표시합니다. |
foundry report |
진단과 함께 미리 채워진 GitHub 문제를 엽니다. |
foundry transcribe |
대화형 로컬 음성 전사 세션을 시작하거나 파일을 전사합니다. |
모델 명령
다음 표에는 모델 관리 및 실행과 관련된 명령이 요약되어 있습니다.
메모
인수를 model별칭 또는 모델 ID로 지정할 수 있습니다. 별칭 사용:
- 사용 가능한 하드웨어에 가장 적합한 모델을 자동으로 선택합니다. 예를 들어 Nvidia GPU를 사용할 수 있는 경우 Foundry Local은 최상의 GPU 모델을 선택합니다. 지원되는 NPU를 사용할 수 있는 경우 Foundry Local은 NPU 모델을 선택합니다.
- 모델 ID를 기억할 필요 없이 더 짧은 이름을 사용할 수 있습니다.
특정 모델을 실행하려면 모델 ID를 사용합니다. 예를 들어 사용 가능한 하드웨어와 상관없이 qwen2.5-0.5b를 CPU에서 실행하려면 다음을 사용하십시오: foundry model run qwen2.5-0.5b-instruct-generic-cpu.
| Command | 설명 |
|---|---|
foundry model --help |
사용 가능한 모든 모델 관련 명령과 사용량을 표시합니다. |
foundry model run <model> |
지정된 모델을 실행하고, 캐시되지 않은 경우 다운로드하고, 상호 작용을 시작합니다. |
foundry model list |
로컬에서 사용할 수 있는 모든 모델을 나열합니다. 처음 실행 시 하드웨어에 대한 실행 공급자(EP)를 다운로드합니다. |
foundry model list --filter <key>=<value> |
지정된 조건(디바이스, 작업, 별칭, 공급자)으로 필터링된 모델을 나열합니다. |
foundry model info <model> |
특정 모델에 대한 자세한 정보를 표시합니다. |
foundry model info <model> --license |
특정 모델에 대한 라이선스 정보를 표시합니다. |
foundry model download <model> |
모델을 실행하지 않고 로컬 캐시에 다운로드합니다. |
foundry model load <model> |
모델을 서비스에 로드합니다. |
foundry model unload <model> |
서비스에서 모델을 언로드합니다. |
모델 목록 순서 지정
별칭에 대해 여러 모델 ID 변형을 사용할 수 있는 경우 모델 목록에 우선 순위가 지정된 모델이 표시됩니다. 목록의 첫 번째 모델은 모델을 지정하는 경우 실행되는 모델 alias입니다.
모델 목록 필터링
이 명령은 옵션을 foundry model list 사용하여 모델 필터링을 지원합니다 --filter . 키-값 쌍을 사용하여 단일 특성에 따라 모델을 필터링할 수 있습니다.
foundry model list --filter <key>=<value>
이 명령은 필터 키 및 값과 일치하는 모델을 출력합니다.
참조: 모델 목록 필터링
메모
설치 후 처음으로 실행 foundry model list 하면 Foundry Local은 컴퓨터의 하드웨어 구성에 대한 관련 실행 공급자(EP)를 자동으로 다운로드합니다. 모델 목록이 나타나기 전에 다운로드 완료를 나타내는 진행률 표시줄이 표시됩니다.
지원되는 필터 키:
디바이스 - 하드웨어 디바이스 유형
실행 중인 하드웨어 디바이스를 기준으로 모델을 필터링합니다.
가능한 값:
-
CPU- 중앙 처리 단위 모델 -
GPU- 그래픽 처리 단위 모델 -
NPU- 신경망 처리 단위 모델
공급자 - 실행 공급자
실행 공급자 또는 런타임별로 모델을 필터링합니다.
가능한 값:
-
CPUExecutionProvider- CPU 기반 실행 -
CUDAExecutionProvider- NVIDIA CUDA GPU 실행 -
WebGpuExecutionProvider- WebGPU 실행 -
QNNExecutionProvider- Qualcomm 신경망 실행(NPU) -
OpenVINOExecutionProvider- Intel OpenVINO 실행 -
NvTensorRTRTXExecutionProvider- NVIDIA TensorRT 실행 -
VitisAIExecutionProvider- AMD Vitis AI 실행
작업 - 모델 작업 유형
모델을 의도한 사용 사례 또는 작업으로 필터링합니다.
공통 값:
-
chat-completion: 대화형 AI 모델 -
text-generation: 텍스트 생성 모델
별칭 - 모델 별칭
별칭 식별자를 사용하여 모델을 필터링합니다.
* 접미사를 사용한 와일드카드 일치를 지원합니다.
샘플 값:
phi4-cpuqwen2.5-coder-0.5b-instruct-generic-cpudeepseek-r1-distill-qwen-1.5b-generic-cpuphi-4-mini-instruct-generic-cpu
특수 필터 기능
부정 지원: 일치하는 모델을 제외할 값을 접두사로 ! 지정합니다.
foundry model list --filter device=!GPU
이 명령은 결과에서 GPU 모델을 제외합니다.
참조: 특수 필터 기능
와일드카드 일치(별칭만 해당): 별칭으로 필터링할 때 접두사를 일치하도록 추가 * 합니다.
foundry model list --filter alias=qwen*
이 명령은 별칭이 .로 qwen시작하는 모델을 반환합니다.
참조: 특수 필터 기능
예제
foundry model list --filter device=GPU
foundry model list --filter task=chat-completion
foundry model list --filter provider=CUDAExecutionProvider
이러한 예제에서는 디바이스, 작업 및 실행 공급자별로 모델 목록을 필터링합니다.
참조: 모델 목록 필터링
메모
- 모든 비교는 대/소문자를 구분하지 않습니다.
- 명령당 하나의 필터만 사용할 수 있습니다.
- 인식할 수 없는 필터 키로 인해 오류가 발생합니다.
대화형으로 모델 실행
모델을 실행하고 터미널에서 직접 상호 작용합니다.
foundry model run qwen2.5-0.5b
Foundry Local은 처음 실행 시 모델을 다운로드한 다음 대화형 세션을 시작합니다. 응답을 받을 프롬프트를 입력합니다.
Why is the sky blue?
Tip
카탈로그의 모든 모델 별칭으로 바꿉 qwen2.5-0.5b 니다. 실행 foundry model list 하여 사용 가능한 모델을 봅니다. Foundry Local은 하드웨어와 가장 일치하는 변형(예: NVIDIA GPU용 CUDA 변형 또는 Qualcomm NPU용 NPU 변형)을 다운로드합니다.
서버 명령
다음 표에는 Foundry 로컬 서비스 관리 및 실행과 관련된 명령이 요약되어 있습니다.
| Command | 설명 |
|---|---|
foundry server --help |
사용 가능한 모든 서버 관련 명령과 사용량을 표시합니다. |
foundry server start |
Foundry 로컬 디먼 및 OpenAI 호환 로컬 서비스를 시작합니다. |
foundry server start --port <port> |
지정된 TCP 포트에서 로컬 서비스를 시작합니다. OS 할당 포트에 사용합니다 0 . |
foundry server start --idle-timeout <minutes> |
지정된 비활성 시간(분) 후에 디먼을 중지합니다. 디먼을 계속 실행하는 데 사용합니다 0 . |
foundry server stop |
Foundry 로컬 디먼을 중지합니다. |
foundry server restart |
Foundry 로컬 디먼 및 로컬 서비스를 다시 시작합니다. |
foundry server restart --port <port> --idle-timeout 0 |
지정된 TCP 포트에서 로컬 서비스를 다시 시작하고 디먼을 계속 실행합니다. |
foundry server status |
디먼 상태, 로컬 서비스 URL, 프로세스 ID, 가동 시간 및 로그 위치를 표시합니다. |
foundry server logs |
Foundry 로컬 디먼 및 SDK 로그를 표시합니다. |
고정 포트 로컬 서버
고정 포트에서 로컬 서비스를 시작하고 디먼을 계속 실행하려면 다음을 --idle-timeout 0사용합니다--port.
foundry server start --port 39839 --idle-timeout 0
디먼이 이미 실행 중이고 새 포트를 적용해야 하는 경우 동일한 옵션을 사용하여 다시 시작합니다.
foundry server restart --port 39839 --idle-timeout 0
로컬 엔드포인트 URL을 확인하려면 다음을 실행합니다.
foundry server status
캐시 명령
다음 표에는 모델이 저장되는 로컬 캐시를 관리하기 위한 명령이 요약되어 있습니다.
| Command | 설명 |
|---|---|
foundry cache --help |
사용 가능한 모든 캐시 관련 명령 및 해당 사용량을 표시합니다. |
foundry cache location |
현재 캐시 디렉터리를 표시합니다. |
foundry cache list |
로컬 캐시에 저장된 모든 모델을 나열합니다. |
foundry cache cd <path> |
캐시 디렉터리를 지정된 경로로 변경합니다. |
foundry cache remove <model> |
로컬 캐시에서 모델을 제거합니다. |
실행 공급자
실행 공급자는 디바이스에서 가능한 한 효율적으로 모델을 실행하는 하드웨어별 가속 라이브러리입니다.
기본 제공 실행 공급자
Foundry Local에는 CPU 실행 공급자, WebGPU 실행 공급자 및 CUDA 실행 공급자가 포함됩니다.
CPU 실행 공급자는 Microsoft MLAS(선형 대수 서브루틴) 를 사용하여 CPU에서 실행하며 Foundry Local의 CPU 대체입니다.
WebGPU 실행 공급자는 GPU의 가속을 위해 웹 기반 API의 네이티브 구현인 Dawn를 사용하며 Foundry Local의 GPU 대체입니다.
CUDA 실행 공급자는 NVIDIA GPU에서 가속을 위해 NVIDIA CUDA를 사용합니다. 최소 권장 드라이버 버전 32.0.15.5585 및 CUDA 버전 12.5를 사용하는 NVIDIA GeForce RTX 30 시리즈 이상이 필요합니다. NVIDIA 소프트웨어 개발 키트에 대한 사용권 계약(EULA)의 사용 조건의 적용을 받습니다.
플러그 인 실행 공급자
다음 표에 나열된 실행 공급자는 디바이스 및 드라이버 호환성에 따라 Windows 동적 다운로드 및 등록에 사용할 수 있습니다. 지정된 사용 조건의 적용을 받습니다.
Foundry Local은 처음 실행 시 이러한 실행 공급자를 자동으로 다운로드합니다. 플러그 인 실행 공급자는 새 버전을 사용할 수 있을 때 자동으로 업데이트됩니다.
| 이름(공급업체) | 요구 사항 | 사용 조건 |
|---|---|---|
NvTensorRTRTXExecutionProvider (엔비디아) |
최소 권장 드라이버 버전 32.0.15.5585 및 CUDA 버전 12.5를 사용하는 NVIDIA GeForce RTX 30XX 이상 버전 | NVIDIA 소프트웨어 개발 키트에 대한 사용권 계약 - EULA |
OpenVINOExecutionProvider (인텔) |
CPU: 최소 권장 드라이버 32.0.100.9565를 사용하는 Intel TigerLake(11세대) 이상 버전 GPU: 최소 권장 드라이버 32.0.101.1029를 사용하는 Intel AlderLake(12세대) 이상 버전 NPU: 최소 권장 드라이버 32.0.100.4239를 사용하는 Intel ArrowLake(15세대) 이상 버전 |
Intel OBL 배포 상용 사용권 계약 v2025.02.12 |
QNNExecutionProvider (퀄컴) |
Snapdragon(R) X Elite - X1Exxxxx - 최소 드라이버 버전 30.0.140.0 이상 버전의 Qualcomm(R) Hexagon(TM) NPU Snapdragon(R) X Plus - X1Pxxxxx - 최소 드라이버 버전 30.0.140.0 이상 버전의 Qualcomm(R) Hexagon(TM) NPU |
QNN 라이선스를 보려면 Qualcomm® 신경망 처리 SDK를 다운로드하고 ZIP을 추출한 다음 LICENSE.pdf 파일을 엽니다. |
VitisAIExecutionProvider (AMD) |
최소 요구 사항: Adrenalin Edition 25.6.3과 NPU 드라이버 32.00.0203.280 Max: NPU 드라이버 32.00.0203.297이 포함된 Adrenalin Edition 25.9.1 |
추가 라이선스가 필요하지 않습니다. |
로컬 서버에서 Open WebUI 사용
디바이스에서 완전히 실행되는 브라우저 기반 채팅 인터페이스를 위해 Open WebUI 를 Foundry Local에 연결합니다.
모델을 시작하고 터미널을 열어 둡니다.
foundry model run qwen2.5-0.5b로컬 엔드포인트 URL을 가져옵니다.
foundry 서버 상태
Copy the endpoint URL. Foundry Local assigns a dynamic port each time the service starts.
1. Install and launch [Open WebUI](https://github.com/open-webui/open-webui), then open `http://localhost:8080` in your browser.
1. Connect Open WebUI to Foundry Local:
1. Go to **Settings** > **Admin Settings** > **Connections** and enable **Direct Connections**.
1. Go to **Settings** > **Connections** > **Manage Direct Connections** and select **+**.
1. Set **URL** to `http://localhost:PORT/v1` (replace `PORT` with the port from step 2) and **Auth** to **None**.
1. Select **Save**.
1. Select a model from the dropdown and start chatting.
> [!TIP]
> If no models appear, run `foundry model run <model>` in a terminal and reload Open WebUI. If the connection fails, confirm the port with `foundry server status`.
## Upgrade Foundry Local
Run the command for your operating system to upgrade Foundry Local.
- **Windows**:
```bash
winget upgrade --id Microsoft.FoundryLocal
-
macOS:
brew upgrade foundrylocal
Foundry 로컬 제거
운영 체제에 대한 명령을 실행하여 Foundry Local을 제거합니다.
-
Windows:
winget uninstall Microsoft.FoundryLocal -
macOS:
brew rm foundrylocal brew untap microsoft/foundrylocal brew cleanup --scrub
Troubleshooting
서비스 연결 문제
다음과 같은 foundry model list명령을 실행할 때 이 오류가 표시되는 경우:
Exception: Request to local service failed.
Uri: http://127.0.0.1:0/foundry/list
The requested address is not valid in its context. (127.0.0.1:0)
Please check service status with 'foundry server status'.
서비스를 다시 시작합니다.
foundry server restart
이 명령은 포트 바인딩 문제로 인해 서버가 실행되지만 액세스할 수 없는 경우를 해결합니다.
자세한 문제 해결 지침은 모범 사례 및 문제 해결을 참조하세요.