Microsoft Discovery는 Foundry Agent Service를 기반으로 구축되었습니다. Microsoft Foundry 모델 카탈로그에서 사용할 수 있는 모든 모델은 검색 에이전트에 액세스할 수 있습니다. 공개 미리 보기 중에는 Discovery 에이전트에 대한 최상의 환경을 위해 OpenAI GPT-5.x 시리즈 모델을 사용합니다.
이 문서는 작업 복잡성, 출력 품질, 비용 및 응답 시간에 따라 에이전트에 적합한 모델을 선택하는 데 도움이 됩니다. 이 지침은 Microsoft 검색 및 검색 앱 모두에 적용되며, 타사 모델 엔드포인트용 검색 앱에서 더 많은 유연성을 제공합니다. (검색 앱은 GitHub Copilot 기반으로 빌드된 로컬 환경입니다.)
적용
| Offering | 모델 지침 | 추가 옵션 |
|---|---|---|
| Microsoft 검색 | 이 문서의 모든 지침이 적용됩니다. 모델을 작업 영역 수준 관리 리소스로 배포합니다. | 모델은 Foundry 모델 카탈로그에서 가져온 것입니다. |
| 검색 앱 | 동일한 모델 선택 원칙이 적용됩니다. | 타사 플랫폼의 BYOM(Bring-your-own-model) 엔드포인트를 지원합니다. |
사전 요구 사항
- 활성 Azure 구독.
- 하나 이상의 프로젝트가 있는 배포된 Microsoft 검색 작업 영역입니다. 설치 지침은 Microsoft 디스커버리 인프라 시작하기를 참조하세요.
- 작업 영역 수준에서 구성된 채팅 모델 배포입니다. 자세한 내용은 채팅 모델 배포 만들기를 참조하세요.
사용 가능한 GPT-5.x 모델 이해
다음 표에서는 공개 미리 보기 중에 검색 에이전트에 권장되는 OpenAI GPT-5.x 모델을 요약합니다.
| 모델 | 컨텍스트 창 | 강점 | 상대적 비용 | 응답 시간 |
|---|---|---|---|---|
| GPT-5.2 | 400,000개의 토큰 | 범용 추론, 도구 사용, 구조적 출력 | 중간 | 중간 |
| GPT-5.4 | 1,050,000개의 토큰 | 컨텍스트 요구 사항이 큰 프로덕션 등급 작업 | 중상급 | 중간 |
| GPT-5.5 | 1,050,000개의 토큰 | 향상된 정확도와 지시 수행 능력을 갖춘 최신 추론 기능 | 높음 | 중간 |
| GPT-5.2-Pro | 400,000개의 토큰 | 심층 추론, 복잡한 연구, 고급 코드 생성 | 높음 | 느림 |
| GPT-5.4-Pro | 1,050,000개의 토큰 | 확장된 컨텍스트를 사용하여 최대 추론 깊이 | 가장 높음 | 가장 느린 |
| GPT-5.2-Chat | 400,000개의 토큰 | 대화형 상호 작용, 질문 및 답변, 지침 | 중간-낮음 | 빠름 |
| GPT-5.4-Chat | 1,050,000개의 토큰 | 더 큰 컨텍스트와의 대화형 상호 작용 | 중간 | 빠름 |
| GPT-5-mini | 400,000개의 토큰 | 비용이 많이 드는 대량 워크로드 | 낮음 | 빠름 |
| GPT-5-nano | 400,000개의 토큰 | 초저비용, 지연 시간에 민감한 워크로드 | 가장 낮음 | 가장 빠름 |
사용 가능한 Grok 모델 이해
Grok 모델은 Foundry를 통해 사용할 수 있으며 생물학 및 생명 과학 연구 워크플로에 대한 대안을 제공합니다. GPT 모델에 비해 Grok 모델은 생물학-수직 쿼리에 대한 콘텐츠 제한이 적습니다. 이들은 GPT 안전 필터가 유용한 과학적 결과물을 제한할 수 있는 생물의학 문헌, 분자생물학, 유전체학 및 관련 분야에 대해 추론하는 에이전트에 더 적합합니다.
| 모델 | Strength | 상대적 비용 | 응답 시간 |
|---|---|---|---|
| Grok-4.20-reasoning | 복잡한 생물학 및 생명 과학 작업에 대한 생각의 사슬 추론 | 높음 | 느림 |
| Grok-4.20-non-reasoning | 연쇄 추론 오버헤드 없이 생물학 특화 에이전트를 위한 빠른 추론 | 중간 | 빠름 |
Grok 모델을 사용하는 경우
생물학 및 생명 과학 에이전트. 에이전트가 분자 구조, 약물 상호 작용, 유전 경로 또는 기타 생물학 관련 콘텐츠에 대한 쿼리를 처리할 때 Grok 모델을 사용합니다. GPT 모델은 응답을 거부하거나 과도하게 필터링할 수 있습니다.
Grok-4.20-reasoning. 생물학 도메인에서 다단계 과학적 추론, 가설 생성 또는 복잡한 분석을 수행하는 에이전트의 추론 변형을 선택합니다. 사고 체인 기능은 보다 철저하고 설명 가능한 출력을 생성합니다.
Grok-4.20-non-reasoning. 확장된 추론의 오버헤드 없이 생물학 중심 쿼리에 대한 빠른 응답이 필요한 처리량이 많은 에이전트에 대해 추론이 아닌 변형을 선택합니다.
비고
Grok 모델은 BYOM 배포로 지원됩니다. 모델을 대상 지역에서 사용할 수 있고 해당 할당량이 예약되어 있는지 확인합니다. Foundry 모델 카탈로그에서 현재 가용성을 확인합니다.
에이전트 사용 사례에 모델을 맞추기
에이전트 작업에 따라 요구 사항이 다릅니다. 다음 지침을 사용하여 프로젝트의 각 에이전트에 적합한 모델을 선택합니다.
연구 및 분석을 위한 프롬프트 에이전트
연구 에이전트는 문헌 검토, 데이터 분석, 요약 및 과학적 추론을 처리합니다. 이러한 작업에는 강력한 추론과 정확한 출력이 필요합니다.
권장 모델:
GPT-5.4(기본 권장 사항). 대부분의 연구 작업에 대해 1,050,000개의 큰 토큰 컨텍스트 창을 사용하여 강력한 추론을 제공합니다. 도구 실행, 구조적 출력 및 다단계 분석을 잘 처리합니다. 대부분의 프롬프트 에이전트는 여기에서 시작합니다.
GPT-5.5. GPT-5.x 제품군의 최신 모델이며, 추론 정확도가 향상되고 지침이 따릅니다. 복잡한 과학적 추론 작업에서 최첨단 성능이 필요한 에이전트의 경우 GPT-5.5를 선택합니다. 제한된 지역(
eastus2,,northcentralus,southcentraluswestus3,polandcentral및swedencentral)에서 사용할 수 있습니다.GPT-5.2. 확장 컨텍스트가 필요하지 않은 경우 비용 효율적인 대안입니다. GPT-5.4보다 저렴한 비용으로 신뢰할 수 있는 추론을 제공합니다.
GPT-5.2-Pro 또는 GPT-5.4-Pro. 심층 과학적 추론, 복잡한 가설 생성 또는 고급 코드 합성을 수행하는 에이전트에 Pro 변형을 사용합니다. Pro 모델은 요청당 더 많은 컴퓨팅을 할당하고 보다 철저한 출력을 생성합니다. 더 높은 비용과 느린 응답 시간을 기대합니다.
계획 및 라우팅을 위한 프롬프트 에이전트
계획 에이전트는 연구 계획을 생성하거나, 라우팅 결정을 내리거나, 다른 에이전트를 조정합니다. 이러한 작업에는 창의적인 추론보다는 일관되고 결정적인 동작이 필요합니다.
권장 모델:
GPT-5.4. 계획 및 라우팅을 안정적으로 처리합니다. 결정적 동작을 위해 온도를
0설정합니다.GPT-5.2-Chat. 심층적인 추론이 필요하지 않은 간단한 계획 작업에 대한 비용 효율적인 대안입니다. 채팅 모델은 더 빠르게 응답하고 토큰당 비용이 적게 듭니다.
GPT-5-mini. 에이전트가 고정된 옵션 집합에서 선택하는 간단한 라우팅 결정에 적합합니다. 간단한 분류 작업을 위한 비용 및 속도의 최상의 균형을 제공합니다.
도구 실행을 위해 에이전트를 프롬프트합니다.
도구 실행 에이전트는 검색 도구, 코드 인터프리터 또는 모델 컨텍스트 프로토콜 도구를 호출합니다. 신뢰할 수 있는 함수 호출 및 구조적 출력 생성이 필요합니다.
권장 모델:
GPT-5.4. 큰 컨텍스트 창을 사용하여 일관된 도구 호출 동작을 제공합니다. 함수 인수에 대해 구조화된 JSON을 안정적으로 생성하고 도구 응답을 정확하게 구문 분석하면서 여러 순차적 도구 호출을 지원합니다.
GPT-5.2. 도구 작업에 큰 입력 페이로드 또는 확장 컨텍스트가 포함되지 않는 경우 비용 효율적인 대안입니다.
사용자 상호 작용을 위한 프롬프트 에이전트
대화형 에이전트는 연구원과 질문 및 답변, 온보딩 또는 예비 대화를 처리합니다. 자연스러운 대화형 톤과 빠른 응답 시간을 활용합니다.
권장 모델:
GPT-5.2-Chat 또는 GPT-5.4-Chat. 대화형 상호 작용에 최적화되었습니다. 채팅 모델은 기본 대화에 비해 대기 시간 및 비용이 낮은 자연스럽고 응답성이 뛰어난 대화를 제공합니다.
GPT-5-mini. 비용 효율성이 중요한 경우 대용량 대화형 시나리오에 대한 강력한 선택입니다. 비용의 일부에 좋은 대화 품질을 제공합니다.
다중 에이전트 조율
다중 에이전트 오케스트레이션에 검색 엔진 을 사용하는 경우 엔진이 호출하는 각 프롬프트 에이전트는 자체 모델 배포를 사용합니다. 이전 섹션의 지침을 프로젝트의 각 프롬프트 에이전트에 적용합니다.
다중 에이전트 시나리오의 경우 에이전트 간에 모델을 혼합할 수 있습니다. 예를 들어 라우팅 에이전트에는 GPT-5-mini, 데이터 처리 에이전트의 경우 GPT-5.2, 합성 에이전트의 경우 GPT-5.2-Pro를 사용합니다. 이 방법은 중요한 경우 출력 품질을 희생하지 않고 비용을 최적화합니다.
품질, 비용 및 속도 간의 절충 평가
다음 의사 결정 매트릭스를 사용하여 모델 선택을 안내합니다.
| 우선순위 | 권장 모델 | 절충 |
|---|---|---|
| 최고 출력 품질 | GPT-5.4-Pro | 가장 느린 응답, 가장 높은 비용 |
| 최신 추론 기능 | GPT-5.5 | 제한된 지역 가용성 |
| 최상의 범용 잔액 | GPT-5.4 | 좋은 품질, 큰 컨텍스트, 적당한 비용 |
| 대규모 컨텍스트 요구 사항 | GPT-5.4 | 더 높은 비용, 최대 1,050,000개의 토큰 지원 |
| 생물학 및 생명 과학 | Grok-4.20-reasoning | 생물학 쿼리에 대한 콘텐츠 제한 감소; BYOM 배포 필요 |
| 빠른 생물학 유추 | Grok-4.20-non-reasoning | 콘텐츠 제한 감소; 생각의 사슬 추론 없음 |
| 빠른 대화형 응답 | GPT-5.2-Chat 또는 GPT-5.4-Chat | 추론 깊이 감소 |
| 비용 최적화 | GPT-5-mini | 저렴한 비용으로 좋은 품질 |
| 최저 비용 및 대기 시간 | GPT-5-nano | 출력 품질 감소, 간단한 작업에 가장 적합 |
비용 관리 팁
GPT-5.4부터 시작합니다. 검색 에이전트에 권장되는 기본값입니다. 특정 이유가 있는 경우에만 다른 모델로 이동합니다.
간단한 작업에는 더 작은 모델을 사용합니다. 라우팅, 분류 및 서식 지정 작업에는 Pro 수준 추론이 필요하지 않습니다. GPT-5-mini 또는 GPT-5-nano는 비용을 크게 줄입니다.
고부가가치 작업을 위해 Pro 모델을 예약합니다. 심층 연구 합성, 복잡한 가설 생성 및 고급 코드 분석은 더 높은 비용을 정당화합니다.
에이전트 간에 모델을 혼합합니다. 각 에이전트의 작업 복잡성에 따라 서로 다른 모델을 다른 에이전트에 할당합니다.
에이전트에 모델 배포를 구성하다
작업 영역 수준에서 모델 배포를 구성합니다. 프로젝트의 모든 에이전트는 이러한 배포를 공유합니다.
Azure CLI, Bicep 또는 Azure Resource Manager 템플릿을 사용하여 작업 영역 수준에서 Azure 관리되는 리소스로 모델을 배포합니다. 자세한 단계는 채팅 모델 배포 만들기 를 참조하세요.
Discovery Studio에서 프롬프트 에이전트를 만들거나 편집합니다.
채팅 모델에서 사용하려는 모델(예
my-gpt-52-deployment: )에 해당하는 배포 이름을 선택합니다.사용 사례에 따라 온도 및 상위 P 응답 컨트롤을 조정합니다.
- 계획 및 라우팅 에이전트를 위한 경우, 값으로
0를 설정하여 결정론적 출력을 얻습니다. - 연구 및 분석 에이전트에는 균형 잡힌 창의성과 정확도를 위해 부터
0.3사이의0.7를 사용하세요. - 예비 또는 브레인스토밍 에이전트의 경우 온도를
0.7와1.0사이로 설정합니다.
- 계획 및 라우팅 에이전트를 위한 경우, 값으로
에이전트를 저장하세요. 각 저장은 변경할 수 없는 새 버전을 만듭니다.
동일한 작업 영역에 여러 모델을 배포하고 다른 에이전트에 다른 배포를 할당할 수 있습니다. 리소스 ID가 아닌 이름으로 배포를 참조합니다.
검색 앱의 모델 선택
이 문서의 모델 선택 지침은 검색 앱에 동일하게 적용됩니다. 모델을 에이전트 사용 사례와 일치시키고, 품질, 비용 및 속도 간의 장단점을 평가하고, 응답 컨트롤을 구성하는 동일한 원칙이 유효합니다.
BYOM
검색 앱은 타사 모델 엔드포인트를 직접 연결할 수 있도록 하여 더 많은 유연성을 제공합니다. Foundry 모델 카탈로그의 모델 외에도 Discovery 앱은 다음을 지원합니다.
OpenAI 엔드포인트. 고유한 API 키를 사용하여 OpenAI API 엔드포인트(예: GPT-4o, GPT-5)에 직접 연결합니다.
Anthropic 엔드포인트. Anthropic Claude 모델에 직접 연결합니다.
기타 타사 플랫폼. 표준 API 규칙을 따르는 모든 모델 엔드포인트입니다.
이러한 유연성을 통해 다음을 수행할 수 있습니다.
Foundry 카탈로그에서 현재 사용할 수 없는 모델을 실험합니다.
다양한 모델 공급자의 성능을 비교합니다.
도메인별 작업에 특수 모델을 사용합니다.
Important
검색 앱에서 타사 모델 엔드포인트를 사용하는 경우 엔드포인트 보안, 데이터 처리 및 조직의 정책 준수를 담당합니다. Microsoft 검색 모델 지침은 프로덕션 및 팀 사용에 권장되는 기준선으로 유지됩니다.
검색 앱의 구성
검색 앱에서 타사 모델 엔드포인트를 구성하려면 다음을 수행합니다.
검색 앱 설정을 엽니다.
엔드포인트 URL 및 인증 자격 증명을 제공하여 새 모델 엔드포인트를 추가합니다.
사용자 지정 에이전트를 만들거나 편집할 때 구성된 엔드포인트를 참조합니다.
모델 공급자에 관계없이 동일한 온도, Top-P 및 기타 응답 제어 매개 변수가 적용됩니다.