Microsoft 검색에서 에이전트에 대한 모델 선택

Microsoft Discovery는 Foundry Agent Service를 기반으로 구축되었습니다. Microsoft Foundry 모델 카탈로그에서 사용할 수 있는 모든 모델은 검색 에이전트에 액세스할 수 있습니다. 공개 미리 보기 중에는 Discovery 에이전트에 대한 최상의 환경을 위해 OpenAI GPT-5.x 시리즈 모델을 사용합니다.

이 문서는 작업 복잡성, 출력 품질, 비용 및 응답 시간에 따라 에이전트에 적합한 모델을 선택하는 데 도움이 됩니다. 이 지침은 Microsoft 검색 및 검색 앱 모두에 적용되며, 타사 모델 엔드포인트용 검색 앱에서 더 많은 유연성을 제공합니다. (검색 앱은 GitHub Copilot 기반으로 빌드된 로컬 환경입니다.)

적용

Offering 모델 지침 추가 옵션
Microsoft 검색 이 문서의 모든 지침이 적용됩니다. 모델을 작업 영역 수준 관리 리소스로 배포합니다. 모델은 Foundry 모델 카탈로그에서 가져온 것입니다.
검색 앱 동일한 모델 선택 원칙이 적용됩니다. 타사 플랫폼의 BYOM(Bring-your-own-model) 엔드포인트를 지원합니다.

사전 요구 사항

사용 가능한 GPT-5.x 모델 이해

다음 표에서는 공개 미리 보기 중에 검색 에이전트에 권장되는 OpenAI GPT-5.x 모델을 요약합니다.

모델 컨텍스트 창 강점 상대적 비용 응답 시간
GPT-5.2 400,000개의 토큰 범용 추론, 도구 사용, 구조적 출력 중간 중간
GPT-5.4 1,050,000개의 토큰 컨텍스트 요구 사항이 큰 프로덕션 등급 작업 중상급 중간
GPT-5.5 1,050,000개의 토큰 향상된 정확도와 지시 수행 능력을 갖춘 최신 추론 기능 높음 중간
GPT-5.2-Pro 400,000개의 토큰 심층 추론, 복잡한 연구, 고급 코드 생성 높음 느림
GPT-5.4-Pro 1,050,000개의 토큰 확장된 컨텍스트를 사용하여 최대 추론 깊이 가장 높음 가장 느린
GPT-5.2-Chat 400,000개의 토큰 대화형 상호 작용, 질문 및 답변, 지침 중간-낮음 빠름
GPT-5.4-Chat 1,050,000개의 토큰 더 큰 컨텍스트와의 대화형 상호 작용 중간 빠름
GPT-5-mini 400,000개의 토큰 비용이 많이 드는 대량 워크로드 낮음 빠름
GPT-5-nano 400,000개의 토큰 초저비용, 지연 시간에 민감한 워크로드 가장 낮음 가장 빠름

사용 가능한 Grok 모델 이해

Grok 모델은 Foundry를 통해 사용할 수 있으며 생물학 및 생명 과학 연구 워크플로에 대한 대안을 제공합니다. GPT 모델에 비해 Grok 모델은 생물학-수직 쿼리에 대한 콘텐츠 제한이 적습니다. 이들은 GPT 안전 필터가 유용한 과학적 결과물을 제한할 수 있는 생물의학 문헌, 분자생물학, 유전체학 및 관련 분야에 대해 추론하는 에이전트에 더 적합합니다.

모델 Strength 상대적 비용 응답 시간
Grok-4.20-reasoning 복잡한 생물학 및 생명 과학 작업에 대한 생각의 사슬 추론 높음 느림
Grok-4.20-non-reasoning 연쇄 추론 오버헤드 없이 생물학 특화 에이전트를 위한 빠른 추론 중간 빠름

Grok 모델을 사용하는 경우

  • 생물학 및 생명 과학 에이전트. 에이전트가 분자 구조, 약물 상호 작용, 유전 경로 또는 기타 생물학 관련 콘텐츠에 대한 쿼리를 처리할 때 Grok 모델을 사용합니다. GPT 모델은 응답을 거부하거나 과도하게 필터링할 수 있습니다.

  • Grok-4.20-reasoning. 생물학 도메인에서 다단계 과학적 추론, 가설 생성 또는 복잡한 분석을 수행하는 에이전트의 추론 변형을 선택합니다. 사고 체인 기능은 보다 철저하고 설명 가능한 출력을 생성합니다.

  • Grok-4.20-non-reasoning. 확장된 추론의 오버헤드 없이 생물학 중심 쿼리에 대한 빠른 응답이 필요한 처리량이 많은 에이전트에 대해 추론이 아닌 변형을 선택합니다.

비고

Grok 모델은 BYOM 배포로 지원됩니다. 모델을 대상 지역에서 사용할 수 있고 해당 할당량이 예약되어 있는지 확인합니다. Foundry 모델 카탈로그에서 현재 가용성을 확인합니다.

에이전트 사용 사례에 모델을 맞추기

에이전트 작업에 따라 요구 사항이 다릅니다. 다음 지침을 사용하여 프로젝트의 각 에이전트에 적합한 모델을 선택합니다.

연구 및 분석을 위한 프롬프트 에이전트

연구 에이전트는 문헌 검토, 데이터 분석, 요약 및 과학적 추론을 처리합니다. 이러한 작업에는 강력한 추론과 정확한 출력이 필요합니다.

권장 모델:

  • GPT-5.4(기본 권장 사항). 대부분의 연구 작업에 대해 1,050,000개의 큰 토큰 컨텍스트 창을 사용하여 강력한 추론을 제공합니다. 도구 실행, 구조적 출력 및 다단계 분석을 잘 처리합니다. 대부분의 프롬프트 에이전트는 여기에서 시작합니다.

  • GPT-5.5. GPT-5.x 제품군의 최신 모델이며, 추론 정확도가 향상되고 지침이 따릅니다. 복잡한 과학적 추론 작업에서 최첨단 성능이 필요한 에이전트의 경우 GPT-5.5를 선택합니다. 제한된 지역(eastus2,, northcentralus,southcentraluswestus3, polandcentralswedencentral)에서 사용할 수 있습니다.

  • GPT-5.2. 확장 컨텍스트가 필요하지 않은 경우 비용 효율적인 대안입니다. GPT-5.4보다 저렴한 비용으로 신뢰할 수 있는 추론을 제공합니다.

  • GPT-5.2-Pro 또는 GPT-5.4-Pro. 심층 과학적 추론, 복잡한 가설 생성 또는 고급 코드 합성을 수행하는 에이전트에 Pro 변형을 사용합니다. Pro 모델은 요청당 더 많은 컴퓨팅을 할당하고 보다 철저한 출력을 생성합니다. 더 높은 비용과 느린 응답 시간을 기대합니다.

계획 및 라우팅을 위한 프롬프트 에이전트

계획 에이전트는 연구 계획을 생성하거나, 라우팅 결정을 내리거나, 다른 에이전트를 조정합니다. 이러한 작업에는 창의적인 추론보다는 일관되고 결정적인 동작이 필요합니다.

권장 모델:

  • GPT-5.4. 계획 및 라우팅을 안정적으로 처리합니다. 결정적 동작을 위해 온도를 0 설정합니다.

  • GPT-5.2-Chat. 심층적인 추론이 필요하지 않은 간단한 계획 작업에 대한 비용 효율적인 대안입니다. 채팅 모델은 더 빠르게 응답하고 토큰당 비용이 적게 듭니다.

  • GPT-5-mini. 에이전트가 고정된 옵션 집합에서 선택하는 간단한 라우팅 결정에 적합합니다. 간단한 분류 작업을 위한 비용 및 속도의 최상의 균형을 제공합니다.

도구 실행을 위해 에이전트를 프롬프트합니다.

도구 실행 에이전트는 검색 도구, 코드 인터프리터 또는 모델 컨텍스트 프로토콜 도구를 호출합니다. 신뢰할 수 있는 함수 호출 및 구조적 출력 생성이 필요합니다.

권장 모델:

  • GPT-5.4. 큰 컨텍스트 창을 사용하여 일관된 도구 호출 동작을 제공합니다. 함수 인수에 대해 구조화된 JSON을 안정적으로 생성하고 도구 응답을 정확하게 구문 분석하면서 여러 순차적 도구 호출을 지원합니다.

  • GPT-5.2. 도구 작업에 큰 입력 페이로드 또는 확장 컨텍스트가 포함되지 않는 경우 비용 효율적인 대안입니다.

사용자 상호 작용을 위한 프롬프트 에이전트

대화형 에이전트는 연구원과 질문 및 답변, 온보딩 또는 예비 대화를 처리합니다. 자연스러운 대화형 톤과 빠른 응답 시간을 활용합니다.

권장 모델:

  • GPT-5.2-Chat 또는 GPT-5.4-Chat. 대화형 상호 작용에 최적화되었습니다. 채팅 모델은 기본 대화에 비해 대기 시간 및 비용이 낮은 자연스럽고 응답성이 뛰어난 대화를 제공합니다.

  • GPT-5-mini. 비용 효율성이 중요한 경우 대용량 대화형 시나리오에 대한 강력한 선택입니다. 비용의 일부에 좋은 대화 품질을 제공합니다.

다중 에이전트 조율

다중 에이전트 오케스트레이션에 검색 엔진 을 사용하는 경우 엔진이 호출하는 각 프롬프트 에이전트는 자체 모델 배포를 사용합니다. 이전 섹션의 지침을 프로젝트의 각 프롬프트 에이전트에 적용합니다.

다중 에이전트 시나리오의 경우 에이전트 간에 모델을 혼합할 수 있습니다. 예를 들어 라우팅 에이전트에는 GPT-5-mini, 데이터 처리 에이전트의 경우 GPT-5.2, 합성 에이전트의 경우 GPT-5.2-Pro를 사용합니다. 이 방법은 중요한 경우 출력 품질을 희생하지 않고 비용을 최적화합니다.

품질, 비용 및 속도 간의 절충 평가

다음 의사 결정 매트릭스를 사용하여 모델 선택을 안내합니다.

우선순위 권장 모델 절충
최고 출력 품질 GPT-5.4-Pro 가장 느린 응답, 가장 높은 비용
최신 추론 기능 GPT-5.5 제한된 지역 가용성
최상의 범용 잔액 GPT-5.4 좋은 품질, 큰 컨텍스트, 적당한 비용
대규모 컨텍스트 요구 사항 GPT-5.4 더 높은 비용, 최대 1,050,000개의 토큰 지원
생물학 및 생명 과학 Grok-4.20-reasoning 생물학 쿼리에 대한 콘텐츠 제한 감소; BYOM 배포 필요
빠른 생물학 유추 Grok-4.20-non-reasoning 콘텐츠 제한 감소; 생각의 사슬 추론 없음
빠른 대화형 응답 GPT-5.2-Chat 또는 GPT-5.4-Chat 추론 깊이 감소
비용 최적화 GPT-5-mini 저렴한 비용으로 좋은 품질
최저 비용 및 대기 시간 GPT-5-nano 출력 품질 감소, 간단한 작업에 가장 적합

비용 관리 팁

  • GPT-5.4부터 시작합니다. 검색 에이전트에 권장되는 기본값입니다. 특정 이유가 있는 경우에만 다른 모델로 이동합니다.

  • 간단한 작업에는 더 작은 모델을 사용합니다. 라우팅, 분류 및 서식 지정 작업에는 Pro 수준 추론이 필요하지 않습니다. GPT-5-mini 또는 GPT-5-nano는 비용을 크게 줄입니다.

  • 고부가가치 작업을 위해 Pro 모델을 예약합니다. 심층 연구 합성, 복잡한 가설 생성 및 고급 코드 분석은 더 높은 비용을 정당화합니다.

  • 에이전트 간에 모델을 혼합합니다. 각 에이전트의 작업 복잡성에 따라 서로 다른 모델을 다른 에이전트에 할당합니다.

에이전트에 모델 배포를 구성하다

작업 영역 수준에서 모델 배포를 구성합니다. 프로젝트의 모든 에이전트는 이러한 배포를 공유합니다.

  1. Azure CLI, Bicep 또는 Azure Resource Manager 템플릿을 사용하여 작업 영역 수준에서 Azure 관리되는 리소스로 모델을 배포합니다. 자세한 단계는 채팅 모델 배포 만들기 를 참조하세요.

  2. Discovery Studio에서 프롬프트 에이전트를 만들거나 편집합니다.

  3. 채팅 모델에서 사용하려는 모델(예my-gpt-52-deployment: )에 해당하는 배포 이름을 선택합니다.

  4. 사용 사례에 따라 온도상위 P 응답 컨트롤을 조정합니다.

    • 계획 및 라우팅 에이전트를 위한 경우, 값으로 0를 설정하여 결정론적 출력을 얻습니다.
    • 연구 및 분석 에이전트에는 균형 잡힌 창의성과 정확도를 위해 부터 0.3 사이의 0.7 를 사용하세요.
    • 예비 또는 브레인스토밍 에이전트의 경우 온도0.71.0 사이로 설정합니다.
  5. 에이전트를 저장하세요. 각 저장은 변경할 수 없는 새 버전을 만듭니다.

동일한 작업 영역에 여러 모델을 배포하고 다른 에이전트에 다른 배포를 할당할 수 있습니다. 리소스 ID가 아닌 이름으로 배포를 참조합니다.

검색 앱의 모델 선택

이 문서의 모델 선택 지침은 검색 앱에 동일하게 적용됩니다. 모델을 에이전트 사용 사례와 일치시키고, 품질, 비용 및 속도 간의 장단점을 평가하고, 응답 컨트롤을 구성하는 동일한 원칙이 유효합니다.

BYOM

검색 앱은 타사 모델 엔드포인트를 직접 연결할 수 있도록 하여 더 많은 유연성을 제공합니다. Foundry 모델 카탈로그의 모델 외에도 Discovery 앱은 다음을 지원합니다.

  • OpenAI 엔드포인트. 고유한 API 키를 사용하여 OpenAI API 엔드포인트(예: GPT-4o, GPT-5)에 직접 연결합니다.

  • Anthropic 엔드포인트. Anthropic Claude 모델에 직접 연결합니다.

  • 기타 타사 플랫폼. 표준 API 규칙을 따르는 모든 모델 엔드포인트입니다.

이러한 유연성을 통해 다음을 수행할 수 있습니다.

  • Foundry 카탈로그에서 현재 사용할 수 없는 모델을 실험합니다.

  • 다양한 모델 공급자의 성능을 비교합니다.

  • 도메인별 작업에 특수 모델을 사용합니다.

Important

검색 앱에서 타사 모델 엔드포인트를 사용하는 경우 엔드포인트 보안, 데이터 처리 및 조직의 정책 준수를 담당합니다. Microsoft 검색 모델 지침은 프로덕션 및 팀 사용에 권장되는 기준선으로 유지됩니다.

검색 앱의 구성

검색 앱에서 타사 모델 엔드포인트를 구성하려면 다음을 수행합니다.

  1. 검색 앱 설정을 엽니다.

  2. 엔드포인트 URL 및 인증 자격 증명을 제공하여 새 모델 엔드포인트를 추가합니다.

  3. 사용자 지정 에이전트를 만들거나 편집할 때 구성된 엔드포인트를 참조합니다.

모델 공급자에 관계없이 동일한 온도, Top-P 및 기타 응답 제어 매개 변수가 적용됩니다.