Foundry 모델의 프로비전된 처리량은 무엇인가요?

현재 보기:새 Foundry 포털 버전 - 클래식 Foundry 포털의 버전으로 전환

프로비전된 처리량은 배포에 대한 전용 모델 처리량을 제공하는 Microsoft Foundry의 배포 유형입니다. 유추 용량이 고객 간에 공유되고 처리량이 수요에 따라 달라질 수 있는 표준 배포와 달리 프로비전된 배포는 요청이 수행되는지 여부에 관계없이 배포 사용에만 고정된 양의 처리 용량을 보유합니다.

이 문서에서는 프로비전된 처리량의 핵심 개념, 즉, 사용 시기, 용량 측정 및 청구 방법, 배포하기 전에 할당량 및 용량에 대해 알아야 할 사항을 소개합니다.

배포 범주 비교

표준 배포, 일괄 처리 배포, 우선 순위 처리 및 프로비전된 처리량은 Microsoft Foundry에서 모델을 배포하는 방법입니다. 적절한 선택은 대기 시간 요구 사항, 트래픽 패턴 및 비용 허용 오차에 따라 달라집니다.

배포 유형 청구서 발행 지연 시간 서비스 수준 계약(SLA) 워크로드 유형 및 요구 사항
표준 토큰당 지불 None 균형 잡힌 워크로드: 가변적이거나 예측할 수 없는 트래픽이 있는 개발, 테스트 및 프로덕션 환경
우선 순위 처리 토큰당 요금(우선순위 등급 요금) 모델당 정의된 대기 시간 대상 장기 약정 없이 일관된 짧은 대기 시간이 필요한 대기 시간에 민감한 프로덕션 워크로드
할당됨 시간당 PTU (또는 Azure 예약 사용 시) 모델당 정의된 대기 시간 대상 보장된 처리량 및 일관된 대기 시간이 필요한 중요 업무용 대규모 프로덕션 워크로드
Batch 토큰당 지불(할인된 일괄 처리 비율) None 대기 시간 요구 사항 없이 워크로드를 대량 처리합니다. 결과는 비동기적으로 반환됩니다.

프로비전된 처리량을 사용하는 경우

프로비전된 처리량은 애플리케이션에 다음이 있는 경우 적합한 선택입니다.

  • 예측 가능한 트래픽 패턴: 분당 요청과 토큰 볼륨을 합리적으로 추정할 수 있습니다.
  • 대기 시간에 민감한 요구 사항: 사용자 또는 다운스트림 시스템에는 일관되고 짧은 대기 시간 응답이 필요합니다.
  • 프로덕션 규모 볼륨: 토큰당 청구 비용이 많이 드는 높은 처리량 사용 사례입니다.
  • 실시간 또는 인터랙티브 시나리오: 응답 시간이 일정하지 않으면 사용자 경험이 저하되는 채팅 애플리케이션, 코파일럿 또는 에이전트

표준 배포는 개발, 테스트, 저용량 사용량 또는 매우 가변적인 트래픽에 더 적합하므로 배포 크기를 미리 조정하기가 어렵습니다.

프로비전된 처리량 단위

프로비전된 처리량 단위(PTU) 는 프로비전된 처리량에 대한 측정 단위입니다. PTU는 고정된 양의 모델 처리 용량을 나타냅니다. 프로비전된 배포를 만들 때 할당할 PTU 수를 지정합니다. Foundry는 해당 양의 컴퓨팅을 예약하고 배포를 위해 보유합니다.

PTU의 주요 특징:

  • 모델 독립적: 지원 되는 모든 모델을 배포하는 데 동일한 PTU 할당량을 사용할 수 있습니다. 특정 모델에 대한PTU는 구입하지 않습니다.
  • 지역별: PTU 할당량은 구독당, 지역별 및 배포 유형별로 부여됩니다. 미국 동부의 할당량은 서유럽으로 이월되지 않습니다.
  • 처리량은 모델에 따라 다릅니다. 지정된 수의PTU가 제공하는 TPM(분당 토큰)은 모델에 따라 달라집니다. 더 무거운 모델은 더 가벼운 모델과 동일한 TPM을 처리하려면 더 많은 PTU가 필요합니다. 모델별 PTU-TPM 비율은 모델별 처리량 매개 변수를 참조하세요.
  • 최소 배포 크기 적용: 각 모델에는 배포를 만드는 데 필요한 최소 PTU 수가 있습니다. 최소값은 모델에 따라 다르며 배포 매개 변수 및 모델별 처리량 값에 나열됩니다.

할당량 및 용량

PTU 할당량 및 용량은 관련이 있지만 배포를 만들 수 있는지 여부에 영향을 주는 고유한 개념입니다. 이 섹션에서는 각 할당량이 무엇인지, 추가 할당량을 요청하는 방법 및 해당 지역에서 용량을 사용할 수 있는지 여부를 확인하는 방법을 설명합니다.

PTU 할당량이란?

PTU 할당량은 구독당, 지역별 및 배포 유형별로 배포할 수 있는 최대 PTU 수입니다. 할당량은 Azure 적용되는 정책 제한이며 관련 비용이 없습니다. 할당량 범위는 제품 수준(전역 프로비전됨, 데이터 영역 프로비저닝됨 및 지역 프로비전은 별도의 할당량 풀임)과 지역 수준에서 범위가 지정됩니다(예: 미국 동부의 할당량은 서유럽에 적용되지 않음).

기본 할당량은 여러 지역의 적격 구독에 할당됩니다.

용량이란?

용량은 배포할 수 있는 모델 버전당 실제 CPU 양입니다. 용량은 배포 시 할당되며 배포의 수명 동안 유지됩니다.

중요합니다

PTU 할당량이 있다고 해서 용량을 사용할 수 있다고 보장하지는 않습니다. 지역의 용량이 요청된 PTU 수에 충분하지 않으면 배포가 실패합니다. 배포를 계획하거나 예약을 구매하기 전에 항상 용량 가용성을 확인 합니다.

용량은 유한하고 동적으로 변경되는 리소스이므로 다음을 수행합니다.

  • 용량 가용성은 모든 지역 및 모델의 고객 수요에 따라 하루 종일 변경됩니다.
  • 배포를 삭제하거나 축소하면 해당 배포에 할당된 용량이 해제되어 리전 풀로 반환됩니다. 나중에 배포를 다시 만들거나 스케일 업하는 경우 동일한 용량을 사용할 수 있다는 보장은 없습니다.

할당량을 가져오는 방법

전역, 데이터 영역 및 지역 프로비저닝된 할당량의 기본 크기는 여러 지역의 적격 구독에 할당됩니다. 할당량 요청 양식을 제출하여 더 많은 할당량 또는 용량을 요청할 수 있습니다. 양식은 할당량 페이지의 Foundry 포털에서도 사용할 수 있습니다.

승인은 할당량 가용성에 따라 며칠이 걸릴 수 있으며 요청이 승인되면 이메일 알림을 받습니다.

사용 가능한 용량을 확인하는 방법

실시간 용량 가용성을 확인하려면 다음을 수행합니다.

  • 배포를 만들려고 할 때 용량을 사용할 수 있는지를 알려주는 Foundry 포털 배포 환경을 사용하고 대상 지역에 충분한 용량이 없는 경우 사용 가능한 용량이 있는 대체 지역을 나열합니다.
  • 모델 용량 API를 사용하여 지정된 모델 및 지역에 대한 배포 가능한 최대 PTU 수를 프로그래밍 방식으로 쿼리합니다.

대상 지역에 사용 가능한 용량이 없는 경우:

  • 할당량 요청 양식을 제출하여 더 많은 할당량 또는 용량을 요청합니다.
  • 더 적은 수의PTU를 사용하여 배포해 보세요.
  • 용량 가용성이 하루 종일 동적으로 변경되면 나중에 다시 시도합니다.

프로비전된 배포를 만들고 용량 제약 조건을 처리하는 방법에 대한 단계별 지침은 프로비전된 배포 시작을 참조하세요.

PTU 크기 조정

프로비전된 배포를 만들기 전에 워크로드에 필요한 CPU 수를 예측합니다. 계산을 구동하는 세 가지 요인은 다음과 같습니다.

  • 요청 셰이프: RPM(분당 예상 요청), 평균 프롬프트 크기(입력 토큰) 및 평균 응답 크기(출력 토큰)입니다.
  • 출력 대 입력 비율: 출력 토큰에는 입력 토큰보다 더 많은 처리 용량이 필요합니다. 각 모델에는 하나의 출력 토큰이 용량 용도에 해당하는 입력 토큰 수를 나타내는 비율이 있습니다. GPT-4.1 이상 Azure OpenAI 모델의 경우 이 비율은 출력과 입력 토큰 간의 모델의 글로벌 표준 가격 책정 비율과 일치합니다. 이 비율에 대한 자세한 내용은 모델별 배포 매개 변수 및 처리량 값을 참조하세요.
  • 캐시 속도: 프롬프트 캐시에서 제공되는 입력 토큰의 비율입니다. 캐시된 토큰은 PTU 용량을 사용하지 않으므로 캐시 속도가 높을수록 필요한 PTU가 줄어듭니다.

크기 조정 계산에서는 이러한 요소를 사용하여 예상 토큰 볼륨을 정규 화된 단일 TPM 그림으로 변환한 다음, PTU 값당 모델의 입력 TPM 으로 나누어 필요한 PTU 수에 도달합니다.

수식 및 모델별 값을 사용하여 수동으로 크기를 조정하거나 Foundry 포털의 용량 계산기를 사용하여 단계별 예상을 수행할 수 있습니다.

수식, 작업된 예제 및 용량 계산기 참조를 포함한 전체 크기 조정 방법론은 워크로드에 대한 PTU 크기 조정을 참조하세요.

프로비전된 처리량 배포 유형

프로비전된 처리량은 세 가지 배포 유형으로 사용할 수 있습니다. 모두 배포된 후 전용 용량과 예측 가능한 대기 시간을 제공합니다. 차이점은 유추 트래픽이 처리되는 위치입니다.

배포 유형 sku-name CLI에서 데이터 라우팅 적합한 대상
글로벌 프로비전 GlobalProvisionedManaged 전역적으로 Azure 지역 간에 라우팅됨 가장 높은 가용성; 라우팅 지역이 제한되지 않는 경우
프로비전된 데이터 영역 DataZoneProvisionedManaged 지리적 영역(미국 또는 EU) 내에 머무른 경우 지역보다 가용성이 높은 영역 수준 데이터 상주
지역 프로비전 ProvisionedManaged 배포의 특정 Azure 지역에 유지 엄격한 단일 지역 데이터 상주 요구 사항

표준, 일괄 처리 및 프로비저닝된 모든 Foundry 배포 유형에 대한 전체 비교는 Microsoft Foundry 모델의 Deployment 형식 참조하세요.

지원되는 모델

각 모델이 지원하는 배포 유형 및 지역 가용성을 포함하여 프로비전된 처리량을 지원하는 Foundry 모델의 전체 목록은 Azure 직접 판매되는 Foundry 모델의 Region 가용성을 참조하세요.

스필오버(Spillover)

Spillover는 오버플로 요청을 동일한 Foundry 리소스의 해당 표준 배포로 자동으로 라우팅하여 프로비전된 배포의 트래픽 변동을 관리하기 위한 선택적 구성입니다. 프로비전된 배포가 완전히 활용되고 200이 아닌 응답(예: 429 CPU가 소진된 경우)을 반환하는 경우 스필오버는 해당 요청을 표준 배포로 리디렉션하여 트래픽 버스트 중 중단을 줄일 수 있도록 합니다.

프로비전된 처리량을 지원하는 Foundry 모델의 모든 Azure OpenAI도 분산을 지원합니다. 다른 공급자의 Foundry 모델(Azure DeepSeek, Meta Llama)은 현재 스필오버를 지원하지 않습니다.

배포의 모든 요청에 대해 스필오버를 구성하거나 요청 헤더를 사용하여 x-ms-spillover-deployment 요청별로 제어할 수 있습니다. 구성 단계는 프로비전된 배포에 대한 분산을 사용하여 트래픽 관리를 참조하세요.

매시간 청구 및 Azure 예약

프로비저닝된 배포는 두 가지 청구 모드를 지원합니다. 즉, 유연한 단기 사용을 위한 시간당 청구와 할인 요금이 적용되는 지속적인 프로덕션 워크로드를 위한 Azure 예약입니다.

시간별 청구

프로비전된 모든 배포 유형은 사용된 토큰 수에 관계없이 배포된 PTU 수에 따라 시간당 요금($/PTU/hr)으로 청구됩니다. 측정기는 배포를 만들 때 시작되고 삭제될 때 중지됩니다.

시간당 청구는 새 모델을 벤치마킹하거나 해커톤과 같은 이벤트에 대해 일시적으로 확장하는 것과 같은 단기 시나리오에 실용적입니다. 그러나 다음과 같은 이유로 시간당 요금 체계를 유지하려고 트래픽에 따라 프로비저닝된 배포를 확장하거나 축소할 계획을 세우지 마세요.

  • 백업을 강화해야 하는 경우 용량을 사용할 수 없을 수 있습니다.

  • 높은 사용률의 지속적인 시간당 청구는 일반적으로 예약 가격을 초과합니다.

시간별 청구 및 프로비전된 배포 크기 조정에 대한 전체 지침은 시간별 청구를 참조하세요.

Azure 예약 서비스

Azure 예약은 개별 배포에는 적용되지 않고 PTU 청구 미터(Azure가 요금을 부과하는 시간당 사용량 카운터)에 적용되는 금전적 할인입니다. 1개월 또는 1년 약정에 대한 대가로 할인된 유효 $/PTU/시간 요금을 받게 됩니다. 예약에 대해 유의해야 할 몇 가지 주요 사항은 다음과 같습니다.

  • 예약은 배포 유형(전역, 데이터 영역 또는 지역)당 구매되며 하나 이상의 구독 또는 리소스 그룹을 포함하도록 범위를 지정할 수 있습니다.

  • 예약 및 배포는 느슨하게 결합되므로 배포 및 예약을 독립적으로 만듭니다.

  • 예약은 용량을 보장하지 않습니다. 먼저 배포를 생성하여 용량이 사용 가능한지 확인한 다음, 예약을 구매해 할인 요금을 확정합니다.

예약 크기 조정, 구매 및 관리에 대한 전체 지침은 프로비전된 처리량에 대한 Azure 예약 참조하세요.

PTU 비용 및 청구를 추적하는 방법

Microsoft Cost Management 사용하여 PTU 사용량 및 예약 비용을 추적하고 분석합니다.

수행하려는 내용 조항
전체 배포에서 예약된 PTU 중 실제로 사용 중인 비율을 확인하세요. Azure 예약 사용률 보기
구매 내역 및 환불 활동 검토 Azure 예약 구매 및 환불 거래 보기
예약의 상각 비용이 미치는 영향을 이해하여 배포별 청구 내역을 더 명확하게 파악하세요 분할 상환 혜택 비용 보기
내부 비용 귀속을 위해 예약 비용을 팀 또는 프로젝트별로 분산합니다. Azure 예약 비용 다시 청구
예약 만료를 방지하고 할인된 요금을 유지하도록 자동 갱신 설정 자동적으로 Azure 예약을 갱신합니다