AI 기능 요금

AI Functions는 기본 제공 Fabric 호스팅된 LLM(대규모 언어 모델) 엔드포인트를 사용하여 별도의 엔드포인트 설정 없이 데이터를 변환하고 보강합니다. 이 문서에서는 해당 기본 제공 엔드포인트에 대한 청구 미터, 소비율 및 사용량 모니터링 옵션을 설명합니다.

Important

이 문서는 기본 제공 Fabric LLM 엔드포인트를 사용하는 AI Functions에 적용됩니다. pandas와 PySpark의 경우, 맞춤형 Azure OpenAI, Microsoft Foundry, 또는 OpenAI 호환 엔드포인트를 통해 자체 모델을 가져올 수 있습니다. Fabric은 커스텀 엔드포인트에 모델 호출을 하는 데 비용을 청구하지 않습니다. LLM 제공자는 토큰 사용에 대해 요금을 부과하며, Fabric 컴퓨트 요금은 여전히 적용됩니다. 설치 세부 정보는 pandas를 사용하여 AI 함수 사용자 지정PySpark를 사용하여 AI 함수 사용자 지정을 참조하세요.

청구 계량기

기본 제공되는 Fabric LLM 엔드포인트를 통한 AI 함수 호출은 Copilot and AI 미터 기준으로 Fabric 용량에 청구됩니다. Microsoft Fabric 용량 메트릭 앱에서 사용량은 AI Functions 작업으로 나타납니다.

Usage 청구 미터 또는 작업
내장된 Fabric LLM 엔드포인트를 통한 모델 호출 COPILOT 및 AI 미터는 AI 함수로 보고됩니다.
맞춤형 엔드포인트를 통한 모델 호출 Fabric에서 모델 호출 수수료는 없습니다. LLM 제공업체는 토큰 사용량을 청구합니다.
Notebook 또는 Spark 작업을 실행하는 Spark 컴퓨팅 Spark 청구 계량기
변환을 실행하는 데이터 흐름 Gen2 컴퓨팅 데이터 흐름 Gen2 사용.
웨어하우스 또는 SQL 분석 엔드포인트 쿼리 컴퓨팅 Data Warehouse 또는 SQL 분석 엔드포인트 사용.

비용 및 지출 보기

용량 메트릭 앱을 사용하여 AI 함수 지출 및 용량 영향을 모니터링합니다.

  1. Microsoft Fabric 용량 메트릭 앱을 엽니다.
  2. AI Functions 워크로드를 실행한 용량, 작업 영역 및 시간 범위로 필터링합니다.
  3. 작업 수준 보기에서 AI 기능을(를) Copilot 및 AI 미터 아래에서 찾으세요.
  4. AI Functions 작업을 Spark, Dataflow Gen2 또는 웨어하우스 작업과 비교하여 워크로드를 오케스트레이션한 컴퓨팅과 모델 호출 소비를 구분합니다.

런타임 사용량 모니터링

개발 중에는 런타임 사용량 통계를 사용하여 파이프라인 크기를 조정하기 전에 사용량을 예측하고 유효성을 검사합니다.

pandas 및 PySpark 노트북에서 AI 함수 결과의 ai.stats에 액세스하여 다음을 포함한 실행 및 토큰 사용량 세부 정보를 확인합니다.

  • num_successful, num_exceptions, num_unevaluatednum_harmful.
  • cached_tokens, input_tokens, output_tokensreasoning_tokens.
  • client_type, input_typesmodel.
# This code uses AI. Always review output for mistakes.

df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)

출력은 다음 표와 같을 수 있습니다.

num_successful num_exceptions num_unevaluated num_harmful 캐시된_토큰 input_tokens output_tokens 추론 토큰 client_type input_types 모델
2 0 0 0 0 555 4 0 fabric_llm_endpoint {"text": 2} gpt-5-mini

pandas Notebook에서 함수가 실행되는 동안 실시간 토큰 및 용량 단위 추정치를 표시하도록 설정합니다 progress_bar_mode="stats" .

import synapse.ml.aifunc as aifunc

aifunc.default_conf.progress_bar_mode = "stats"

진행률 표시줄은 라이브 및 프로젝션된 캐시된 입력, 입력, 출력 및 용량 단위 예상치를 표시한 다음 작업이 완료되면 최종 값을 표시합니다. PySpark를 사용하여 진행률 표시줄 모드AI 함수 사용자 지정을 참조하세요.

소비율

달리 모델을 구성하지 않는 한, pandas 및 PySpark용 Python AI Functions는 기본적으로 gpt-5-mini를 사용하며, reasoning_effort은(는) low로 설정됩니다. 사용량은 토큰 사용량을 기반으로 합니다. 입력, 캐시된 입력 및 출력 토큰의 속도는 다를 수 있습니다.

언어 모델

모델 배포 이름 컨텍스트 창(토큰) 입력(1,000개 토큰당) 캐시된 입력(토큰 1,000개당) 출력(1,000개 토큰당)
gpt-5.1-2025-11-13 gpt-5.1 400,000
최대 출력: 128,000
42.02 CU 초 4.20 CU 초 336.13 CU 초
gpt-5-mini-2025-08-07 gpt-5-mini 400,000
최대 출력: 128,000
8.40 CU초 0.84 CU초 67.23 CU 초

임베딩 모델

모델 배포 이름 컨텍스트 창(토큰) 입력(1,000개 토큰당)
Ada text-embedding-ada-002 8,192 3.36 CU 초

소비율은 변경될 수 있습니다. 전체 소비율 목록과 소비율 변경 정책은 Fabric의 Foundry 도구에서 소비율을 참조하세요.

모델 마이그레이션 지침

보다 정교한 변환을 위해 gpt-5.1을 구성하거나 reasoning_effort을 조정하여 더 많은 연산 리소스를 사용해 더 높은 품질의 결과를 얻을 수 있습니다. 설치 세부 정보는 pandas를 사용하여 AI 함수 사용자 지정PySpark를 사용하여 AI 함수 사용자 지정을 참조하세요.