AI 기능은 Azure Databricks에 저장된 데이터에 LLM이나 최첨단 연구 기법을 적용하여 데이터 변환과 분석을 수행하는 데 사용할 수 있는 내장 기능입니다. Databricks SQL, Notebook, Lakeflow 파이프라인 및 워크플로에서 실행할 수 있습니다.
AI 함수는 사용하기 쉽고 빠르며 확장 가능합니다. 분석가는 이를 사용하여 독점 데이터에 데이터 인텔리전스를 적용할 수 있으며, 데이터 엔지니어, 데이터 과학자 및 기계 학습 엔지니어는 이를 사용하여 프로덕션 등급 일괄 처리 파이프라인을 빌드할 수 있습니다.
AI 함수를 호출할 때, 쿼리는 SQL 웨어하우스, 노트북, 클러스터, 파이프라인 등 제출한 컴퓨팅에서 실행됩니다. 함수에 따라 모델 추론은 별도의 Databricks 관리 인프라에서 실행될 수 있으며, 이 인프라는 해당 계산 외에 청구됩니다. AI 기능 작업 부하에 대한 비용 보기를 참조하세요.
요구 사항
- AI 기능은 클래식 SQL 웨어하우스에서는 제공되지 않습니다.
- Databricks 런타임 15.4 LTS 이상이 필요합니다. 최고의 성능과 최신 기능 접근을 위해 Databricks Runtime 18.2 이상이 권장됩니다.
작업별 및 범용用途
AI Functions에는 작업별 및 범용 함수가 있습니다.
- 작업별 AI 함수 - 문서 구문 분석, 엔터티 추출, 분류 및 감정 분석과 같은 특정 작업에 최적화된 용도로 작성된 함수입니다. 이러한 함수는 Azure Databricks 관리되는 리서치 백 시스템에 의해 구동됩니다. 일부 함수에는 UI 환경이 포함됩니다. 지원되는 함수 및 모델에 대한 작업별 AI 함수 참조하세요.
-
ai_query- 작업 및 모델 유연성을 위한 범용 함수입니다. 프롬프트를 제공하고 지원되는 모든 Foundation Model API를 선택합니다. 사용ai_query을 참조하세요.
조직에서 액세스할 수 있는 작업별 AI 함수를 제한하려면 AI Functions Unity 카탈로그 권한을 참조하세요.
작업별 AI 함수
작업별 함수는 엔터티 추출, 변환 및 분류와 같은 일상적인 변환을 자동화할 수 있도록 특정 작업에 대해 범위가 지정됩니다. Databricks는 시작할 때, Databricks가 유지 관리하는 첨단 연구 기술을 사용하는 이러한 함수를 추천하며, 사용자 지정이 필요하지 않습니다.
예제는 AI Functions 사용하여 고객 리뷰 분석을 참조하세요.
다음 함수는 작업별로 그룹화됩니다.
| 기능 | 설명 |
|---|---|
| ai_parse_document | 최신 연구 기법을 사용하여 구조화된 콘텐츠(텍스트, 표, 그림 설명) 및 구조화되지 않은 문서의 레이아웃을 구문 분석합니다. |
| ai_extract | 정의한 스키마를 사용하여 문서 또는 텍스트에서 구조화된 필드를 추출합니다. |
| ai_classify | 최신 연구 기법을 사용하여 제공하는 레이블에 따라 입력 텍스트를 분류합니다. |
| ai_prep_search (베타) | 파싱된 문서나 일반 텍스트, 마크다운을 AI 검색 및 RAG 파이프라인에 최적화된 검색 가능한 청크로 변환할 수 있습니다. |
| ai_search (베타) | 하나 이상의 지식 소스를 대상으로 하는 자연어 질의에 대해 순위가 매겨지고 중복이 제거된 문서와 근거 기반 답변을 검색합니다. |
| ai_enrich (베타) | 정의한 스키마에서 각 행마다 새로운 열을 생성하세요. 선택적으로 AI 검색 인덱스나 웹 검색에 기반을 두고 사용할 수 있습니다. |
텍스트 변환:
| 기능 | 설명 |
|---|---|
| ai_문법_수정 | 최첨단 AI 모델을 사용해 텍스트 내 문법 오류를 수정합니다. |
| ai_translate | 최첨단 AI 모델을 사용해 텍스트를 지정된 대상 언어로 번역합니다. |
| ai_summarize | SQL과 최첨단 AI 모델을 사용해 텍스트 요약을 생성하세요. |
| ai_mask | 최첨단 AI 모델을 사용해 텍스트 내에서 지정된 엔터티를 마스크합니다. |
텍스트 분석:
| 기능 | 설명 |
|---|---|
| AI 감성 분석 | 최첨단 AI 모델을 사용해 입력된 텍스트에 대한 감정 분석을 수행합니다. |
| ai_similarity | 두 문자열을 비교하고 최첨단 AI 모델을 사용해 의미 유사도 점수를 계산합니다. |
콘텐츠를 생성합니다. 사용자 지정 프롬프트나 특정 모델에 대해서는 사용 ai_query을 참조하세요.
| 기능 | 설명 |
|---|---|
| ai_gen | 최첨단 AI 모델을 사용해 사용자가 제공한 질문에 응답하세요. |
예측 시계열:
| 기능 | 설명 |
|---|---|
| ai_forecast | 지정된 수평선까지 데이터를 예측합니다. 이 테이블 반환 함수는 시계열 데이터를 미래로 추정하도록 설계되었습니다. |
메트릭 변경 내용 분석:
| 기능 | 설명 |
|---|---|
| ai_top_drivers (베타) | 컨트롤 그룹과 테스트 그룹 간의 메트릭 변경에 가장 큰 영향을 주는 차원 값의 순위를 지정합니다. |
AI Search 임베딩을 사용하여 검색:
| 기능 | 설명 |
|---|---|
| vector_search | 최첨단 AI 모델을 사용해 AI 검색 인덱스를 검색하고 조회할 수 있습니다. |
프로덕션 워크플로에서 AI Functions 사용
대규모 일괄 처리 유추의 경우 작업별 AI Functions 또는 범용 함수 ai_query 를 Lakeflow 파이프라인, Databricks 워크플로 및 구조적 스트리밍과 같은 프로덕션 워크플로에 통합할 수 있습니다. 이를 통해 프로덕션 등급 처리를 대규모로 수행할 수 있습니다.
프로덕션 환경에서 AI 함수에 대한 모범 사례:
AI Functions에서 워크로드를 대규모로 처리할 수 있도록 합니다 . AI Functions는 병렬 처리, 재시도 및 크기 조정을 자동으로 관리합니다. 전체 데이터 세트를 작은 일괄 처리로 수동으로 분할하는 대신 단일 쿼리로 제출하는 것이 좋습니다. 성능은 매우 작은 워크로드에서 대규모 워크로드로 선형적으로 확장되지 않을 수 있습니다.
Databricks 호스팅 기본 모델을 사용합니다 . ai_query AI 함수를 사용하는 경우 프로비전된 처리량이 아닌 Databricks 호스팅 기본 모델(databricks-접두사)을 사용합니다. 이러한 프로비저닝 없는 엔드포인트는 완전히 관리되며 일괄 처리에 가장 적합합니다.
예제 및 세부 정보는 일괄 처리 유추 파이프라인 배포 를 참조하세요.
AI 함수 진행률 모니터링
완료 또는 실패한 유추 수를 파악하고 성능 문제를 해결하려면 쿼리 프로필 기능을 사용하여 AI Functions의 진행률을 모니터링할 수 있습니다.
Databricks Runtime 16.1 ML 이상의 작업 영역의 SQL 편집기 쿼리 창에서 다음을 수행합니다.
- 원시 결과 창 아래쪽에서 실행--- 링크를 선택합니다. 성능 창이 오른쪽에 나타납니다.
- 쿼리 프로필을 클릭하여 성능 세부 정보를 확인합니다.
- AI 쿼리 클릭하여 완료 및 실패한 유추 수와 요청이 완료되는 데 걸린 총 시간을 포함하여 특정 쿼리에 대한 메트릭을 확인합니다.
AI 함수 워크로드에 대한 비용 보기
쿼리를 실행하는 컴퓨트는 항상 청구됩니다. 예를 들어 SQL 웨어하우스나 작업 클러스터 등이 그렇습니다. 추가적인 모델 추론 비용이 존재하는지는 다음 함수에 따라 다릅니다:
-
작업별 함수 (예:
ai_classify,ai_summarize,ai_translate)는 Databricks가 관리하는 서버리스 GPU 인프라에서 모델 서빙을 통해 추론을 수행합니다. 이 인프라를 직접 프로비저닝하는 것은 아니지만, 쿼리 컴퓨트와 함께 청구됩니다. -
ai_query는 지정한 모델 서빙 엔드포인트 에 대해 청구됩니다. Databricks 호스팅 기반 기반 모델 엔드포인트는 작업별 기능과 동일하게 청구됩니다; 맞춤형 모델 및 프로비저닝된 처리량 엔드포인트는 전용 서비스 컴퓨트에서 실행되며 그에 따라 청구됩니다. -
ai_forecast및ai_top_drivers는 제출한 컴퓨팅 리소스에서 전적으로 실행되며, 별도의 추론 비용이 없습니다. -
vector_searchDatabricks가 관리하는 AI 검색 서비스를 통해 AI 검색 인덱스를 조회할 수 있습니다.
AI 함수 비용은 MODEL_SERVING 제공 유형에서 BATCH_INFERENCE 제품의 일부로 기록됩니다.
배치 추론 워크로드의 비용 보기에 대한 예제 쿼리를 참조하세요.
비고
ai_parse_document, ai_extract, 및 ai_classify의 비용은 AI_FUNCTIONS 제품의 일부로 기록됩니다. 예제 쿼리 의 실행에 대한 ai_parse_document 비용 보기를 참조하세요.
일괄 처리 유추 워크로드에 대한 비용 보기
다음 예제에서는 작업, 컴퓨팅, SQL 웨어하우스 및 Lakeflow 파이프라인을 기반으로 일괄 처리 유추 워크로드를 필터링하는 방법을 보여 줍니다.
AI Functions를 사용하는 일괄 추론 워크로드의 비용을 확인하는 방법에 대한 일반적인 예시는 모델 서비스 비용 모니터링을 참조하세요.
Jobs
다음 쿼리는 시스템 테이블을 사용하여 system.workflow.jobs 일괄 처리 유추에 사용되는 작업을 보여줍니다.
시스템 테이블을 사용하여 작업 비용 및 성능 모니터링을 참조하세요.
SELECT *
FROM system.billing.usage u
JOIN system.workflow.jobs x
ON u.workspace_id = x.workspace_id
AND u.usage_metadata.job_id = x.job_id
WHERE u.usage_metadata.workspace_id = <workspace_id>
AND u.billing_origin_product = "MODEL_SERVING"
AND u.product_features.model_serving.offering_type = "BATCH_INFERENCE";
Compute
다음은 시스템 테이블을 사용하여 일괄 처리 유추에 사용되는 클러스터를 system.compute.clusters 보여 줍니다.
SELECT *
FROM system.billing.usage u
JOIN system.compute.clusters x
ON u.workspace_id = x.workspace_id
AND u.usage_metadata.cluster_id = x.cluster_id
WHERE u.usage_metadata.workspace_id = <workspace_id>
AND u.billing_origin_product = "MODEL_SERVING"
AND u.product_features.model_serving.offering_type = "BATCH_INFERENCE";
Lakeflow Spark 선언적 파이프라인
다음은 system.lakeflow.pipelines 시스템 테이블을 사용하여 배치 추론에 사용 중인 Lakeflow 파이프라인을 보여줍니다.
SELECT *
FROM system.billing.usage u
JOIN system.lakeflow.pipelines x
ON u.workspace_id = x.workspace_id
AND u.usage_metadata.dlt_pipeline_id = x.pipeline_id
WHERE u.usage_metadata.workspace_id = <workspace_id>
AND u.billing_origin_product = "MODEL_SERVING"
AND u.product_features.model_serving.offering_type = "BATCH_INFERENCE";
SQL 웨어하우스
다음은 시스템 테이블을 사용하여 일괄 처리 추론에 사용되는 SQL 웨어하우스를 보여 줍니다 system.compute.warehouses.
SELECT *
FROM system.billing.usage u
JOIN system.compute.clusters x
ON u.workspace_id = x.workspace_id
AND u.usage_metadata.cluster_id = x.cluster_id
WHERE u.workspace_id = <workspace_id>
AND u.billing_origin_product = "MODEL_SERVING"
AND u.product_features.model_serving.offering_type = "BATCH_INFERENCE";
실행 비용 보기 ai_parse_document
다음 예제에서는 청구 시스템 테이블을 쿼리하여 ai_parse_document 작업 비용을 보는 방법을 보여 줍니다.
SELECT *
FROM system.billing.usage u
WHERE u.workspace_id = <workspace_id>
AND u.billing_origin_product = "AI_FUNCTIONS"
AND u.product_features.ai_functions.ai_function = "AI_PARSE_DOCUMENT";