적용 대상:✅ 패브릭 데이터 엔지니어링 및 데이터 과학
Fabric에서 작업 공간을 만들면, 그 작업 공간과 연관된 스타터 풀이 자동으로 생성됩니다. Fabric의 단순화된 설정 덕분에 노드나 기계 크기를 선택할 필요가 없으며, 이 옵션들은 뒤에서 자동으로 처리됩니다. 이 구성은 사용자가 컴퓨팅 설정에 대해 걱정할 필요 없이 많은 일반적인 시나리오에서 Apache Spark 작업을 시작하고 실행할 수 있도록 더 빠른(5~10초) Apache Spark 세션 시작 환경을 제공합니다. 특정 컴퓨팅 요구 사항이 있는 고급 시나리오의 경우 사용자는 사용자 지정 Apache Spark 풀을 만들고 성능 요구 사항에 따라 노드 크기를 조정할 수 있습니다.
작업 영역에서 Apache Spark 설정을 변경하려면 해당 작업 영역에 대한 관리자 역할이 있어야 합니다. 자세한 내용은 작업 영역의 역할을 참조 하세요.
작업 영역과 연결된 풀에 대한 Spark 설정을 관리하려면 다음을 수행합니다.
작업 영역의 작업 영역 설정으로 이동하고 데이터 엔지니어링/과학 옵션을 선택하여 메뉴를 확장합니다.
왼쪽 메뉴에 Spark 컴퓨팅 옵션이 표시됩니다.
참고
기본 풀을 시작 풀에서 사용자 지정 Spark 풀로 변경하면 세션 시작 시간이 길어질 수 있습니다(~3분).
풀
작업 영역의 기본 풀
자동으로 생성된 시작 풀을 사용하거나 작업 영역에 대한 사용자 지정 풀을 만들 수 있습니다.
시작 풀: 빠른 환경을 위해 미리 하이드레이션된 라이브 풀이 자동으로 생성됩니다. 이러한 클러스터는 중간 크기입니다. 시작 풀은 구매한 패브릭 용량 SKU에 따라 기본 구성으로 설정됩니다. 관리자는 Spark 워크로드 크기 조정 요구 사항에 따라 최대 노드 및 실행기를 사용자 지정할 수 있습니다. 자세한 내용은 시작 풀 구성을 참조하세요.
사용자 지정 Spark 풀: Spark 작업 요구 사항에 따라 노드 크기를 조정하고, 자동 크기 조정하고, 실행기를 동적으로 할당할 수 있습니다. 사용자 지정 Spark 풀을 만들려면 용량 관리자가 용량 관리자 설정의 Spark 컴퓨팅 섹션에서 사용자 지정된 작업 영역 풀 옵션을 사용하도록 설정해야 합니다.
참고
사용자 지정된 작업 영역 풀에 대한 용량 수준 제어는 기본적으로 사용하도록 설정됩니다. 자세한 내용은 패브릭 용량에 대한 데이터 엔지니어링 및 데이터 과학 설정 구성 및 관리를 참조하세요.
관리자는 새 풀 옵션을 선택하여 컴퓨팅 요구 사항에 따라 사용자 지정 Spark 풀을 만들 수 있습니다.
Fabric용 Apache Spark는 단일 노드 클러스터를 지원하며, 사용자가 최소 노드 구성을 1개로 선택할 수 있어 드라이버와 실행자가 단일 노드에서 실행됩니다. 이러한 단일 노드 클러스터는 노드 실패 시 복원 가능한 고가용성을 제공하고 컴퓨팅 요구 사항이 더 작은 워크로드에 대해 더 나은 작업 안정성을 제공합니다. 사용자 지정 Spark 풀에 대해 자동 크기 조정 옵션을 사용하거나 사용하지 않도록 설정할 수도 있습니다. 자동 크기 조정을 사용하도록 설정하면 풀은 사용자가 지정한 최대 노드 제한 내에서 새 노드를 획득하고 성능 향상을 위해 작업 실행 후 사용 중지합니다.
성능 향상을 위해 데이터 볼륨에 따라 지정된 최대 한도 내에서 자동으로 최적의 실행기 수를 풀링하기 위해 실행기를 동적으로 할당하는 옵션을 선택할 수도 있습니다.
패브릭용 Apache Spark 컴퓨팅에 대해 자세히 알아보세요.
- 항목에 대한 컴퓨팅 구성 사용자 지정: 작업 영역 관리자는 사용자가 환경을 사용하여 Notebook, Spark 작업 정의와 같은 개별 항목에 대해 컴퓨팅 구성(드라이버/실행기 코어, 드라이버/실행기 메모리를 포함하는 세션 수준 속성)을 조정하도록 허용할 수 있습니다.
작업 영역 관리자가 설정을 해제하면 기본 풀과 해당 컴퓨팅 구성이 작업 영역의 모든 환경에 사용됩니다.
환경
환경은 Spark 작업(Notebook, Spark 작업 정의)을 실행하기 위한 유연한 구성을 제공합니다. 환경에서 컴퓨팅 속성을 구성하고, 워크로드 요구 사항에 따라 다양한 런타임을 선택하고, 라이브러리 패키지 종속성을 설정할 수 있습니다.
환경 탭에는 기본 환경을 설정하는 옵션이 있습니다. 작업 영역에 사용할 Spark 버전을 선택할 수 있습니다.
패브릭 작업 영역 관리자는 환경을 작업 영역 기본 환경으로 선택할 수 있습니다.
환경 드롭다운을 통해 새 항목을 만들 수도 있습니다.
기본 환경을 사용하는 옵션을 사용하지 않도록 설정하면 드롭다운 선택 영역에 나열된 사용 가능한 런타임 버전에서 패브릭 런타임 버전을 선택할 수 있습니다.
Apache Spark 런타임에 대해 자세히 알아봅니다.
작업
작업 설정을 사용하면 관리자가 작업 영역의 모든 Spark 작업에 대한 작업 허용 논리를 제어할 수 있습니다.
기본적으로 모든 작업 영역은 낙관적 작업 수용으로 설정됩니다. Spark in Fabric의 취업 입사에 대해 더 알아보세요.
활성 Spark 작업에 대해 최대 예약 코어를 사용하도록 설정하여 낙관적 작업 허용 기반 접근 방식을 해제하고 Spark 작업에 대한 최대 코어를 예약할 수 있습니다.
Spark 세션 시간 제한을 설정하여 모든 Notebook 대화형 세션에 대한 세션 만료를 사용자 지정할 수도 있습니다.
참고
기본 세션 만료는 대화형 Spark 세션에 대해 20분으로 설정됩니다.
최대 작업 수명 설정
Set maximum job lifetime 설정을 가드레일로 사용하여 정해진 시간 제한을 초과한 Spark 작업이 컴퓨팅을 소모하지 못하도록 막으세요. 이 설정을 켜고 지속 시간을 지정하면, Fabric은 설정된 수명을 초과하는 자격이 있는 Spark 작업을 자동으로 종료합니다. 워크스페이스 관리자는 이 제어를 통해 다음과 같은 일을 할 수 있습니다:
- 무한히 용량을 차지하거나 작업 공간에서 다른 작업을 차단하기 전에 도망치거나 막는 작업을 막으세요.
- 단일 작업의 실행 시간을 제한하여 컴퓨트 준수 및 거버넌스 정책을 강제합니다.
설정하려면 최대 작업 수명 설정을 켜고, 값을 입력한 뒤 시간 단위(예: 시간 단위)를 선택한 후 저장 을 선택해 작업 공간에 제한을 적용하세요.
어떤 직업이 영향을 받는지
최대 작업 수명은 사용자가 명시적으로 시작하고 사용자의 정체성으로 실행되는 사용자 제출 작업 에만 적용됩니다. 이러한 일자리에는 예를 들어:
- 파이프라인을 통해 오케스트레이션되는 노트북 런을 포함한 인터랙티브 및 예정된 노트북 실행.
- Spark 작업 정의는 직접 제출하든, 일정에 따라 제출하든, 파이프라인을 통해 제출하든 실행됩니다.
- 리비 배치 및 인터랙티브 세션, 그리고 고동시성 세션을 포함합니다.
시스템 관리 작업은 이 설정의 영향을 받지 않으며 완료될 때까지 계속 실행됩니다. 이러한 작업들은 Fabric이 대신 트리거하고 관리합니다. 예를 들면:
- 레이크하우스 테이블 유지보수 작업, 예를 들어 최적화와 진공 청소 작업.
- 실체화된 호수 전망이 새로워집니다.
- 보안 및 정책 집행과 같은 플랫폼 운영.
이 구분은 백그라운드 유지보수와 데이터 및 작업 공간을 유지하는 플랫폼 운영이 중단되지 않도록 보장하며, 사용자 작업 부하는 가드레일에 계속 적용되도록 합니다.
참고
작업이 설정된 최대 수명에 도달하면 Fabric이 자동으로 이를 취소합니다. 가장 오래 지속된 합법적인 사용자 작업이 완료될 수 있도록 충분한 시간을 허용하는 한도를 설정하세요.
높은 동시성
높은 동시성 모드를 사용하면 사용자가 Apache Spark for Fabric 데이터 엔지니어링 및 데이터 과학 워크로드에서 동일한 Spark 세션을 공유할 수 있습니다. Notebook과 같은 항목은 실행에 Spark 세션을 사용하며, 이를 사용하도록 설정하면 사용자가 여러 Notebook에서 단일 Spark 세션을 공유할 수 있습니다.
Apache Spark for Fabric의 높은 동시성에 대해 자세히 알아보세요.
Machine Learning 모델 및 실험에 대한 자동 로깅
이제 관리자는 기계 학습 모델 및 실험에 자동 로깅을 사용하도록 설정할 수 있습니다. 이 옵션은 학습 중인 기계 학습 모델의 입력 매개 변수, 출력 메트릭 및 출력 항목의 값을 자동으로 캡처합니다. 자동 로깅에 대해 자세히 알아보세요.
관련 콘텐츠
- Fabric의 Apache Spark 런타임 - 개요, 버전 관리, 다중 런타임 지원 및 Delta Lake 프로토콜 업그레이드에 대해 알아보세요.
- Apache Spark 공개 문서에서 자세히 알아보세요.
- 자주 묻는 질문에 대한 답변은 Apache Spark 작업 영역 관리 설정 FAQ에서 찾아보세요.