sdp-meta
Databricks Labs의 프로젝트는 유지 관리하는 메타데이터에서 파이프라인을 생성하는 도구를 제공합니다.
메모
오픈 소스 sdp-meta 프로젝트는 databrickslabs GitHub 계정 내 모든 프로젝트와 마찬가지로 탐색 목적으로만 존재합니다. Azure Databricks는 이를 지원하거나 SLA(서비스 수준 계약)를 제공하지 않습니다. 이 프로젝트와 관련된 문제에 대한 Azure Databricks 지원 티켓을 제출하지 마세요. 대신 시간이 되는 대로 검토되는 GitHub 이슈를 등록하세요.
sdp-meta란 무엇인가요?
Lakeflow 파이프라인을 사용하면 테이블을 선언적으로 지정하고 파이프라인에서 테이블을 만들고 원본 데이터가 변경되면 최신 상태로 유지하는 흐름을 생성할 수 있습니다. 그러나 조직에 수백 개의 테이블이 있는 경우 이러한 파이프라인을 생성하고 관리하는 데 시간이 오래 걸리며 일관성 없는 관행이 발생할 수 있습니다.
sdp-meta 프로젝트는 Lakeflow 파이프라인과 함께 작동하도록 설계된 메타데이터 기반 메타프로그래밍 프레임워크입니다. 이 프레임워크를 사용하면 JSON 및 YAML 파일 집합에 기록된 메타데이터를 활용하여 브론즈 및 실버 데이터 파이프라인을 자동화할 수 있습니다. 런타임 시에는 일반 파이프라인이 메타데이터를 읽고 그 안에 설명된 흐름을 동적으로 구축합니다. 청동과 은은 가공은 별도의 파이프라인에서 또는 결합된 파이프라인에서 함께 진행될 수 있습니다. 사용자가 파이프라인 메타데이터를 생성하면 sdp-meta가 파이프라인을 생성합니다.
논리를 한 곳에서 중앙 집중식으로(메타데이터) 사용하면 시스템이 더 빠르고 재사용 가능하며 유지 관리가 더 쉽습니다.
메모
sdp-meta 프로젝트는 이전에 Azure Databricks의 이전 dlt-meta 기능의 이름을 따서 라는 이름으로 불렸습니다.
델타 라이브 테이블은 Lakeflow 파이프라인으로 대체되었고, SDP-메타는 Lakeflow 파이프라인과 함께 작동합니다. 기존 dlt-meta 설치를 업그레이드하는 경우, sdp-meta 문서의 마이그레이션 가이드 를 참고하세요.
sdp-meta의 장점
sdp-meta의 주요 사용 사례는 두 가지입니다:
- 대량의 테이블을 간편하게 수집하고 정리합니다.
- 여러 파이프라인 및 사용자에 데이터 엔지니어링 표준을 적용합니다.
메타데이터 기반 접근 방식을 사용할 경우의 이점은 다음과 같습니다.
- 메타데이터 유지 관리 작업은 Python 또는 SQL 코드에 대한 지식 없이도 수행할 수 있습니다.
- 코드가 아닌 메타데이터를 유지 관리하려면 오버헤드가 적고 오류가 줄어듭니다.
- 코드는 sdp-meta로 생성되어 일관성을 유지하고, 파이프라인과 공개된 테이블 간에 커스텀 코드가 적습니다.
- 데이터를 가장 효율적으로 업데이트하는 데 필요한 파이프라인 수를 생성하여 메타데이터 내의 파이프라인으로 테이블을 쉽게 그룹화할 수 있습니다.
sdp-메타가 작동하는 방식
다음 이미지는 sdp-메타 시스템의 개요를 보여줍니다:
- 메타데이터 파일을 sdp-meta에 입력하여 소스 파일과 출력, 품질 규칙, 필요한 처리를 지정합니다. 이 온보딩 파일들은 JSON 또는 YAML로 작성할 수 있습니다.
- sdp-meta 온보딩 작업을 실행합니다. 엔진은 온보딩 파일을 DataflowSpec이라 불리는 데이터 흐름 명세로 컴파일하고, 이후 사용을 위해 델타 테이블(
bronze_dataflowspec와silver_dataflowspec)에 저장합니다. - 런타임에는 일반 파이프라인이 DataflowSpec을 읽고 동적으로 브론즈 처리 그래프를 구축합니다. 이 도구는 소스 데이터(파일, 스트림, CDC)를 읽고, 품질 규칙에 맞는 올바른 데이터 기대치를 적용하여 브론즈 테이블을 생성하고 해당 규칙에 맞지 않는 레코드를 격리합니다.
- 실버 처리는 선언적 자동화 번들의 기본 설정인 별도의 일반 파이프라인에서 실행될 수 있고, 결합 모드를 사용할 경우 같은 파이프라인에서 실행할 수 있습니다. 파이프라인은 DataflowSpec을 사용하여 적절한 변환과 기타 처리를 적용하며, 클리닝되고 풍부하며 분석 준비가 된 실버 테이블을 생성합니다.
sdp-meta가 생성한 파이프라인을 실행하여 소스 데이터가 업데이트될 때마다 출력이 최신으로 유지되도록 합니다.
Get started
sdp-meta를 사용하려면 다음을 해야 합니다:
- SDP-메타 솔루션을 배포하고 구성하세요.
- 브론즈 및 실버 레이어 테이블에 대한 메타데이터를 준비합니다.
- 메타데이터를 온보딩하는 작업을 만듭니다.
- 메타데이터를 사용하여 테이블에 대한 파이프라인을 만듭니다.
sdp-meta 프로젝트는 여러 배포 인터페이스를 지원합니다: 번들(권장), 인터랙티브 CLI, 브라우저 기반 GUI가 포함된 Databricks 앱, AI 지원 설정을 위한 MCP 서버, 그리고 기술 인식 AI 에이전트를 위한 휴대용 에이전트 스킬.
GitHub의 sdp-meta 문서에 이 과정을 시작하는 데 도움이 되는 튜토리얼이 있습니다. 자세한 내용은 GitHub의 sdp-meta 시작 방법을 참고하세요.