sdp-meta로 파이프라인을 생성하세요

sdp-meta Databricks Labs의 프로젝트는 유지 관리하는 메타데이터에서 파이프라인을 생성하는 도구를 제공합니다.

메모

오픈 소스 sdp-meta 프로젝트는 databrickslabs GitHub 계정 내 모든 프로젝트와 마찬가지로 탐색 목적으로만 존재합니다. Azure Databricks는 이를 지원하거나 SLA(서비스 수준 계약)를 제공하지 않습니다. 이 프로젝트와 관련된 문제에 대한 Azure Databricks 지원 티켓을 제출하지 마세요. 대신 시간이 되는 대로 검토되는 GitHub 이슈를 등록하세요.

sdp-meta란 무엇인가요?

Lakeflow 파이프라인을 사용하면 테이블을 선언적으로 지정하고 파이프라인에서 테이블을 만들고 원본 데이터가 변경되면 최신 상태로 유지하는 흐름을 생성할 수 있습니다. 그러나 조직에 수백 개의 테이블이 있는 경우 이러한 파이프라인을 생성하고 관리하는 데 시간이 오래 걸리며 일관성 없는 관행이 발생할 수 있습니다.

sdp-meta 프로젝트는 Lakeflow 파이프라인과 함께 작동하도록 설계된 메타데이터 기반 메타프로그래밍 프레임워크입니다. 이 프레임워크를 사용하면 JSON 및 YAML 파일 집합에 기록된 메타데이터를 활용하여 브론즈 및 실버 데이터 파이프라인을 자동화할 수 있습니다. 런타임 시에는 일반 파이프라인이 메타데이터를 읽고 그 안에 설명된 흐름을 동적으로 구축합니다. 청동과 은은 가공은 별도의 파이프라인에서 또는 결합된 파이프라인에서 함께 진행될 수 있습니다. 사용자가 파이프라인 메타데이터를 생성하면 sdp-meta가 파이프라인을 생성합니다.

논리를 한 곳에서 중앙 집중식으로(메타데이터) 사용하면 시스템이 더 빠르고 재사용 가능하며 유지 관리가 더 쉽습니다.

메모

sdp-meta 프로젝트는 이전에 Azure Databricks의 이전 dlt-meta 기능의 이름을 따서 라는 이름으로 불렸습니다. 델타 라이브 테이블은 Lakeflow 파이프라인으로 대체되었고, SDP-메타는 Lakeflow 파이프라인과 함께 작동합니다. 기존 dlt-meta 설치를 업그레이드하는 경우, sdp-meta 문서의 마이그레이션 가이드 를 참고하세요.

sdp-meta의 장점

sdp-meta의 주요 사용 사례는 두 가지입니다:

  • 대량의 테이블을 간편하게 수집하고 정리합니다.
  • 여러 파이프라인 및 사용자에 데이터 엔지니어링 표준을 적용합니다.

메타데이터 기반 접근 방식을 사용할 경우의 이점은 다음과 같습니다.

  • 메타데이터 유지 관리 작업은 Python 또는 SQL 코드에 대한 지식 없이도 수행할 수 있습니다.
  • 코드가 아닌 메타데이터를 유지 관리하려면 오버헤드가 적고 오류가 줄어듭니다.
  • 코드는 sdp-meta로 생성되어 일관성을 유지하고, 파이프라인과 공개된 테이블 간에 커스텀 코드가 적습니다.
  • 데이터를 가장 효율적으로 업데이트하는 데 필요한 파이프라인 수를 생성하여 메타데이터 내의 파이프라인으로 테이블을 쉽게 그룹화할 수 있습니다.

sdp-메타가 작동하는 방식

다음 이미지는 sdp-메타 시스템의 개요를 보여줍니다:

SDP-메타 개요

  1. 메타데이터 파일을 sdp-meta에 입력하여 소스 파일과 출력, 품질 규칙, 필요한 처리를 지정합니다. 이 온보딩 파일들은 JSON 또는 YAML로 작성할 수 있습니다.
  2. sdp-meta 온보딩 작업을 실행합니다. 엔진은 온보딩 파일을 DataflowSpec이라 불리는 데이터 흐름 명세로 컴파일하고, 이후 사용을 위해 델타 테이블(bronze_dataflowspecsilver_dataflowspec)에 저장합니다.
  3. 런타임에는 일반 파이프라인이 DataflowSpec을 읽고 동적으로 브론즈 처리 그래프를 구축합니다. 이 도구는 소스 데이터(파일, 스트림, CDC)를 읽고, 품질 규칙에 맞는 올바른 데이터 기대치를 적용하여 브론즈 테이블을 생성하고 해당 규칙에 맞지 않는 레코드를 격리합니다.
  4. 실버 처리는 선언적 자동화 번들의 기본 설정인 별도의 일반 파이프라인에서 실행될 수 있고, 결합 모드를 사용할 경우 같은 파이프라인에서 실행할 수 있습니다. 파이프라인은 DataflowSpec을 사용하여 적절한 변환과 기타 처리를 적용하며, 클리닝되고 풍부하며 분석 준비가 된 실버 테이블을 생성합니다.

sdp-meta가 생성한 파이프라인을 실행하여 소스 데이터가 업데이트될 때마다 출력이 최신으로 유지되도록 합니다.

Get started

sdp-meta를 사용하려면 다음을 해야 합니다:

  • SDP-메타 솔루션을 배포하고 구성하세요.
  • 브론즈 및 실버 레이어 테이블에 대한 메타데이터를 준비합니다.
  • 메타데이터를 온보딩하는 작업을 만듭니다.
  • 메타데이터를 사용하여 테이블에 대한 파이프라인을 만듭니다.

sdp-meta 프로젝트는 여러 배포 인터페이스를 지원합니다: 번들(권장), 인터랙티브 CLI, 브라우저 기반 GUI가 포함된 Databricks 앱, AI 지원 설정을 위한 MCP 서버, 그리고 기술 인식 AI 에이전트를 위한 휴대용 에이전트 스킬.

GitHub의 sdp-meta 문서에 이 과정을 시작하는 데 도움이 되는 튜토리얼이 있습니다. 자세한 내용은 GitHub의 sdp-meta 시작 방법을 참고하세요.

추가 리소스