시각적 데이터 준비 파일을 프로덕션으로 이동

Lakeflow Designer에서 빌드하는 모든 시각적 데이터 준비 파일은 프로덕션 준비 코드로 지원되며 이름이 지정된 <name>.designer.ipynbNotebook으로 저장됩니다. Git에 저장하고, 작업으로 실행하고, 선언적 자동화 번들을 사용하여 배포하는 등 다른 Azure Databricks 코드에 사용하는 것과 동일한 도구를 사용하여 프로덕션으로 이동할 수 있습니다.

이 페이지에서는 프로토타입에서 프로덕션으로 시각적 데이터 준비 파일을 가져오는 방법을 설명합니다.

Git에 저장 및 버전

작업 영역은 시각적 데이터 준비 파일을 기본적으로 저장합니다. 시각적 데이터 준비 파일의 버전을 지정하려면 Git 폴더에 배치하고 다른 전자 필기장처럼 추적합니다.

  1. 작업 영역에서 Git 폴더를 만듭니다.
  2. 시각적 데이터 준비 파일을 해당 Git 폴더로 이동합니다.
  3. Git의 다른 Notebook과 마찬가지로 파일을 추적, 커밋 및 버전 관리합니다. Git에서 파일은 .로 <file_name>.designer.ipynb표시됩니다.

Git 폴더에 대한 자세한 내용은 Azure Databricks Git 폴더를 참조하세요. 시각적 데이터 준비 파일을 내보내거나 가져오려면 시각적 데이터 준비 파일 내보내기 및 가져오기를 참조하세요.

작업으로 예약하기

시각적 데이터 준비 파일을 작업으로 예약하여 자동화할 수 있습니다.

  • 직접 예약: 위쪽 메뉴에서 일정 단추를 클릭하여 시각적 데이터 준비 파일에 대한 예약된 작업을 만듭니다.
  • 작업에 추가: Azure Databricks 작업을 만들고 시각적 데이터 준비 파일을 작업으로 추가합니다. 이렇게 하면 해당 시각적 데이터 준비 파일을 더 큰 파이프라인의 다른 작업과 결합할 수 있습니다. 작업 유형 드롭다운에서 시각적 데이터 준비를 선택한 다음, 파일을 선택합니다.

예약된 실행에서는 Jobs 작업 그래프에 각 연산자가 개별 노드로 표시되므로, 캔버스에서와 같은 방식으로 실행에서 연산자별 결과를 검사할 수 있습니다.

기존 일정을 보고 관리하려면 일정을 다시 클릭하여 목록을 엽니다. 일정 추가를 클릭하여 다른 일정을 만들거나, 일정의 케밥 메뉴 아이콘을 열어 편집, 지금 실행, 일시 중지, 복제, Jobs에서 보기 또는 삭제할 수 있습니다.

실행에서 연산자 출력 표시

기본적으로 예약된 실행은 출력 연산자 같은 터미널 연산자(다운스트림 연결이 없는 연산자)에 대해서만 출력을 생성합니다. 실행 중인 모든 연산자의 결과를 보려면 일정 대화 상자에서 고급 설정을 확장하고 연산자 출력 표시를 선택합니다.

시각적 데이터 준비 파일을 작업으로 자동화하기 위한 LFD 일정 컨트롤입니다.

실행 출력 크기 제한을 초과하지 않도록 큰 캔버스에 대해 이 옵션을 해제합니다.

서버리스 환경 선택

시각적 데이터 준비 파일을 사용하는 경우 대화형 실행 및 예약된 작업 모두에 사용되는 서버리스 환경을 선택할 수 있습니다. 노트북에서와 동일한 방식으로 오른쪽 사이드바의 Environment 아이콘Environment 측면 창에서 구성합니다. 기본 환경에서 환경 버전을 선택합니다. 서버리스 환경 구성을 참조하세요.

환경 간 매개 변수화

매개 변수는 SQL 및 Python 연산자에서 참조할 수 있는 전체 시각적 데이터 준비 파일에 대해 정의된 명명된 값입니다. 매개 변수 정의 및 참조에 대한 자세한 내용은 매개 변수를 참조하세요.

매개 변수를 사용하면 개발 중 테스트 카탈로그, 프로덕션의 프로덕션 카탈로그 등 다양한 환경에 대해 동일한 시각적 데이터 준비 파일을 실행할 수 있습니다.

  • UI에서 작업을 예약하는 경우: 각 일정에 대한 매개 변수 값을 재정의합니다. 예를 들어, environment 매개 변수를 test(으)로 설정하여 실행되는 일정을 하나 만들고, 해당 매개 변수를 production(으)로 설정하여 실행되는 다른 일정도 만듭니다.
  • 번들을 사용하여 배포하는 경우: 작업을 parameters통해 매개 변수 값을 설정하고 번들 대상을 사용하여 환경별로 다른 값을 제공합니다. 번들 개발 및 프로덕션 대상을 사용하면 환경별 설정을 사용하여 별도의 환경에 동일한 작업을 배포할 수 있습니다. 선언적 자동화 번들 배포 모드 및선언적 자동화 번들 구성을 참조하세요.

런타임에 시각적 데이터 준비 파일은 대화형으로 실행하든 작업으로 실행되는지와 동일한 방식으로 해당 매개 변수를 읽으므로 동일한 파일이 모든 환경에서 변경 없이 작동합니다.

환경별 다른 테이블에서 읽기

각 환경의 다른 원본 테이블에서 읽으려면 고정 원본 연산자 대신 매개 변수가 있는 SQL 연산자를 사용합니다. catalog, schema, 및 table 매개 변수를 정의한 다음, IDENTIFIER() 절을 사용하여 이를 참조해 테이블 이름을 동적으로 생성합니다.

SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)

일정 또는 번들 대상별로 catalog, schema, 또는 table 매개 변수를 재정의하여, 동일한 시각적 데이터 준비 파일이 개발 중에는 테스트 데이터를, 프로덕션에서는 프로덕션 데이터를 가리키도록 합니다. IDENTIFIER() 절에 대한 자세한 내용은 IDENTIFIER 절을 참조하세요.

선언적 자동화 번들을 사용하여 배포

선언적 자동화 번들을 사용하면 소스 파일과 같은 Azure Databricks 리소스를 정의하고 배포할 수 있으므로 소스 제어, 코드 검토, 테스트 및 CI/CD와 같은 소프트웨어 엔지니어링 모범 사례를 시각적 데이터 준비 파일에 적용할 수 있습니다. 선언적 자동화 번들이란 무엇인가?를 참조하세요.

번들과 함께 비주얼 데이터 준비 파일을 배포하려면 노트북 작업을 정의하고 .designer.ipynb에서 notebook_task.notebook_path 파일 경로를 참조합니다. 번들에서 시각적 데이터 준비 파일은 Jobs UI에 notebook_task 작업 유형으로 표시되더라도 키를 사용합니다.

다음 예제에서는 번들 구성 파일 옆에 있는 시각적 데이터 준비 파일을 실행하는 작업을 정의합니다.

resources:
  jobs:
    daily_prep_job:
      name: daily_prep_job
      tasks:
        - task_key: run_visual_data_prep
          notebook_task:
            notebook_path: ./my_transformation.designer.ipynb

Azure Databricks CLI를 사용하여 번들을 배포하고 실행합니다.

databricks bundle deploy
databricks bundle run daily_prep_job

전자 필기장 작업 키의 전체 집합은 Notebook 작업을 참조하세요. 번들에서 작업을 정의하는 전체 연습은 선언적 자동화 번들을 사용하여 작업 개발을 참조하세요.

CI/CD를 사용하여 자동화

시각적 데이터 준비 번들의 유효성을 자동으로 검사하고 배포하려면 CI/CD 파이프라인에 통합합니다. GitHub Actions 사용하는 예제는 GitHub Actions 참조하세요.

추가 리소스