튜토리얼: Databricks IDE 확장 기능을 사용해 클러스터와 직업으로 Python을 실행하세요

이 튜토리얼은 Databricks IDE 확장 기능을 설정하고, Azure Databricks 클러스터에서 Python을 실행하는 방법과 원격 작업 공간에서 Azure Databricks 작업으로 실행하는 방법을 안내합니다. Databricks IDE 확장 기능을 참조하세요.

요구 사항

이 자습서에서는 다음이 필요합니다.

  • Databricks IDE 확장 프로그램을 설치하셨습니다. Databricks IDE 확장 프로그램 설치를 참조하세요.
  • 사용할 원격 Azure Databricks 클러스터가 있습니다. 클러스터의 이름을 기록해 둡다. 사용 가능한 클러스터를 보려면 Azure Databricks 작업 영역 사이드바에서 Compute 클릭합니다. 컴퓨팅을 참조하세요.

1단계: 새 Databricks 프로젝트 만들기

이 단계에서는 새 Databricks 프로젝트를 만들고 원격 Azure Databricks 작업 영역과의 연결을 구성합니다.

  1. Visual Studio Code 시작하고 > 폴더 열기를 클릭하고 로컬 개발 머신에서 빈 폴더를 엽니다.
  2. 사이드바에서 Databricks 로고 아이콘을 클릭합니다. 그러면 Databricks 확장이 열립니다.
  3. 구성 보기에서 구성 만들기클릭합니다.
  4. Databricks 작업 영역을 구성하는 명령 팔레트가 열립니다. Databricks 호스트에 대해, 작업 영역별 URL을입력하거나 선택하십시오(예: https://adb-1234567890123456.7.azuredatabricks.net).
  5. 프로젝트에 대한 인증 프로필을 선택합니다. Databricks IDE 확장 기능에 대한 인증 설정 항목을 참조하세요.

2단계: Databricks 확장에 클러스터 정보 추가 및 클러스터 시작

  1. 구성 보기가 이미 열려 있는 상태에서 클러스터 선택하거나 기어(클러스터구성) 아이콘을 클릭합니다.

    클러스터 구성

  2. 명령 팔레트이전에 만든 클러스터의 이름을 선택합니다.

  3. 아직 시작되지 않은 경우 재생 아이콘(클러스터 시작)을 클릭합니다.

3단계: Python 코드 만들기 및 실행

  1. 로컬 Python 코드 파일을 만듭니다. 사이드바에서 폴더(Explorer) 아이콘을 클릭합니다.

  2. 주 메뉴에서 파일 > 새 파일을 클릭하고 Python 파일을 선택합니다. 파일 이름을 demo.py 프로젝트의 루트에 저장합니다.

  3. 파일에 다음 코드를 추가한 다음 저장합니다. 이 코드는 기본 PySpark DataFrame의 내용을 만들고 표시합니다.

    from pyspark.sql import SparkSession
    from pyspark.sql.types import *
    
    spark = SparkSession.builder.getOrCreate()
    
    schema = StructType([
       StructField('CustomerID', IntegerType(), False),
       StructField('FirstName',  StringType(),  False),
       StructField('LastName',   StringType(),  False)
    ])
    
    data = [
       [ 1000, 'Mathijs', 'Oosterhout-Rijntjes' ],
       [ 1001, 'Joost',   'van Brunswijk' ],
       [ 1002, 'Stan',    'Bokenkamp' ]
    ]
    
    customers = spark.createDataFrame(data, schema)
    customers.show()
    
    # +----------+---------+-------------------+
    # |CustomerID|FirstName|           LastName|
    # +----------+---------+-------------------+
    # |      1000|  Mathijs|Oosterhout-Rijntjes|
    # |      1001|    Joost|      van Brunswijk|
    # |      1002|     Stan|          Bokenkamp|
    # +----------+---------+-------------------+
    
  4. 편집기 탭 목록 옆에 있는 Databricks 실행 아이콘을 클릭한 다음 파일업로드 및 실행 클릭합니다. 출력이 디버그 콘솔 보기에 나타납니다.

    아이콘에서 파일 업로드 및 실행

    탐색기 보기에서 파일을 마우스 오른쪽 버튼으로 클릭한 후, demo.py, >을 클릭합니다.

    상황에 맞는 메뉴에서 파일 업로드 및 실행

4단계: 작업으로 코드 실행

demo.py을 작업으로 실행하려면 편집기 탭 목록 옆에 있는 Databricks 실행 아이콘을 클릭한 후, 파일을 워크플로로 실행을 클릭합니다. 출력은 demo.py 파일 편집기 옆에 있는 별도의 출력 탭에 나타납니다.

아이콘에서 파일을 워크플로로 실행

또는 demo.py 파일을 탐색기 패널에서 마우스 오른쪽 버튼으로 클릭한 다음 Databricks에서 실행>워크플로로 파일 실행을 선택합니다.

상황에 맞는 메뉴에서 워크플로로 파일 실행

다음 단계

이제 Databricks IDE 확장 프로그램을 성공적으로 사용해 로컬 Python 파일을 업로드하고 원격으로 실행하셨다면, 다음과 같은 방법도 할 수 있습니다: