Azure Databricks에는 Apache Spark에서 기본적으로 지원하는 모든 데이터 형식에 대한 기본 제공 키워드 바인딩이 있습니다. Azure Databricks는 데이터와 테이블을 읽고 쓰기 위한 기본 프로토콜로 Delta Lake를 사용하는 반면 Apache Spark는 Parquet를 사용합니다. 다음 섹션에서는 Azure Databricks에서 각 데이터 형식을 조회할 때 이용 가능한 옵션과 구성을 설명합니다.
대부분의 형식은 compression 옵션을 통해 쓰기 압축을 지원합니다. 각 포맷에 대한 지원 값은 옵션을 참조하세요DataFrameWriter. 또한 Azure Databricks 여러 형식으로 미리 압축된 파일을 직접 읽을 수 있으며 필요한 경우 Azure Databricks 압축된 파일의 압축을 풀 수 있습니다.
Apache Spark 데이터 원본에 대한 자세한 내용은 제네릭 로드/저장 함수 및 제네릭 파일 원본 옵션을 참조하세요.
오픈 테이블 형식
ACID 트랜잭션, 스키마 진화, 엔진 간 상호운용성을 지원하는 테이블 형식.
| Format | Description |
|---|---|
| 델타 호수 | Azure Databricks에서 데이터와 테이블을 읽고 쓰는 기본 형식입니다. |
| 빙산 | Iceberg 테이블을 읽고 쓰고 외부 Iceberg 엔진과 상호 운용할 수 있습니다. |
| OpenSharing | 오픈 공유 프로토콜을 사용해 공유 테이블과 데이터를 읽습니다. |
열 형식
분석 읽기 성능과 압축에 최적화된 이진 열 형식.
| Format | Description |
|---|---|
| 파켓 | Apache Spark가 기본적으로 사용하는 컬럼 형식이며, 효율적인 압축과 인코딩이 가능합니다. |
| 오크 | 내장된 압축 기능과 경량 인덱스 지원을 갖춘 컬럼 포맷입니다. |
텍스트 기반 형식
유연하거나 진화하는 스키마를 가진 교환, 구성 및 기록을 위한 인간이 읽을 수 있는 형식.
| Format | Description |
|---|---|
| JSON | 다중 줄 레코드 및 스키마 추론 옵션을 포함한 JSON 파일을 읽고 쓸 수 있습니다. |
| CSV | 헤더, 구분자 및 잘못된 형식의 레코드에 대한 옵션을 사용하여 구분자로 분리된 텍스트 파일을 읽고 쓸 수 있습니다. |
| XML | 행 태그와 스키마를 지정하여 XML 파일을 읽고 쓸 수 있습니다. |
| 문자 메시지 | 한 줄씩 또는 한 파일씩 일반 텍스트 파일을 읽고 쓰는 것. |
바이너리 및 특수 형식
바이너리 직렬화 형식과 Azure Databricks 전용 데이터 소스.
| Format | Description |
|---|---|
| Avro | Avro 파일을 읽고 쓰고, 스트리밍에서 Avro로 인코딩된 페이로드를 다룰 수 있습니다. |
| MLflow 실험 | 사용자 지정 mlflow-experiment 키워드를 사용하여 MLflow 실험 실행 데이터를 로드하세요. |
구조화되지 않은 데이터
문서, 이미지, 오디오 및 기타 비구조화 파일을 저장하고 처리하는 형식과 유형.
| Format | Description |
|---|---|
| 비정형 데이터 작업 | 문서, 이미지, 오디오 등 비정형 데이터를 저장, 관리, 처리합니다. |
| 이진 | 이미지 및 기타 비정형 데이터를 포함한 원시 이진 레코드로 파일을 읽습니다. |
| 이미지 | 머신러닝 작업을 위한 이미지 데이터를 로드하세요. Databricks는 이미지를 데이터로 binary 불러올 것을 권장합니다. |
| 파일 |
BINARY 또는 STRING를 사용하는 대신 비정형 파일에 대한 관리되는 참조를 저장합니다. |
| 파일 형식으로 파일 인제스트 | SQL, 테이블 값 함수, 자동 로더를 사용해 비구조화된 파일을 참조로 FILE 테이블에 인징합니다. |
| UDF가 포함된 프로세스 파일 | 파일 바이트를 읽고, 이미지 및 비디오 메타데이터를 추출하며, UDF를 포함한 파생 파일을 생성합니다. |
| FILE 함수 퀵스타트 | Databricks SQL 및 Databricks Runtime에서 FILE 형식과 해당 함수에 대해 알아보세요. |
반구조화된 데이터
호숫가에서 중첩 및 반구조화 데이터를 다루기 위한 패턴과 함수.
| Format | Description |
|---|---|
| 반구조화 데이터 모델 | 반구조화 데이터를 저장할 때 Variant, JSON 문자열, struct, maps 중에서 선택하세요. |
| 변형 | 최적화된 읽기 및 쓰기를 위한 타입을 VARIANT 사용하여 반구조화 데이터를 저장합니다. |
| 복합 데이터 형식 변환 | Apache Spark에서 구조체, 배열, 맵을 다루세요. |
| 상위 순서 함수 | 내장된 고차 함수를 사용하여 배열과 매핑을 변환합니다. |