스토리지 아키텍처

Lakebase는 스토리지를 컴퓨팅과 분리합니다. 데이터베이스 데이터는 쿼리를 실행하는 컴퓨팅 인스턴스와 관계없이 Databricks 관리 분산 스토리지 계층에 있습니다. 스토리지는 컴퓨팅이 실행 중인지, 일시 중지되었는지 또는 크기 조정 중인지에 관계없이 고가용성을 유지하고 유지합니다.

세이프키퍼와 페이지서버 등 컴퓨팅 및 스토리지 계층이 어떻게 함께 작동하는지에 대한 개요는 Lakebase 아키텍처를 참조하세요.

Databricks 관리형 클라우드 개체 스토리지에 유지되는 영역 중복 분산 스토리지에 대한 컴퓨팅 연결을 보여 주는 스토리지 아키텍처입니다.

비고

Azure Lakebase는 클라우드 개체 스토리지 계층으로 Azure Blob Storage 데이터를 유지합니다. 지역에 따라 스토리지는 LRS(로컬 중복 스토리지) 또는 ZRS(영역 중복 스토리지)를 사용합니다. LRS는 단일 데이터 센터 내의 여러 복사본에 걸쳐 데이터를 복제하여 지역 내에서 높은 내구성을 제공합니다. ZRS는 여러 가용성 영역에서 데이터를 복제합니다. Databricks는 스토리지 중복 계층을 관리합니다. 고객이 구성할 수 없습니다.

스토리지 계층

Lakebase는 분산 스토리지 아키텍처를 사용합니다. 데이터베이스의 신뢰할 수 있는 상태를 보유하는 컴퓨터는 하나도 없습니다. Lakebase는 또한 데이터브릭이 관리하는 클라우드 객체 저장소에 데이터를 보존하며, 이는 전체 스토리지 계층의 내구성 기반입니다. 클라우드 객체 스토리지는 매우 높은 내구성을 위해 설계되었으며 비동기 복제에 의존하지 않기 때문에 복제 지연이 내구성에 영향을 주지 않습니다. Azure Databricks 스토리지 중복 구성을 관리합니다.

Azure Lakebase는 클라우드 개체 스토리지 계층으로 Azure Blob Storage 데이터를 유지합니다.

스토리지 중복성은 컴퓨팅 HA와 독립적입니다.

Azure Databricks는 고가용성(HA) 컴퓨트 설정과 독립적으로 Lakebase 스토리지 중복성과 가용성을 관리합니다. HA를 사용하거나 사용하지 않도록 설정해도 스토리지 중복성에는 영향을 주지 않습니다.

고가용성이 컴퓨팅 계층 기능입니다. 자동 장애 조치(failover)를 위해 별도의 가용성 영역에 보조 컴퓨팅 인스턴스를 미리 프로비전합니다. 스토리지 중복성 및 컴퓨팅 HA는 독립적인 계층입니다.

특성 스토리지 이중화 HA(고가용성) 컴퓨팅
필수 Yes No
고객 구성 가능 No Yes
보호되는 항목 데이터 내구성 및 가용성 쿼리를 실행하는 기능

스토리지 중복성을 보여 주는 나란히 비교는 컴퓨팅 HA를 사용하지 않도록 설정했는지 또는 사용하도록 설정되었는지에 관계없이 변경되지 않습니다.

스토리지 분리를 통해 다른 기능을 사용하는 방법

컴퓨팅에서 스토리지를 분리하면 다음과 같은 여러 Lakebase 기능을 사용할 수 있습니다.

  • 데이터 손실 0(RPO = 0): Lakebase는 저장 계층 내 모든 커밋된 트랜잭션을 확인하기 전에 지속적으로 기록하기 때문에, 컴퓨트가 실패하거나 재시작, 0으로 확장되거나 페일오버될 때 커밋된 데이터를 잃지 않습니다.
  • 인스턴트 분기: Lakebase는 공유 스토리지에 대해 쓰기 복사를 사용하여 분기를 만듭니다. 이 프로세스는 데이터를 복제하지 않습니다.
  • 읽기 복제본: 여러 컴퓨팅 인스턴스가 동일한 공유 스토리지 계층에서 읽습니다. 이 방법을 사용하려면 데이터 복제가 필요하지 않습니다.
  • 0으로 크기 조정: 컴퓨팅은 일시 중지되지만 스토리지는 유지됩니다. 컴퓨팅이 다시 시작될 때 데이터를 즉시 사용할 수 있습니다.
  • 빠른 장애 조치( failover): 스토리지는 컴퓨팅과 별개이므로 장애 조치(failover)에는 데이터 이동이 포함되지 않습니다. Lakebase는 기존 스토리지에 연결하는 보조 컴퓨팅 인스턴스를 승격합니다.
  • 고가용성: 여러 가용성 영역에 걸쳐 자동 장애 조치를 지원하도록 컴퓨팅 계층의 이중화를 구성합니다. 고가용성을 참조하세요.
  • 고가용성 관리: 엔드포인트에서 HA 컴퓨팅 설정을 사용하도록 설정하고 구성합니다. 고가용성 관리를 참조하세요.
  • 데이터베이스 브랜치: 브랜치가 쓰기 시 복사 스토리지를 사용해 즉시 격리된 환경을 생성하는 방식을 알아보세요. 브랜치를 참조하세요.
  • 읽기 복제본: 데이터 복제 없이 동일한 스토리지 계층에서 읽은 읽기 전용 컴퓨팅 인스턴스를 추가합니다. 읽기 복제본을 참조하세요.