Arsitektur penyimpanan

Lakebase memisahkan penyimpanan dari komputasi. Data database Anda berada di lapisan penyimpanan terdistribusi yang dikelola Databricks, terlepas dari instans komputasi yang menjalankan kueri Anda. Penyimpanan tetap tersimpan dan memiliki ketersediaan tinggi, baik saat komputasi Anda berjalan, dijeda, maupun diskalakan.

Untuk gambaran umum bagaimana lapisan komputasi dan penyimpanan bekerja bersama, termasuk safekeeper dan pageserver, lihat Arsitektur Lakebase.

Arsitektur penyimpanan yang menunjukkan komputasi yang terhubung ke penyimpanan terdistribusi redundan zona, yang disimpan secara persisten di penyimpanan objek cloud yang dikelola Databricks.

Note

Pada Azure, Lakebase menyimpan data ke Azure Blob Storage sebagai lapisan penyimpanan objek cloud. Bergantung pada wilayahnya, penyimpanan menggunakan penyimpanan redundan lokal (LRS) atau penyimpanan redundan zona (ZRS). LRS mereplikasi data di beberapa salinan dalam satu pusat data, memberikan durabilitas tinggi dalam wilayah tersebut. ZRS mereplikasi data di beberapa zona ketersediaan. Databricks mengelola tingkat redundansi penyimpanan. Ini tidak dapat dikonfigurasi oleh pelanggan.

Lapisan penyimpanan

Lakebase menggunakan arsitektur penyimpanan terdistribusi. Tidak ada satu mesin pun yang memegang status otoritatif database Anda. Lakebase juga menyimpan data ke penyimpanan objek cloud yang dikelola Databricks, fondasi daya tahan untuk seluruh lapisan penyimpanan. Cloud object storage dirancang untuk daya tahan yang sangat tinggi dan tidak bergantung pada replikasi asinkron, sehingga delay replikasi tidak memengaruhi daya tahan. Azure Databricks mengelola konfigurasi redundansi penyimpanan.

Pada Azure, Lakebase menyimpan data ke Azure Blob Storage sebagai lapisan penyimpanan objek cloud.

Redundansi penyimpanan tidak bergantung pada HA komputasi

Azure Databricks mengelola redundansi penyimpanan Lakebase, dan ketersediaan secara independen dari pengaturan komputasi high availability (HA). Mengaktifkan atau menonaktifkan HA tidak memengaruhi redundansi penyimpanan.

Ketersediaan tinggi adalah fitur lapisan komputasi. Menyediakan sebelumnya instans komputasi sekunder di zona ketersediaan yang terpisah untuk pengalihan otomatis saat terjadi kegagalan. Redundansi penyimpanan dan HA komputasi adalah lapisan yang terpisah.

Karakteristik Redundansi penyimpanan Menghitung ketersediaan tinggi (HA)
Mandatory Yes No
Dapat dikonfigurasi pelanggan No Yes
Apa yang dilindunginya Durabilitas dan ketersediaan data Kemampuan untuk menjalankan kueri

Perbandingan berdampingan yang menunjukkan bahwa redundansi penyimpanan tetap sama, baik saat HA komputasi dinonaktifkan maupun diaktifkan.

Bagaimana pemisahan penyimpanan memungkinkan fitur lain

Pemisahan penyimpanan dari komputasi memungkinkan beberapa fitur Lakebase:

  • Kehilangan data nol (RPO = 0): Karena Lakebase secara permanen merekam setiap transaksi yang dikomitmenkan di lapisan penyimpanan sebelum mengakuinya, Anda tidak kehilangan data yang dikomitmenkan saat komputasi gagal, di-restart, diskalakan menjadi nol, atau gagal.
  • Cabang instan: Lakebase membuat cabang dengan mekanisme copy-on-write pada penyimpanan bersama. Proses ini tidak menduplikasi data.
  • Replika baca: Beberapa instans komputasi membaca dari lapisan penyimpanan bersama yang sama. Pendekatan ini tidak memerlukan replikasi data.
  • Skala-ke-nol: Komputasi berhenti sementara, tetapi penyimpanan tetap ada. Data segera tersedia saat komputasi dilanjutkan.
  • Failover cepat: Karena penyimpanan terpisah dari komputasi, failover tidak melibatkan pemindahan data. Lakebase mempromosikan instans komputasi sekunder, yang terhubung ke penyimpanan yang ada.
  • Ketersediaan tinggi: Konfigurasikan redundansi tingkat komputasi untuk failover otomatis di seluruh zona ketersediaan. Lihat Ketersediaan tinggi.
  • Mengelola ketersediaan tinggi: Aktifkan dan konfigurasikan pengaturan komputasi HA di titik akhir Anda. Lihat Mengelola ketersediaan tinggi.
  • Cabang basis data: Pelajari cara cabang menggunakan penyimpanan salin-saat-tulis (copy-on-write) untuk membuat lingkungan yang terisolasi secara instan. Lihat Cabang.
  • Replika baca: Tambahkan instans komputasi baca-saja yang membaca dari lapisan penyimpanan yang sama tanpa replikasi data. Lihat Membaca replika.