Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Lakebase memisahkan penyimpanan dari komputasi. Data database Anda berada di lapisan penyimpanan terdistribusi yang dikelola Databricks, terlepas dari instans komputasi yang menjalankan kueri Anda. Penyimpanan tetap tersimpan dan memiliki ketersediaan tinggi, baik saat komputasi Anda berjalan, dijeda, maupun diskalakan.
Untuk gambaran umum bagaimana lapisan komputasi dan penyimpanan bekerja bersama, termasuk safekeeper dan pageserver, lihat Arsitektur Lakebase.
Note
Pada Azure, Lakebase menyimpan data ke Azure Blob Storage sebagai lapisan penyimpanan objek cloud. Bergantung pada wilayahnya, penyimpanan menggunakan penyimpanan redundan lokal (LRS) atau penyimpanan redundan zona (ZRS). LRS mereplikasi data di beberapa salinan dalam satu pusat data, memberikan durabilitas tinggi dalam wilayah tersebut. ZRS mereplikasi data di beberapa zona ketersediaan. Databricks mengelola tingkat redundansi penyimpanan. Ini tidak dapat dikonfigurasi oleh pelanggan.
Lapisan penyimpanan
Lakebase menggunakan arsitektur penyimpanan terdistribusi. Tidak ada satu mesin pun yang memegang status otoritatif database Anda. Lakebase juga menyimpan data ke penyimpanan objek cloud yang dikelola Databricks, fondasi daya tahan untuk seluruh lapisan penyimpanan. Cloud object storage dirancang untuk daya tahan yang sangat tinggi dan tidak bergantung pada replikasi asinkron, sehingga delay replikasi tidak memengaruhi daya tahan. Azure Databricks mengelola konfigurasi redundansi penyimpanan.
Pada Azure, Lakebase menyimpan data ke Azure Blob Storage sebagai lapisan penyimpanan objek cloud.
Redundansi penyimpanan tidak bergantung pada HA komputasi
Azure Databricks mengelola redundansi penyimpanan Lakebase, dan ketersediaan secara independen dari pengaturan komputasi high availability (HA). Mengaktifkan atau menonaktifkan HA tidak memengaruhi redundansi penyimpanan.
Ketersediaan tinggi adalah fitur lapisan komputasi. Menyediakan sebelumnya instans komputasi sekunder di zona ketersediaan yang terpisah untuk pengalihan otomatis saat terjadi kegagalan. Redundansi penyimpanan dan HA komputasi adalah lapisan yang terpisah.
| Karakteristik | Redundansi penyimpanan | Menghitung ketersediaan tinggi (HA) |
|---|---|---|
| Mandatory | Yes | No |
| Dapat dikonfigurasi pelanggan | No | Yes |
| Apa yang dilindunginya | Durabilitas dan ketersediaan data | Kemampuan untuk menjalankan kueri |
Bagaimana pemisahan penyimpanan memungkinkan fitur lain
Pemisahan penyimpanan dari komputasi memungkinkan beberapa fitur Lakebase:
- Kehilangan data nol (RPO = 0): Karena Lakebase secara permanen merekam setiap transaksi yang dikomitmenkan di lapisan penyimpanan sebelum mengakuinya, Anda tidak kehilangan data yang dikomitmenkan saat komputasi gagal, di-restart, diskalakan menjadi nol, atau gagal.
- Cabang instan: Lakebase membuat cabang dengan mekanisme copy-on-write pada penyimpanan bersama. Proses ini tidak menduplikasi data.
- Replika baca: Beberapa instans komputasi membaca dari lapisan penyimpanan bersama yang sama. Pendekatan ini tidak memerlukan replikasi data.
- Skala-ke-nol: Komputasi berhenti sementara, tetapi penyimpanan tetap ada. Data segera tersedia saat komputasi dilanjutkan.
- Failover cepat: Karena penyimpanan terpisah dari komputasi, failover tidak melibatkan pemindahan data. Lakebase mempromosikan instans komputasi sekunder, yang terhubung ke penyimpanan yang ada.
Informasi terkait
- Ketersediaan tinggi: Konfigurasikan redundansi tingkat komputasi untuk failover otomatis di seluruh zona ketersediaan. Lihat Ketersediaan tinggi.
- Mengelola ketersediaan tinggi: Aktifkan dan konfigurasikan pengaturan komputasi HA di titik akhir Anda. Lihat Mengelola ketersediaan tinggi.
- Cabang basis data: Pelajari cara cabang menggunakan penyimpanan salin-saat-tulis (copy-on-write) untuk membuat lingkungan yang terisolasi secara instan. Lihat Cabang.
- Replika baca: Tambahkan instans komputasi baca-saja yang membaca dari lapisan penyimpanan yang sama tanpa replikasi data. Lihat Membaca replika.