Architecture de stockage

Lakebase sépare le stockage du calcul. Vos données de base de données se trouvent dans une couche de stockage distribuée managée par Databricks, indépendamment des instances de calcul qui exécutent vos requêtes. Le stockage persiste et reste hautement disponible, que votre calcul soit en cours d’exécution, suspendu ou mis à l’échelle.

Architecture de stockage montrant les ressources de calcul connectées à un stockage distribué redondant entre zones, avec persistance dans le stockage d’objets cloud géré par Databricks.

Remarque

Sur Azure, Lakebase conserve les données à Stockage Blob Azure en tant que couche de stockage d’objets cloud. Selon la région, le stockage utilise le stockage localement redondant (LRS) ou le stockage redondant interzone (ZRS). LRS réplique les données entre plusieurs copies au sein d’un seul centre de données, offrant une durabilité élevée dans la région. ZRS réplique les données entre plusieurs zones de disponibilité. Databricks gère le niveau de redondance du stockage. Il n’est pas configurable par le client.

Couche de stockage

Lakebase utilise une architecture de stockage distribuée. Aucun ordinateur unique ne contient l’état faisant autorité de votre base de données. Les données sont également conservées dans le stockage d’objets cloud gérés par Databricks, la base de durabilité de l’ensemble de la couche de stockage. Le stockage d’objets cloud est conçu pour une durabilité extrêmement élevée et ne s’appuie pas sur la réplication asynchrone, de sorte que la durabilité n’est pas affectée par le décalage de réplication. Azure Databricks gère la configuration de redondance du stockage.

Sur Azure, Lakebase conserve les données à Stockage Blob Azure en tant que couche de stockage d’objets cloud.

La redondance du stockage est indépendante de la haute disponibilité de calcul

La redondance et la disponibilité du stockage Lakebase sont gérées par Azure Databricks et sont indépendantes du paramètre de calcul haute disponibilité (HA). L’activation ou la désactivation de la haute disponibilité n’affecte pas la redondance du stockage.

La haute disponibilité est une fonctionnalité de couche de calcul. Il préconfigure une instance de calcul secondaire dans une zone de disponibilité distincte pour le basculement automatique. La redondance de stockage et la haute disponibilité de calcul sont des couches indépendantes.

Caractéristique Redondance du stockage Haute disponibilité informatique
Obligatoire Yes No
Configurable par le client No Yes
Ce qu’il protège Durabilité et disponibilité des données Possibilité d’exécuter des requêtes

La comparaison côte à côte montrant la redondance du stockage est inchangée si la haute disponibilité de calcul est désactivée ou activée.

Comment la séparation du stockage active d’autres fonctionnalités

La séparation du stockage du calcul permet plusieurs fonctionnalités Lakebase :

  • Perte de données nulle (RPO = 0) : Étant donné que chaque transaction validée est durablement conservée dans le stockage d’objets cloud avant qu’elle ne soit reconnue, aucune donnée validée n’est perdue lorsque le calcul échoue, redémarre, s’adapte à zéro ou bascule.
  • Branches instantanées : Lakebase crée des branches à l’aide de la copie en écriture sur le stockage partagé. Le processus ne duplique aucune donnée.
  • Réplicas en lecture : plusieurs instances de calcul lisent depuis une même couche de stockage partagée. Cette approche ne nécessite aucune réplication de données.
  • Mise à l’échelle jusqu’à zéro : Le calcul est mis en pause, mais le stockage reste disponible. Les données sont immédiatement disponibles lorsque le calcul reprend.
  • Basculement rapide : Étant donné que le stockage est distinct du calcul, le basculement n’implique pas le déplacement de données. Lakebase promeut une instance de calcul secondaire, qui se connecte au stockage existant.
  • Haute disponibilité : Configurez la redondance au niveau du calcul pour le basculement automatique entre les zones de disponibilité. Consultez La haute disponibilité.
  • Gérer la haute disponibilité : Activez et configurez le paramètre de calcul haute disponibilité sur votre point de terminaison. Consultez Gérer la haute disponibilité.
  • Branches de base de données : Découvrez comment les branches utilisent le stockage de copie en écriture pour créer des environnements isolés instantanés. Voir Branches.
  • Réplicas en lecture : ajoutez des instances de calcul en lecture seule qui lisent à partir de la même couche de stockage sans réplication de données. Consultez la section Réplicas en lecture.