Concepts de base

Lakebase repose sur un ensemble de fonctionnalités qui vous permettent de développer, tester et mettre à l’échelle efficacement vos applications de base de données. Cette section présente les concepts fondamentaux qui différencient Lakebase des systèmes de base de données traditionnels.

Projets

Un projet Lakebase est le conteneur de niveau supérieur pour toutes vos ressources de base de données. Chaque projet appartient à un espace de travail Azure Databricks et contient une ou plusieurs branches, chacune avec ses propres bases de données et calcul.

Project
└── Branch (e.g., production)
    ├── Compute (read-write)
    └── Database (e.g., databricks_postgres)

En savoir plus : Projets | gérer des projets

Autoscaling

Lakebase ajuste automatiquement les ressources de calcul en fonction des demandes de votre charge de travail. À mesure que le trafic de votre application augmente ou diminue, les ressources de calcul augmentent ou diminuent au sein de votre plage configurée sans intervention manuelle ni temps d’arrêt.

Principaux avantages :

  • Ajustement automatique : Les ressources sont mises à l’échelle en fonction de la demande réelle.
  • Aucun temps d’arrêt : La mise à l’échelle au sein de votre plage configurée se produit sans interrompre les connexions. Toutefois, la modification de la configuration de cu minimale ou maximale peut entraîner une brève interruption.
  • Optimisation des coûts : Payez uniquement pour les ressources que vous utilisez réellement.
  • Cohérence des performances : Maintenez les performances réactives pendant les pics de trafic.

En savoir plus : Autoscaling | Configuration de la mise à l’échelle automatique

Mise à l'échelle jusqu'à zéro

Lorsque votre base de données est inactive, Lakebase peut mettre automatiquement à l’échelle les ressources de calcul jusqu’à zéro, ce qui élimine les coûts liés à la capacité inutilisée. Lorsque l'activité reprend, vos ressources de calcul augmentent automatiquement leur capacité en quelques secondes.

Principaux avantages :

  • Coûts inactifs zéro : Aucun frais de calcul lorsque votre base de données est inactive.
  • Reprise instantanée : Les bases de données se réveillent automatiquement lorsqu’elles sont consultées.
  • Adapté au développement : Idéal pour le développement et les environnements de préproduction avec une utilisation intermittente.
  • Gestion automatique : Aucune intervention manuelle n’est requise.

En savoir plus : Mettre à l’échelle à zéro | configurer la mise à l'échelle à zéro

Branches de base de données

Les branches de base de données dans Lakebase fonctionnent de la même façon que les branches Git pour votre code. Vous pouvez créer des branches instantanées isolées pour le développement, les tests ou l’expérimentation sans dupliquer des données ou avoir un impact sur votre environnement de production.

Principaux avantages :

  • Création instantanée : Les branches sont créées en secondes à l’aide de la technologie de copie en écriture.
  • Économique : Seules les données modifiées sont stockées séparément, ce qui réduit les coûts de stockage.
  • Environnements isolés : Testez les modifications en toute sécurité sans affecter votre base de données principale.
  • Collaboration: Les membres de l’équipe peuvent travailler simultanément sur des branches distinctes.

En savoir plus : Les branches de base de données | Gérer les branches

Calcul informatique et points d'accès

Un point de terminaison Lakebase est le point de connexion stable que votre application utilise pour atteindre une base de données. Derrière chaque point de terminaison, une ou plusieurs instances de calcul gèrent le traitement des requêtes. Votre chaîne de connexion reste la même, même lorsque vous mettez à l’échelle les ressources de calcul ou activez la haute disponibilité.

Une branche possède généralement un point de terminaison en lecture-écriture (votre instance de calcul principale) et, éventuellement, un ou plusieurs points de terminaison en lecture seule (réplicas en lecture).

En savoir plus : Calculs et points de terminaison | Gérer les calculs

Architecture de stockage

Lakebase stocke les données dans une couche de stockage distribuée distincte du calcul. Le stockage est redondant entre zones et persiste indépendamment de l’état de la ressource de calcul, que celle-ci soit en cours d’exécution, suspendue ou en cours de basculement. Cette dissociation du stockage permet de créer instantanément des branches, des répliques de lecture et une mise à l’échelle jusqu’à zéro, sans duplication des données.

Principaux avantages :

  • Stockage hautement disponible : Azure Databricks assure un stockage hautement disponible indépendamment de votre paramètre de haute disponibilité du calcul.
  • Persiste malgré les changements de ressources de calcul : Le stockage reste disponible malgré les défaillances des ressources de calcul, les pauses ou les modifications de configuration.
  • Fondation pour les branches et les réplicas : La création de branche instantanée et les réplicas en lecture s’appuient sur plusieurs instances de calcul partageant la même couche de stockage.

En savoir plus : Architecture de stockage

Haute disponibilité

La haute disponibilité associe un calcul en lecture/écriture principal avec une ou plusieurs instances de calcul secondaires réparties entre les zones de disponibilité. Lorsque le serveur principal devient indisponible, Lakebase promeut automatiquement une instance secondaire et votre application continue à partir de la dernière transaction validée. Votre chaîne de connexion reste inchangée. Le stockage est déjà hautement disponible. L’activation de HA ajoute une redondance au niveau des ressources de calcul pour le basculement automatique.

Principaux avantages :

  • Basculement automatique : Lakebase promeut une instance de calcul secondaire sans intervention manuelle.
  • Aucune perte de données : Le basculement conserve toutes les transactions validées.
  • Chaînes de connexion stables : Votre application n’a pas besoin de modifier sa configuration de connexion après un basculement.

En savoir plus : Haute disponibilité |

Réplicas en lecture

Les réplicas en lecture sont des instances de calcul en lecture seule indépendantes qui effectuent des opérations de lecture sur les mêmes données que votre instance de calcul principale en lecture-écriture. Contrairement aux réplicas traditionnels, les réplicas en lecture Lakebase ne dupliquent pas les données : ils lisent à partir de la même couche de stockage, ce qui permet une création immédiate et élimine les coûts de stockage supplémentaires.

Principaux avantages :

  • Mise à l’échelle horizontale : Distribuer des demandes de lecture sur plusieurs répliques.
  • Aucune duplication de données : Tous les réplicas lisent à partir du même stockage.
  • Création instantanée : Disponible en secondes sans copie de données.
  • Économique : Aucun coût de stockage supplémentaire, ainsi que la mise à l’échelle automatique et la prise en charge de la mise à l’échelle à zéro.

En savoir plus : Réplicas en lecture | Gérer les réplicas en lecture

Comment ils travaillent ensemble

Ces concepts fondamentaux fonctionnent ensemble pour créer une plateforme de base de données puissante et flexible :

  1. Les projets organisent toutes vos ressources de base de données et appartiennent à un espace de travail Azure Databricks.
  2. La mise à l’échelle automatique garantit que chaque branche a la bonne quantité de calcul en fonction de la demande.
  3. La mise à l’échelle à zéro réduit les coûts sur les branches inactives en suspendant le calcul lorsqu’elle n’est pas utilisée.
  4. Les branches de base de données vous permettent de créer des environnements isolés pour le développement et les tests sans dupliquer les données.
  5. Les ressources de calcul et les points de terminaison fournissent des points de connexion stables à mesure que vous faites évoluer ou reconfigurez votre infrastructure.
  6. L’architecture de stockage conserve votre espace de données redondante et hautement disponible, indépendamment de l’état de calcul.
  7. La haute disponibilité ajoute la redondance au niveau du calcul et le basculement automatique entre les zones de disponibilité pour les charges de travail de production.
  8. Les réplicas en lecture répartissent le trafic de lecture sur des instances de calcul supplémentaires.

Cette architecture vous permet de créer et de mettre à l’échelle des applications de base de données avec plus de flexibilité, de réduire les coûts et de réduire la surcharge opérationnelle que les systèmes de base de données traditionnels.