Podstawowe pojęcia

Lakebase oferuje zestaw funkcji, które pozwalają efektywnie rozwijać, testować i skalować aplikacje bazodanowe do pracy. W tej sekcji przedstawiono podstawowe pojęcia, które odróżniają bazę danych Lakebase od tradycyjnych systemów baz danych.

Architecture

Lakebase odróżnia bezstanowe obliczenia Postgres od trwałej warstwy pamięci masowej, składającej się z sejfów, serwerów stron i chmurowego przechowywania obiektów. Zrozumienie tego podziału wyjaśnia, dlaczego poniższe pojęcia, od natychmiastowych rozgałęzień po skalowanie do zera, działają w taki sposób.

Dowiedz się więcej: Architektura

Projekty

Projekt usługi Lakebase jest kontenerem najwyższego poziomu dla wszystkich zasobów bazy danych. Każdy projekt należy do obszaru roboczego Azure Databricks i zawiera co najmniej jedną gałąz, z których każda ma własne zasoby obliczeniowe i bazy danych.

Project
└── Branch (e.g., production)
    ├── Compute (read-write)
    └── Database (e.g., databricks_postgres)

Dowiedz się więcej: Projekty | Zarządzanie projektami

Autoscaling

Usługa Lakebase automatycznie dostosowuje zasoby obliczeniowe na podstawie wymagań dotyczących obciążeń. W miarę zwiększania lub zmniejszania ruchu aplikacji zasoby obliczeniowe są skalowane w górę lub w dół w skonfigurowanym zakresie bez ręcznej interwencji lub przestoju.

Najważniejsze korzyści:

  • Automatyczne dostosowanie: Zasoby są skalowane na podstawie rzeczywistego zapotrzebowania.
  • Brak przestoju: Skalowanie w skonfigurowanym zakresie odbywa się bez przerywania połączeń. Jednak zmiana minimalnej lub maksymalnej konfiguracji CU może spowodować krótką przerwę w działaniu.
  • Optymalizacja kosztów: Płacisz tylko za zasoby, których rzeczywiście używasz.
  • Spójność wydajności: Utrzymuj wydajność reakcji podczas wzrostów ruchu.

Dowiedz się więcej: Autoskalowanie | — konfigurowanie skalowania automatycznego

Skalowanie do zera

Gdy baza danych jest bezczynna, usługa Lakebase może automatycznie skalować zasoby obliczeniowe w dół do zera, eliminując koszty nieużywanej pojemności. Gdy działanie zostanie wznowione, środowisko obliczeniowe automatycznie skaluje się w górę w ciągu kilku sekund.

Najważniejsze korzyści:

  • Zero bezczynnych kosztów: Brak opłat za zasoby obliczeniowe, gdy baza danych jest nieaktywna.
  • Natychmiastowe wznawianie: Bazy danych są automatycznie wznawiane po korzystaniu z dostępu.
  • Przyjazny dla deweloperów: Idealne rozwiązanie dla środowisk deweloperskich i testowych ze sporadycznym użyciem.
  • Automatyczne zarządzanie: Nie jest wymagana interwencja ręczna.

Dowiedz się więcej: Skalowanie do zera |

Gałęzie bazy danych

Gałęzie bazy danych w usłudze Lakebase działają podobnie do gałęzi usługi Git dla kodu. Możesz tworzyć natychmiastowe, izolowane gałęzie na potrzeby programowania, testowania lub eksperymentowania bez duplikowania danych lub wpływania na środowisko produkcyjne.

Najważniejsze korzyści:

  • Natychmiastowe tworzenie: Gałęzie są tworzone w sekundach przy użyciu technologii kopiowania na zapis.
  • Opłacalne: Tylko zmodyfikowane dane są przechowywane oddzielnie, minimalizując koszty magazynowania.
  • Środowiska izolowane: Bezpieczne testowanie zmian bez wpływu na podstawową bazę danych.
  • Współpracy: Członkowie zespołu mogą pracować nad oddzielnymi gałęziami jednocześnie.

Dowiedz się więcej: Gałęzie bazy danych |

Obliczenia i punkty końcowe

Punkt końcowy usługi Lakebase jest stabilnym punktem połączenia używanym przez aplikację do uzyskania dostępu do bazy danych. Za każdym endpointem jedna lub więcej instancji obliczeniowych odpowiada za przetwarzanie zapytań. Parametry połączenia pozostają takie same nawet podczas skalowania zasobów obliczeniowych lub dodawania wysokiej dostępności.

Gałąź zazwyczaj ma jeden punkt końcowy odczytu i zapisu (podstawowe obliczenia) i opcjonalnie co najmniej jeden punkt końcowy tylko do odczytu (repliki do odczytu).

Dowiedz się więcej: Obliczenia i punkty końcowe | Zarządzaj obliczeniami

architektura pamięci

Usługa Lakebase przechowuje dane w rozproszonej warstwie magazynu, która jest oddzielona od zasobów obliczeniowych. Magazyn jest strefowo nadmiarowy i utrzymuje się niezależnie od stanu obliczeniowego, niezależnie od tego, czy zasoby obliczeniowe są uruchomione, wstrzymane, czy w trybie failover. To rozdzielenie warstwy pamięci masowej umożliwia natychmiastowe tworzenie gałęzi, replik tylko do odczytu oraz skalowanie do zera bez powielania danych.

Najważniejsze korzyści:

  • Pamięć masowa o wysokiej dostępności: Azure Databricks utrzymuje pamięć masową o wysokiej dostępności niezależnie od ustawienia wysokiej dostępności warstwy obliczeniowej.
  • Zachowuje trwałość mimo zmian zasobów obliczeniowych: Pamięć masowa pozostaje dostępna pomimo awarii zasobów obliczeniowych, ich wstrzymania lub zmian konfiguracji.
  • Podstawa działania gałęzi i replik: Błyskawiczne tworzenie gałęzi oraz replik do odczytu opiera się na wielu instancjach obliczeniowych korzystających z tej samej warstwy pamięci masowej.

Dowiedz się więcej: Architektura magazynu

Wysoka dostępność

Wysoka dostępność łączy podstawowe obliczenia odczytu/zapisu z co najmniej jednym pomocniczym wystąpieniem obliczeniowym dystrybuowanym w różnych strefach dostępności. Gdy węzeł podstawowy stanie się niedostępny, usługa Lakebase automatycznie awansuje węzeł pomocniczy do roli podstawowego, a aplikacja będzie działać dalej od ostatnio zatwierdzonej transakcji. Parametry połączenia pozostają bez zmian przez cały czas. Pamięć masowa jest już objęta wysoką dostępnością. Włączenie HA zapewnia nadmiarowość zasobów obliczeniowych na potrzeby automatycznego przełączania awaryjnego.

Najważniejsze korzyści:

  • Automatyczne przełączenie awaryjne: Lakebase automatycznie awansuje pomocniczą instancję obliczeniową bez ręcznej interwencji.
  • Brak utraty danych: Tryb failover zachowuje wszystkie zatwierdzone transakcje.
  • Stabilne parametry połączenia: Aplikacja nie musi zmieniać konfiguracji połączenia po przejściu w tryb failover.

Dowiedz się więcej: Wysoka dostępność |

Repliki do odczytu

Repliki do odczytu to niezależne jednostki obliczeniowe tylko do odczytu, które wykonują operacje odczytu na tych samych danych co podstawowa jednostka odczytu i zapisu. W przeciwieństwie do tradycyjnych replik, repliki odczytu w Lakebase nie kopiują danych. Odczytują z tej samej warstwy pamięci, umożliwiając natychmiastowe tworzenie i eliminując dodatkowe koszty przechowywania.

Najważniejsze korzyści:

  • Skalowanie w poziomie: Dystrybuuj żądania odczytu między wieloma replikami.
  • Brak duplikowania danych: Wszystkie repliki odczytane z tego samego magazynu.
  • Natychmiastowe tworzenie: Dostępne w sekundach bez kopiowania danych.
  • Opłacalne: Brak dodatkowych kosztów magazynowania oraz skalowanie automatyczne i obsługa skalowania do zera.

Dowiedz się więcej: Repliki do odczytu | Zarządzaj replikami do odczytu

Jak współpracują ze sobą

Te podstawowe pojęcia współpracują ze sobą, aby utworzyć zaawansowaną i elastyczną platformę bazy danych:

  1. Projekty organizują wszystkie zasoby bazy danych i należą do obszaru roboczego Azure Databricks.
  2. Skalowanie automatyczne zapewnia, że każda gałąź ma odpowiednią ilość zasobów obliczeniowych na podstawie zapotrzebowania.
  3. Skalowanie do zera zmniejsza koszty w bezczynnych gałęziach, zawieszając obliczenia, gdy nie są używane.
  4. Gałęzie bazy danych umożliwiają tworzenie izolowanych środowisk na potrzeby programowania i testowania bez duplikowania danych.
  5. Obliczenia i punkty końcowe zapewniają stabilne punkty połączenia podczas skalowania lub ponownego konfigurowania infrastruktury.
  6. Architektura pamięci masowej zapewnia nadmiarowość strefową i wysoką dostępność danych, niezależnie od stanu warstwy obliczeniowej.
  7. Wysoka dostępność zapewnia nadmiarowość na poziomie zasobów obliczeniowych oraz automatyczne przełączanie awaryjne między strefami dostępności dla obciążeń produkcyjnych.
  8. Repliki do odczytu rozkładają ruch odczytu na dodatkowe instancje obliczeniowe.

Ta architektura umożliwia tworzenie i skalowanie aplikacji baz danych z większą elastycznością, niższymi kosztami i mniejszym obciążeniem operacyjnym niż tradycyjne systemy baz danych.