Arquitetura de armazenamento

O Lakebase separa o armazenamento do computo. Os dados da sua base de dados vivem numa camada de armazenamento distribuído gerida pela Databricks, independente das instâncias de computação que executam as suas consultas. O armazenamento persiste e permanece altamente disponível, quer o seu cálculo esteja a correr, pausado ou a escalar.

Para uma visão geral de como as camadas de computação e armazenamento funcionam em conjunto, incluindo safekeepers e pageservers, veja arquitetura Lakebase.

Arquitetura de armazenamento que mostra computação ligada a armazenamento distribuído redundante por zona, que persiste no armazenamento de objetos na nuvem gerido pelo Databricks.

Note

No Azure, o Lakebase armazena os dados no Armazenamento de Blobs do Azure como camada de armazenamento de objetos na cloud. Dependendo da região, o armazenamento utiliza armazenamento localmente redundante (LRS) ou armazenamento redundante por zonas (ZRS). O LRS replica dados em várias cópias dentro de um único centro de dados, proporcionando elevada durabilidade dentro da região. O ZRS replica dados em múltiplas zonas de disponibilidade. O Databricks gere a camada de redundância de armazenamento. Não é configurável pelo cliente.

Camada de armazenamento

O Lakebase utiliza uma arquitetura de armazenamento distribuído. Nenhuma máquina isolada detém o estado autoritativo da sua base de dados. O Lakebase também mantém dados para armazenamento de objetos na cloud gerido pela Databricks, a base de durabilidade de toda a camada de armazenamento. O armazenamento de objetos na cloud foi concebido para uma durabilidade extremamente elevada e não depende da replicação assíncrona, pelo que o atraso de replicação não afeta a durabilidade. Azure Databricks administra a configuração de redundância de armazenamento.

No Azure, o Lakebase armazena os dados no Armazenamento de Blobs do Azure como camada de armazenamento de objetos na cloud.

A redundância de armazenamento é independente do HA de computação

O Azure Databricks gere a redundância e disponibilidade do armazenamento Lakebase independentemente da configuração de computação de alta disponibilidade (HA). Ativar ou desativar o HA não afeta a redundância de armazenamento.

A alta disponibilidade é uma funcionalidade da camada de computação. Pré-prevê uma instância de computação secundária numa zona de disponibilidade separada para failover automático. Redundância de armazenamento e HA de computação são camadas independentes.

Característica Redundância de armazenamento Computação de alta disponibilidade (HA)
Mandatory Yes No
Configurável pelo cliente No Yes
O que protege Durabilidade e disponibilidade dos dados Capacidade de executar consultas

Comparação lado a lado mostrando que a redundância do armazenamento permanece inalterada, quer o compute HA esteja desativado ou ativado.

Como a separação de armazenamento permite outras funcionalidades

A separação do armazenamento da computação permite várias funcionalidades do Lakebase:

  • Perda de dados zero (RPO = 0): Como o Lakebase regista permanentemente todas as transações comprometidas na camada de armazenamento antes de as reconhecer, não perdes dados comprometidos quando o cálculo falha, reinicia, escala até zero ou faz failover.
  • Ramificações instantâneas: O Lakebase cria ramificações através de cópia na escrita sobre armazenamento partilhado. O processo não duplica dados.
  • Réplicas de leitura: Múltiplas instâncias de computação leem a partir da mesma camada de armazenamento partilhada. Esta abordagem não requer replicação de dados.
  • Escala para zero: O cálculo pausa, mas o armazenamento persiste. Os dados estão imediatamente disponíveis quando o processo de computação é retomado.
  • Failover rápido: Como o armazenamento é separado da computação, o failover não envolve mover dados. O Lakebase promove uma instância de computação secundária, que se liga ao armazenamento existente.
  • Alta disponibilidade: Configure redundância ao nível de computação para failover automático entre zonas de disponibilidade. Ver Alta disponibilidade.
  • Gerir a alta disponibilidade: Ativa e configura a definição de computação do HA no teu endpoint. Veja Gerir a alta disponibilidade.
  • Ramificações da base de dados: Saiba como as ramificações usam armazenamento com cópia na escrita para criar ambientes isolados de forma instantânea. Ver Ramificações.
  • Réplicas de leitura: Adicione instâncias de computação só de leitura que leem da mesma camada de armazenamento sem replicação de dados. Ver Ler réplicas.