Arquitetura de armazenamento

O Lakebase separa o armazenamento da computação. Os dados do banco de dados residem em uma camada de armazenamento distribuído gerenciada pelo Databricks, independentemente das instâncias de computação que executam suas consultas. O armazenamento persiste e continua altamente disponível, esteja sua capacidade computacional em execução, pausada ou sendo escalada.

Para uma visão geral de como as camadas de computação e armazenamento funcionam juntas, incluindo safekeepers e pageservers, veja Lakebase architecture.

Arquitetura de armazenamento mostrando a computação se conectando ao armazenamento distribuído com redundância de zona, que persiste no armazenamento de objetos de nuvem gerenciado pelo Databricks.

Note

Em Azure, o Lakebase persiste os dados para Armazenamento de Blobs do Azure como a camada de armazenamento de objetos de nuvem. Dependendo da região, o armazenamento usa LRS (armazenamento com redundância local) ou ZRS (armazenamento com redundância de zona). O LRS replica dados em várias cópias em um único datacenter, fornecendo alta durabilidade dentro da região. O ZRS replica dados em várias zonas de disponibilidade. O Databricks gerencia a camada de redundância de armazenamento. Não é configurável pelo cliente.

Camada de armazenamento

O Lakebase usa uma arquitetura de armazenamento distribuído. Nenhum computador único contém o estado autoritativo do banco de dados. A Lakebase também persiste dados para armazenamento de objetos em nuvem gerenciado pelo Databricks, a base de durabilidade de toda a camada de armazenamento. O armazenamento de objetos na nuvem é projetado para durabilidade extremamente alta e não depende da replicação assíncrona, então o atraso de replicação não afeta a durabilidade. Azure Databricks gerencia a configuração de redundância de armazenamento.

Em Azure, o Lakebase persiste os dados para Armazenamento de Blobs do Azure como a camada de armazenamento de objetos de nuvem.

A redundância de armazenamento é independente da HA de computação

O Azure Databricks gerencia a redundância e disponibilidade do armazenamento Lakebase independentemente da configuração de computação de alta disponibilidade (HA). Habilitar ou desabilitar a HA não afeta a redundância de armazenamento.

A alta disponibilidade é uma funcionalidade da camada de processamento. Ele provisiona previamente uma instância de computação secundária em uma zona de disponibilidade separada para failover automático. Redundância de armazenamento e HA de computação são camadas independentes.

Característica Redundância de armazenamento Alta disponibilidade de computação (HA)
Obrigatório Sim No
Configurável pelo cliente No Sim
O que ele protege Durabilidade e disponibilidade de dados Capacidade de executar consultas

A comparação lado a lado mostrando a redundância de armazenamento não muda se a HA de computação está desabilitada ou habilitada.

Como a separação de armazenamento habilita outros recursos

A separação do armazenamento da computação permite vários recursos do Lakebase:

  • Perda de dados zero (RPO = 0): Como o Lakebase registra permanentemente todas as transações comprometidas na camada de armazenamento antes de reconhecê-las, você não perde nenhum dado comprometido quando o processamento falha, reinicia, escala até zero ou faz failover.
  • Ramificações instantâneas: O Lakebase cria ramificações usando cópia por gravação em armazenamento compartilhado. O processo não duplica nenhum dado.
  • Réplicas de leitura: Múltiplas instâncias de computação leem da mesma camada de armazenamento compartilhado. Essa abordagem não requer replicação de dados.
  • Escala para zero: A computação pausa, mas o armazenamento persiste. Os dados ficam imediatamente disponíveis quando a computação é retomada.
  • Failover rápido: Como o armazenamento é separado da computação, o failover não envolve a movimentação de dados. O Lakebase promove uma instância de computação secundária, que se conecta ao armazenamento existente.
  • Alta disponibilidade: Configure a redundância no nível de computação para failover automático entre zonas de disponibilidade. Consulte Alta disponibilidade.
  • Gerenciar alta disponibilidade: Habilite e defina a configuração de computação de HA em seu ponto de extremidade. Consulte Gerenciar alta disponibilidade.
  • Ramificações de banco de dados: Saiba como as ramificações usam o armazenamento com cópia por gravação para criar ambientes instantâneos e isolados. Consulte Branches.
  • Réplicas de leitura: Adicione instâncias de computação somente para leitura que leem da mesma camada de armazenamento, sem necessidade de replicação de dados. Consulte réplicas de leitura.