Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
O Azure Site Recovery é um serviço de replicação e failover gerenciado para VMs (máquinas virtuais) que mantém cargas de trabalho disponíveis durante interrupções. Ele replica continuamente cargas de trabalho de sites primários para locais secundários e limita a perda de dados e o tempo de inatividade. Durante a manutenção planejada ou interrupções inesperadas, ele orquestra o failover e o failback. Esse serviço dá suporte à recuperação de desastre (DR) para ambientes locais e VMs do Azure, o que ajuda as organizações a manter a continuidade dos negócios.
Quando você usa o Azure, a confiabilidade é uma responsabilidade compartilhada. A Microsoft fornece uma variedade de recursos para dar suporte à resiliência e recuperação. Você é responsável por entender como esses recursos funcionam em todos os serviços que você usa e selecionar os recursos necessários para atender aos seus objetivos de negócios e metas de tempo de atividade.
Este artigo descreve como tornar o Site Recovery resiliente a várias possíveis interrupções e problemas, incluindo falhas transitórias, interrupções de zona de disponibilidade e interrupções de região. Ele também destaca as principais informações sobre o SLA (contrato de nível de serviço) do Site Recovery.
Observação
Este artigo descreve como o serviço do Site Recovery é resiliente ou como você pode torná-lo resiliente a vários problemas. Ele não explica como usar o Site Recovery para proteger suas VMs ou outros ativos. Para obter mais informações, consulte Sobre o Site Recovery.
Recomendações de implantação de produção para confiabilidade
Ao usar o Site Recovery com cargas de trabalho de produção, recomendamos que você execute estas ações:
Implante o cofre de Serviços de Recuperação na região de destino para replicação.
Para a DR do Azure para o Azure, use o recurso de alta rotatividade do Site Recovery para VMs que têm uma alta taxa de alteração de dados. O suporte a alta taxa de rotatividade melhora seu objetivo de recuperação (RPO) e possibilita a replicação para muitas cargas de trabalho de banco de dados de grande escala.
Para a DR do Azure para o Azure, configure a conta de armazenamento em cache para usar o ZRS (armazenamento com redundância de zona).
Realize procedimentos de emulação de falhas regularmente como parte de exercícios de recuperação de desastres. Execute exercícios de recuperação de desastre trimestralmente ou semestralmente para verificar se os processos de replicação e failover estão funcionando corretamente.
Use reservas de capacidade sob demanda para assegurar que os recursos de computação estejam disponíveis na sua região de destino em caso de failover.
Habilitar atualizações automáticas para agentes de mobilidade.
Monitore a integridade da replicação e configure alertas para que você seja notificado se ocorrer um problema.
Visão geral da arquitetura de confiabilidade
Ao usar o Site Recovery, você define uma origem e um destino, que representam as VMs replicadas:
A origem pode ser uma VM do Azure ou uma VM ou servidor de outra fonte com suporte, incluindo servidores físicos locais, VMs VMware e VMs Hyper-V.
O target é sempre uma VM Azure. Para a replicação de VM Azure para Azure, o destino pode ser uma região ou zona de disponibilidade diferente da VM de origem.
Você é responsável por implantar e definir recursos e configurações relacionadas, incluindo:
Recovery Services vault, que Site Recovery usa para armazenar as configurações de replicação. O cofre de dados não armazena dados replicados. A configuração de redundância do cofre não é importante para Site Recovery, mas é importante se você usar o mesmo cofre para Backup do Azure.
Um cofre pode incluir configurações extras, como:
Uma política de replicação, que configura a frequência do instantâneo e o comprimento da retenção.
Um plano de recuperação, que coordena a ordem em que os computadores fazem failover e podem incluir scripts e ações manuais. Os planos de recuperação são especialmente úteis para cargas de trabalho que têm várias camadas, como camadas de aplicativo e banco de dados, que precisam fazer failover em uma ordem específica.
Para replicação de Azure para Azure, uma conta de armazenamento em cache que armazena uma cópia dos dados de origem em sua região antes de serem replicados para o destino. A configuração de redundância da sua conta de armazenamento em cache pode afetar sua confiabilidade durante uma interrupção da zona de disponibilidade.
O diagrama mostra três zonas de disponibilidade. A Zona 1 inclui uma Máquina Virtual (VM). As seções a seguir abrangem todas as três zonas: componentes principais do Site Recovery, o cofre dos Serviços de Recuperação e a conta de armazenamento em cache do ZRS.
Observação
Este guia se concentra na confiabilidade dos componentes baseados no Azure do Site Recovery e na relação de replicação. Se você replicar dados ou VMs de um ambiente local ou de outro provedor de nuvem, considere a confiabilidade dos componentes fora do Azure.
Para obter mais informações sobre os componentes que você implanta, consulte os seguintes artigos:
- Arquitetura de DR do Azure para Azure
- Arquitetura de DR do Hyper-V para o Azure
- Arquitetura de DR do VMware para o Azure
- Arquitetura de DR do servidor físico para o Azure
O serviço de Site Recovery principal é executado na infraestrutura gerenciada pela Microsoft. Este artigo refere-se a esses componentes coletivamente como o serviço principal do Site Recovery.
Resiliência a falhas transitórias
Falhas transitórias são falhas curtas e intermitentes nos componentes. Elas ocorrem com frequência em um ambiente distribuído, como a nuvem, e são uma parte normal das operações. Falhas transitórias se corrigem após um curto período de tempo. É importante que seus aplicativos possam lidar com falhas transitórias, geralmente repetindo solicitações afetadas.
Todos os aplicativos hospedados na nuvem devem seguir as diretrizes transitórias de tratamento de falhas do Azure quando eles se comunicam com qualquer APIs, bancos de dados e outros componentes hospedados na nuvem. Para obter mais informações, confira Recomendações para tratamento de falhas transitórias.
Site Recovery lida automaticamente com falhas transitórias que ocorrem durante o processo de replicação repetindo suas operações. Você não precisa configurar o tratamento de falhas transitórias para o Site Recovery.
Resiliência a falhas de zona de disponibilidade
as zonas Availability são grupos fisicamente separados de datacenters em uma região Azure. Quando uma zona falha, os serviços podem fazer o failover de uma das zonas restantes.
Para entender como a replicação do Site Recovery se comporta durante falhas na zona de disponibilidade, você precisa considerar os seguintes componentes de serviço:
Serviço de Recuperação de Site Principal: O serviço principal do Site Recovery foi projetado para ser resiliente a falhas de zona de disponibilidade em regiões com suporte. Os componentes internos da zona de serviço suportam a redundância de zona de forma automática, sem necessidade de configuração pelo cliente.
Cofre dos Serviços de Recuperação: O cofre armazena dados de configuração. Em regiões em que o Site Recovery dá suporte à resiliência a zonas, os dados de configuração no cofre também são resilientes a zonas.
Conta de armazenamento em cache: Para a replicação do Azure para o Azure, você é responsável por tornar a zona da conta de armazenamento de cache redundante implantando-a usando a camada ZRS.
Se você usar a camada de replicação de armazenamento com redundância local (LRS) do Armazenamento do Azure para sua conta de armazenamento de cache e uma zona falhar, o Site Recovery poderá não replicar os dados alterados recentemente para o destino.
Observação
O Site Recovery pode ajudá-lo a fazer failover entre VMs em diferentes zonas de disponibilidade. Para obter mais informações, consulte Habilitar a DR da VM do Azure entre zonas de disponibilidade.
Requirements
Suporte à região:
Serviço principal de Recuperação de Sites e Cofres de Serviços de Recuperação: O Site Recovery é resiliente a zonas nas regiões a seguir.
Américas Europa Médio Oriente Pacífico Asiático Chile Central Leste da Áustria Israel Central Indonésia Central México Central Norte da Itália Oeste do Japão Oeste dos EUA 3 Polônia Central Oeste da Malásia Espanha Central Norte da Nova Zelândia O Site Recovery está implantando suporte para zonas de disponibilidade em todas as regiões habilitadas para zona de disponibilidade. Em regiões que não estão listadas na tabela anterior como sendo resilientes à zona, falhas de zona podem afetar as operações.
Conta de armazenamento em cache: Você pode implantar uma conta de armazenamento ZRS em todas as regiões habilitadas para zona de disponibilidade.
Custo
Site Recovery é cobrado com base no número de instâncias de VM protegidas, independentemente de sua configuração de zona de disponibilidade. Para obter mais informações, consulte o preço do Site Recovery.
Configurar o suporte à zona de disponibilidade
Core Site Recovery service: Você não configura a resiliência de zona no serviço de Site Recovery principal. A Microsoft fornece resiliência de zona em regiões com suporte.
Se a Microsoft habilitar a resiliência de zona em uma região posteriormente, seus recursos do Site Recovery se beneficiarão automaticamente da resiliência de zona. Você não precisa realizar nenhuma ação.
Cofre dos Serviços de Recuperação: Os cofres dos Serviços de Recuperação têm uma configuração de redundância, mas o Site Recovery não usa a configuração de redundância do cofre. Você não precisa configurar seu cofre para redundância de zona ao usar Site Recovery.
Cache storage account: Quando você usa a replicação de Azure para Azure, você é responsável pela criação da conta de armazenamento de cache e por configurá-la com o nível apropriado de redundância. Para fazer com que a zona seja redundante, configure-a para o tipo de replicação ZRS. Para obter mais informações, consulte Reliability no Armazenamento de Blobs do Azure.
Comportamento quando todas as zonas estão saudáveis
Esta seção descreve o que esperar quando você usa o Site Recovery em uma região com suporte de zona de disponibilidade para o serviço principal, sua conta de armazenamento em cache é configurada para usar o ZRS e todas as zonas de disponibilidade estão operacionais.
Operação entre zonas: O processo de replicação pode usar a infraestrutura em várias zonas de disponibilidade para disparar e executar trabalhos de replicação. O serviço gerencia essa infraestrutura de forma transparente para você.
Replicação de dados entre zonas: Site Recovery e Armazenamento lidam com a replicação de dados das zonas.
Configuração do Site Recovery: O Site Recovery replica os dados de configuração entre zonas, mesmo se você configurar o cofre para usar o LRS.
Conta de armazenamento em cache: Se você configurar sua conta de armazenamento em cache para usar o ZRS, o Armazenamento replicará de forma síncrona os dados armazenados em cache entre zonas.
Comportamento durante uma falha de zona
Esta seção descreve o que esperar quando você usa o Site Recovery em uma região com suporte de zona de disponibilidade para o serviço principal, sua conta de armazenamento em cache é configurada para usar o ZRS e ocorre uma interrupção de zona de disponibilidade.
Observação
Se a zona com falha contiver a VM de origem, você será responsável por realizar o failover para o destino. Para obter mais informações, consulte os seguintes artigos:
- Detection and response: A plataforma Site Recovery detecta automaticamente falhas em uma zona de disponibilidade e inicia uma resposta. Você não precisa iniciar manualmente um failover de zona para o serviço principal do Site Recovery. No entanto, se a interrupção da zona afetar sua VM de origem, talvez seja necessário iniciar o failover da VM.
- Notificação: A Microsoft não notifica você automaticamente quando uma zona está inoperante. No entanto, você pode usar Integridade do Serviço do Azure para entender a integridade geral do serviço, incluindo quaisquer falhas de zona, e pode configurar alertas Service Health para notificar você sobre problemas.
Solicitações ativas: O efeito em trabalhos de replicação ativos depende do tipo de replicação:
A replicação de zona para zona e de região para região de Máquinas Virtuais do Azure: Se a instância de origem ou a de destino estiver em uma zona com falha, a replicação ficará pausada até que ambas as instâncias estejam disponíveis novamente.
Se a zona com falha não contiver a VM de origem ou de destino e você tiver configurado a conta de armazenamento em cache para usar o ZRS, a replicação continuará sendo executada.
On-premises para Azure: Se a instância de destino estiver na zona com falha, a replicação será pausada até que a instância esteja disponível novamente.
Se a zona com falha não contiver a VM de destino, a replicação continuará sendo executada.
Perda de dados esperada: Nenhuma perda de dados é esperada durante uma falha de zona.
Tempo de inatividade esperado: Se a zona com falha contiver a VM de origem ou de destino, a replicação será pausada até que ambas as instâncias estejam disponíveis novamente.
Redistribuição: O Site Recovery e o Armazenamento se adaptam automaticamente a falhas de zona:
Serviço de Recuperação de Site Principal: O serviço principal do Site Recovery usa automaticamente a infraestrutura em zonas de disponibilidade íntegras para executar a replicação. Você não precisa realizar nenhuma ação.
Conta de armazenamento em cache: O armazenamento roteia automaticamente solicitações de dados de cache para zonas íntegras.
Recuperação de zona
Quando a zona de disponibilidade afetada se recupera, o Site Recovery retoma automaticamente os trabalhos de replicação que pausaram durante a interrupção da zona.
Você é responsável por iniciar o failback para servidores ou VMs para os quais você realizou o processo de failover durante a interrupção da zona. Para obter mais informações, consulte os seguintes artigos:
Replicação de zona para zona e região para região de VMs do Azure:Realizar retorno de uma VM do Azure para a região primária
Replicação local para o Azure:
Replicação física para o Azure:arquitetura de DR do servidor físico para o Azure
Replicação do Hyper-V para o Azure:arquitetura de DR do Hyper-V para o Azure
Replicação do VMware para o Azure:sobre failover e failback de DR local
Testar falhas em zonas
A plataforma Site Recovery gerencia a resiliência de zona para seus componentes internos. Esse recurso é totalmente gerenciado, então você não precisa iniciar ou validar processos de falha de zona de disponibilidade.
É importante executar exercícios regulares de recuperação de desastre, que devem testar o failover da VM e os procedimentos gerais de resposta. Projete os treinamentos de recuperação de desastre para evitar impacto no ambiente de produção. Para obter mais informações, consulte os seguintes artigos:
Replicação de zona para zona e região para região de VMs do Azure:Executar uma simulação de DR para VMs do Azure
Replicação local para o Azure:
Replicação física para o Azure:executar um teste de recuperação de desastre no Azure
Replicação do Hyper-V para o Azure:executar um teste de recuperação de desastre no Azure
Replicação do VMware para o Azure:Executar um exercício de recuperação de desastre no Azure
Resiliência a falhas em toda a região
Para a replicação do Azure para o Azure, o Site Recovery fornece resiliência a falhas de região, permitindo o failover de VMs para uma região de destino íntegra. Para obter mais informações, consulte Replicar VMs Azure para outra região Azure.
Considerações
Região do cofre: Você implanta um cofre dos Serviços de Recuperação em uma região específica do Azure selecionada. A região do vault é importante. A replicação continua durante uma interrupção na região de armazenamento. No entanto, você não pode executar operações de gerenciamento do Site Recovery, incluindo failover e failback, até que a região se recupere.
Implantar o cofre na região de destino auxilia a garantir que as operações de failover e recuperação permaneçam disponíveis durante uma interrupção na região de origem. Ele também impede que uma interrupção em uma terceira região afete operações de failover e recuperação.
Observação
Se o cofre estiver na região que você normalmente usa como região de destino, após fazer failover e restabelecer a replicação, essa região se tornará sua nova origem. Se essa região apresentar um problema posteriormente, talvez você não consiga executar o failback até que ambas as regiões estejam íntegras.
Reservas de capacidade: Você é responsável por verificar se sua região de destino dá suporte aos tipos de VM de que você precisa e que ela tem capacidade disponível para sua carga de trabalho. Recomendamos que você use reservas de capacidade sob demanda para garantir que os recursos de computação estejam disponíveis para sua carga de trabalho se ocorrer um failover.
Configurar o suporte a várias regiões
Cofre dos Serviços de Recuperação: Você precisa selecionar a região do cofre. Para obter mais informações, confira as Considerações.
Os cofres dos Serviços de Recuperação têm uma configuração de redundância, mas o Site Recovery não usa a configuração de redundância dos cofres. Você não precisa configurar seu cofre para redundância geográfica ao usar Site Recovery.
Conta de armazenamento em cache: A conta de armazenamento em cache é usada apenas como um local temporário para dados antes de serem replicados, portanto, você não deve configurá-la para usar o GRS (armazenamento com redundância geográfica).
Comportamento durante uma falha de região
O comportamento específico do serviço Site Recovery principal durante uma falha de região depende de qual região experimenta a falha:
Falha na região de origem: Para a replicação do Azure para o Azure, você pode disparar um failover quando a região de origem não estiver disponível.
Como a região de origem não está disponível, a replicação é interrompida até que a VM na região de origem esteja íntegra.
O diagrama mostra a região de origem e a região de destino. Duas falhas são mostradas na VM de origem. Uma seta rotulada com "replicação de Site Recovery" aponta para a região de destino. A região de destino inclui a VM de destino e o cofre dos Serviços de Recuperação.
Falha na região de destino: Como a região de destino não está disponível, a replicação é interrompida e você não pode fazer failover para o destino até que a região esteja íntegra.
O diagrama mostra a região de origem e a região de destino. A região de origem contém a VM de origem. Uma seta rotulada com "replicação de Site Recovery" aponta para a região de destino. Um X indica uma falha de replicação. A região de destino inclui a VM de destino e o cofre dos Serviços de Recuperação. As falhas são indicadas na VM de destino e no cofre dos Serviços de Recuperação.
Falha na região que contém o cofre: Se você implantar o cofre em uma terceira região (não na região de origem ou destino) e essa região apresentar uma falha, o Site Recovery continuará replicando seus dados. No entanto, você não pode iniciar nenhuma operação, incluindo failover ou failback, até que o cofre esteja íntegro.
O diagrama mostra a região de origem, a região de destino e a região do cofre. Uma seta rotulada como replicação do Site Recovery aponta da VM de origem para a VM na região de destino. Uma falha é indicada no cofre dos Serviços de Recuperação. Uma seta rotulada com "failover, failback e outras operações bloqueadas, mas a replicação continua" aponta do cofre de Recuperação de Serviços para a replicação do Site Recovery.
Recuperação de região
Você é responsável por iniciar o failback para servidores ou VMs que você fez failover durante a interrupção na região. Para obter mais informações, consulte os seguintes artigos:
A replicação de zona para zona e região para região de máquinas virtuais do Azure:Voltar as máquinas virtuais do Azure para a região primária
Replicação local para o Azure:
Replicação física para o Azure:arquitetura de DR do servidor físico para o Azure
Replicação do Hyper-V para o Azure:arquitetura de DR do Hyper-V para o Azure
Replicação do VMware para o Azure:failover e failback de DR local
Teste de falhas na região
É importante executar exercícios regulares de recuperação de desastre que testam o failover da VM e os procedimentos gerais de resposta. Projete as simulações de recuperação de desastre para prevenir impacto no ambiente de produção. Para obter mais informações, consulte os seguintes artigos:
Replicação de zona para zona e região para região de VMs do Azure:Executar uma simulação de DR para VMs do Azure
Replicação local para o Azure:
Replicação física para o Azure:executar um teste de recuperação de desastre no Azure
Replicação do Hyper-V para o Azure:executar um teste de recuperação de desastre no Azure
Replicação do VMware para o Azure:Executar um exercício de recuperação de desastre no Azure
Resiliência a problemas de configuração e replicação
Uma solução de recuperação de desastre só é confiável quando você sabe que ela funciona antes de ocorrer um desastre. Monitore o Site Recovery para detectar problemas como erros de configuração ou problemas de integridade de replicação de VM. Para obter mais informações, consulte Monitor Site Recovery.
Recomendamos que você configure alertas do Azure Monitor para que seja informado sobre problemas com a integridade da replicação. Para obter mais informações, consulte alertas integrados do Azure Monitor para Site Recovery.
Resiliência à manutenção do serviço
Azure gerencia automaticamente as atualizações e a manutenção do serviço de Site Recovery principal. As operações de manutenção não exigem tempo de inatividade e não interrompem a replicação de suas VMs e servidores.
No entanto, você é responsável por aplicar atualizações aos componentes do Site Recovery em suas VMs e servidores, incluindo o agente de mobilidade quando necessário.
Importante
É altamente recomendável habilitar atualizações automáticas para agentes. Se a versão do agente ficar mais de quatro versões para trás, a replicação será desativada e a capacidade de recuperação da carga de trabalho será comprometida.
Para obter mais informações, consulte atualizações de serviço no Site Recovery.
Contrato de nível de serviço
O SLA (contrato de nível de serviço) para serviços de Azure descreve a disponibilidade esperada de cada serviço e as condições que sua solução deve atender para atingir essa expectativa de disponibilidade. Para obter mais informações, consulte SLAs para serviços online.
Para o Site Recovery, os SLAs separados abrangem:
Disponibilidade do serviço, o que significa que o Site Recovery está disponível para failover de instâncias protegidas. Uma instância protegida é uma VM ou servidor físico que é replicada para um local secundário. Para ser elegível para este SLA, você deve tentar novamente tentativas de failover que falharam pelo menos a cada 30 minutos.
RTO (objetivo de tempo de recuperação), que é o tempo desde quando você inicia um failover (ou seus scripts iniciam) até quando a VM de destino começa a funcionar. Desta vez, exclui ações manuais ou execução de script.
O SLA fornece créditos de serviço somente quando a região secundária tem capacidade de computação suficiente.