Надежность в Microsoft Fabric

В этой статье описывается поддержка надёжности в Microsoft Fabric, включая региональную устойчивость с зонами доступности, а также межрегиональное восстановление и непрерывность бизнеса. Более подробный обзор надежности в Azure см. в статье "Надежность Azure".

Поддержка зон доступности

Зоны доступности — это физически отдельные группы центров обработки данных в регионе Azure. При сбое одной зоны службы могут переключиться на одну из оставшихся зон.

Fabric использует зоны доступности Azure для защиты элементов Fabric и Power BI от сбоев центра обработки данных. Сервис автоматически распределяет ресурсы Fabric по нескольким зонам без необходимости настройки клиента.

  • Инженерия данных поддерживает зоны доступности, если используется OneLake. Если вы используете другие источники данных, такие как ADLS Gen2, то необходимо убедиться, что зонально-избыточное хранилище (ZRS) включено.

Опыт снижения активности в зоне

Во время сбоя на уровне зоны не требуется никаких действий клиента. Возможности сетевой структуры восстанавливаются и перебалансируются автоматически, чтобы использовать здоровую зону. В некоторых случаях операции в процессе могут потребовать перезапуска. Например, запуск Spark Jobs может провалиться, если основной узел находится в зоне отказа. В таком случае вам нужно повторно подать вакансии. Запросы к хранилищу данных и SQL-аналитике могут не сработать, если фронтенд-узел находится в зоне отказа. В таком случае нужно безопасно перезапустить запрос.

Important

Хотя корпорация Майкрософт стремится обеспечить единую и согласованную поддержку зон доступности, в некоторых случаях сбоя зоны доступности мощности Fabric, расположенные в регионах Azure с более высокими колебаниями спроса клиентов, могут испытывать более высокую, чем обычно, задержку.

Аварийное восстановление между регионами и непрерывность бизнес-процессов

Аварийное восстановление (DR) относится к процедурам, которые организации используют для восстановления после событий значительного воздействия, таких как стихийные бедствия или ошибочные развертывания, которые приводят к простою и потере данных. Независимо от причины, лучшее средство устранения последствий таких событий — это четко очерченный и проверенный план аварийного восстановления. Также важно, чтобы архитектура приложений активно поддерживала аварийное восстановление. Прежде чем приступить к созданию плана аварийного восстановления, ознакомьтесь с рекомендациями по разработке стратегии аварийного восстановления.

Для восстановления после сбоя компания Microsoft использует модель общей ответственности. В этой модели корпорация Майкрософт гарантирует, что доступны базовые инфраструктуры и службы платформы. Однако многие службы Azure не делают автоматической репликации данных и не обеспечивают возврат из вышедшего из строя региона для перекрестной репликации в другой доступный регион. Для этих сервисов вы отвечаете за настройку плана аварийного восстановления, соответствующего вашей рабочей нагрузке. Большинство служб, работающих на платформе Azure как услуга (PaaS), предоставляют функции и рекомендации для поддержки аварийного восстановления. Вы можете использовать специализированные функции для поддержки быстрого восстановления и разработки плана аварийного восстановления.

В этом разделе описывается план аварийного восстановления для Fabric, предназначенный для обеспечения безопасности и доступности данных в организации при возникновении незапланированной региональной катастрофы. План охватывает следующие разделы:

  • Репликация между регионами: Структура предлагает репликацию между регионами для данных, хранящихся в OneLake. Вы можете отказаться от этой функции в зависимости от ваших требований.

  • Доступ к данным после аварии: в региональном сценарии аварии Fabric гарантирует доступ к данным с определенными ограничениями. Хотя создание или изменение элементов ограничено после переключения на резервный ресурс, основное внимание уделяется обеспечению доступности и сохранности существующих данных.

  • Руководство по восстановлению: Fabric предлагает вам набор инструкций, которые помогут пройти процесс восстановления. Структурированное руководство упрощает переход к обычным операциям.

Power BI, которая теперь входит в состав Fabric, имеет надежную систему аварийного восстановления и предлагает следующие функции:

  • BCDR по умолчанию: Если регион образует пару с регионом, который поддерживает Power BI, возможности аварийного восстановления включены по умолчанию. Вам не нужно включать или активировать эту функцию отдельно.

  • Репликация между регионами: Power BI использует геоизбыточную репликацию хранилища Azure и геоизбыточную репликацию SQL Azure, чтобы гарантировать, что экземпляры резервного копирования существуют в других регионах и могут быть использованы. Это означает, что данные дублируются в разных регионах, повышая доступность и уменьшая риски, связанные с региональными сбоями.

  • Продолжающиеся службы и доступ после аварии: даже во время разрушительных событий элементы Power BI остаются доступными в режиме только для чтения. Элементы включают семантические модели, отчеты и панели мониторинга, гарантируя, что предприятия могут продолжать свои процессы анализа и принятия решений без значительных помех.

Дополнительные сведения см. в разделе Вопросы и ответы о высокой доступности, автоматическом переключении при отказе и аварийном восстановлении в Power BI.

Important

Для клиентов, пострадавших в результате стихийного бедствия, чьи основные регионы не имеют парного региона Azure, в котором поддерживается Fabric, возможность использовать емкости Fabric может быть ограничена, даже если данные в этих емкостях реплицируются. Это ограничение связано с инфраструктурой родного региона, которая необходима для работы мощностей. Чтобы просмотреть список регионов, поддерживающих Fabric, перейдите в раздел "Доступность региона Fabric".

Функциональность региона и мощности дома

Для эффективного планирования аварийного восстановления важно понимать связь между вашим домашним регионом и местами размещения возможностей. Понимание домашних регионов и локаций емкости помогает стратегически выбирать регионы емкости, а также вырабатывать соответствующие процессы репликации и восстановления.

Адрес выставления счетов первого пользователя, который регистрируется, определяет домашний регион вашей организации для аренды и хранения данных. Дополнительные сведения о настройке арендатора (tenant) см. в разделе "Планирование реализации Power BI: настройка арендатора". При создании новых емкостей хранилище данных по умолчанию присваивается домашнему региону. Если вы хотите изменить регион хранения данных на другой регион, необходимо включить Multi-Geo — функцию Fabric Premium.

Important

Выбор другого региона для вместимости не приводит к полной миграции ваших данных в этот регион. Некоторые элементы данных по-прежнему хранятся в домашнем регионе. Сведения о том, какие данные остаются в домашнем регионе и какие данные хранятся в регионе с поддержкой нескольких регионов, см. в разделе "Настройка поддержки нескольких регионов" для Fabric Premium.

В случае если у домашнего региона нет парного региона, ресурсы в любом регионе с поддержкой Multi-Geo могут столкнуться со сбоями в работе, если в домашнем регионе произойдет катастрофа, поскольку ключевая функциональность службы привязана к домашнему региону.

Если выбрать регион с поддержкой нескольких регионов в ЕС, вы гарантируете, что данные хранятся в пределах границы данных ЕС.

Для получения информации о том, как определить свой домашний регион, см. Найти домашний регион Fabric.

Настройка емкости аварийного восстановления

Fabric предоставляет переключатель аварийного восстановления на странице параметров емкости. Это доступно там, где региональные пары Azure совпадают с размещением службы Fabric. Ниже приведены характеристики этого переключателя:

  • Ролевой доступ: только пользователи с ролью администратора емкостей или выше могут использовать этот параметр.

  • Степень детализации. Степень детализации коммутатора — это уровень емкости. Он доступен как для емкостей Premium, так и Fabric.

  • Область данных: переключатель восстановления после сбоев специально предназначен для данных OneLake, включая данные Lakehouse и Warehouse. Коммутатор не влияет на ваши данные, хранящиеся вне OneLake.

  • Непрерывность BCDR для Power BI: Хотя вы можете включать и выключать аварийное восстановление для данных OneLake, BCDR для Power BI поддерживается всегда, независимо от того, включен выключатель или выключен.

  • Частота: После изменения настройки емкости восстановления после катастрофы нужно подождать 30 дней, прежде чем можно будет снова её изменить. Период ожидания обеспечивает стабильность и предотвращает постоянное переключение.

Снимок экрана настройки арендатора восстановления после катастрофы.

Note

После включения настройки аварийной возможности восстановления или создания новых рабочих пространств внутри мощности репликация данных может занять некоторое время. Вы можете проверить статус каждой рабочей области на странице настроек емкости в разделе Рабочие области, назначенные этой емкости. В столбце "Георепликация OneLake " отображается состояние включения георепликации.

Репликация данных

Если включить параметр емкости аварийного восстановления, репликация между регионами включена как возможность аварийного восстановления для данных OneLake. Платформа Fabric синхронизируется с регионами Azure для создания пар геоизбыточности. Однако в некоторых регионах нет партнёрского региона Azure, или у партнёрского региона отсутствует поддержка Fabric. Для этих регионов репликация данных недоступна. Дополнительные сведения см. в разделах «Регионы с зонами доступности и без пары регионов» и «Доступность региона Fabric».

Note

Хотя Fabric предлагает решение для репликации данных в OneLake для поддержки аварийного восстановления, существуют заметные ограничения. Например, данные баз данных и наборов запросов KQL хранятся внешне в OneLake, что означает, что требуется отдельный подход к аварийному восстановлению. Дополнительные сведения о подходе к аварийному восстановлению для каждого элемента Fabric см. в оставшейся части этого документа.

Billing

Функция аварийного восстановления в Fabric обеспечивает георепликацию данных для повышения безопасности и надежности. Эта функция потребляет больше ресурсов хранения и транзакций, которые начисляются как ресурсы хранения BCDR и операции BCDR соответственно. Этими затратами можно отслеживать и управлять в приложении метрик емкости Microsoft Fabric, где они отображаются как отдельные элементы строки.

Исчерпывающие сведения обо всех связанных затратах на восстановление после аварийных ситуаций, которые помогут вам спланировать и составить бюджет соответствующим образом, см. в разделе OneLake: потребление ресурсов вычислений и хранилища.

Настройка аварийного восстановления

Хотя Fabric предоставляет функции аварийного восстановления для поддержки устойчивости данных, необходимо выполнить определенные действия вручную, чтобы восстановить службу во время сбоев. В этом разделе описаны действия, которые необходимо предпринять для подготовки к потенциальным нарушениям.

Этап 1. Подготовка

  • Активируйте параметры емкости аварийного восстановления: регулярно просматривайте и устанавливайте параметры емкости аварийного восстановления, чтобы убедиться, что они соответствуют вашим потребностям в защите и производительности.

  • Создание резервных копий данных. Скопируйте критически важные данные, хранящиеся вне OneLake, в другой регион таким образом, чтобы выровнять план аварийного восстановления.

Этап 2: Переключение на резерв в случае аварии

Когда крупномасштабная авария приводит к невозможности восстановления основного региона, Microsoft Fabric инициирует переключение на резервный регион. Вы не сможете получить доступ к порталу Fabric, пока не завершится аварийное переключение. Уведомление публикуется на странице поддержки Microsoft Fabric.

Время завершения отработки отказа может отличаться, хотя обычно оно занимает менее одного часа. После завершения переключения в случае сбоя вы можете ожидать следующее:

  • Портал Fabric: Вы можете получить доступ к порталу, а операции, связанные с чтением, такие как просмотр существующих рабочих областей, потоков задач в рабочих областях и элементов, продолжают работать. Все операции записи, такие как создание или изменение рабочей области, приостановлены.

  • Power BI. Вы можете выполнять операции чтения, такие как отображение панелей мониторинга и отчетов. Обновления, операции публикации отчетов, изменения панели мониторинга и отчета, а также другие операции, требующие изменений в метаданных, не поддерживаются.

  • Lakehouse/Warehouse: Вы не можете открыть эти элементы, но получите доступ к файлам через API или инструменты OneLake.

  • Определение заданий Spark: вы не можете открыть определения заданий Spark, но можете получить доступ к файлам кода через API или инструменты OneLake. Любые метаданные или конфигурации сохраняются после отказа.

  • Блокнот: Вы не можете открывать блокноты, и контент кода не сохраняется после катастрофы.

  • Модель машинного обучения или эксперимент. Нельзя открывать модели машинного обучения или эксперименты. Контент кода и метаданные, такие как метрики запуска и конфигурации, не сохраняются после катастрофы.

  • Dataflow Gen2/Pipeline/Eventstream: вы не можете открыть эти элементы, но для защиты данных можно использовать поддерживаемые назначения аварийного восстановления (озеро данных или хранилище данных).

  • База данных KQL/набор запросов: После аварийного переключения не удается получить доступ к базам данных KQL и наборам запросов. Для защиты данных в базах данных и наборах запросов KQL требуются дополнительные действия.

В случае катастрофы портал Fabric и Power BI находятся в режиме только чтения, а другие элементы Fabric недоступны. Вы можете получить доступ к их данным, хранящимся в OneLake, с помощью API или сторонних инструментов. Портал и Power BI сохраняют возможность выполнять операции чтения и записи данных. Эта возможность гарантирует, что критически важные данные остаются доступными и изменяемыми и устраняют потенциальные нарушения бизнес-операций.

Вы можете получить доступ к данным OneLake через несколько каналов:

  • API OneLake ADLS 2-го поколения: см . статью "Подключение к Microsoft OneLake"

  • Примеры инструментов, которые могут подключаться к данным OneLake:

  • В случае аварии каталог OneLake находится в режиме только для чтения:

    • Перейдите на вкладку "Обзор", чтобы просмотреть все элементы и рабочие области, включая их метаданные и связанные сведения.

    • Вкладка "Управление": Вы можете получить доступ к вкладке "Управление" для просмотра аналитики, рекомендуемых действий и инструментов управления на основе последнего успешного обновления модели перед переключением на резервный узел.

Этап 3. План восстановления

Хотя Структура гарантирует, что данные остаются доступными после аварии, вы также можете действовать для полного восстановления служб в состоянии до инцидента. В этом разделе представлено пошаговое руководство по работе с процессом восстановления.

Действия по восстановлению

  1. Создайте новую емкость Fabric в любом регионе после аварии. Учитывая высокий спрос во время таких событий, выберите регион вне основной геолокации, чтобы повысить вероятность доступности вычислительных сервисов. Для получения информации о создании емкости см. раздел Buy Fabric capacity in Azure.

  2. Создайте рабочие области в недавно созданной емкости. При необходимости используйте те же имена, что и в старых рабочих областях.

  3. Создайте элементы с теми же именами, что и те, которые требуется восстановить. Этот шаг важен, если вы используете пользовательский скрипт для восстановления лейкхаусов и складов.

  4. Восстановите предметы. Для восстановления каждого элемента следуйте соответствующему разделу в руководстве по аварийному восстановлению для конкретного опыта.

Дальнейшие действия