Загрузка данных в Microsoft Fabric

Microsoft Fabric предоставляет несколько способов переноса данных в среду аналитики. Необходимо ли обрабатывать события потоковой передачи в режиме реального времени, реплицировать операционные базы данных, оркестрировать пакетные конвейеры или получать доступ к данным без копирования, Fabric предлагает встроенные возможности для поддержки каждого сценария. Fabric также поддерживает управляемые шаблоны общего доступа к данным через OneLake, обеспечивая межтенантный и кросс-рабочий доступ к динамическим наборам данных без дублирования.

В этой статье описываются основные параметры приема и перемещения данных в Fabric. В нем рассматриваются следующие сведения:

  • Прием данных в режиме реального времени с помощью Eventstreams и Eventhouse
  • Пакетная оркестрация с конвейерами Data Factory и задачей копирования
  • Репликация практически в режиме реального времени с зеркальным отображением
  • Виртуализация данных с помощью сочетаний клавиш OneLake

Используйте этот обзор, чтобы понять, как работает каждый подход и выбрать стратегию, которая лучше всего соответствует вашим требованиям к рабочей нагрузке для задержки, преобразования и операционной сложности.

Прием данных в реальном времени

Потоки событий и элементы Eventhouse в рабочей нагрузке аналитики Real-Time поддерживают сценарии потоковой передачи данных. Потоки событий принимают и обрабатывают события в режиме реального времени, а хранилища событий сохраняют и осуществляют их запрос в масштабе. Обычно для записи и маршрутизации данных в хранилище событий используется поток событий. Вы также можете использовать каждую возможность независимо от ваших требований. На следующей схеме показано, как наборы данных в режиме реального времени перемещаются в Eventstream и Eventhouse в Fabric.

Схема наборов данных в режиме реального времени, поступающих в Eventstream или Eventhouse.

Прием и маршрутизация событий с помощью Eventstream

Eventstream предоставляет безкодовый интерфейс для приема событий в Fabric, применения преобразований в потоке и маршрутизации данных в несколько пунктов назначения. Поток событий действует как конвейер загрузки данных в режиме реального времени. Вы создаете поток событий и добавляете один или несколько исходных соединителей. Fabric поддерживает множество источников потоковой передачи, включая внутренние события Fabric, такие как события рабочей области Fabric, события файла OneLake и события задания в pipeline.

После запуска событий можно применить необязательные преобразования в режиме реального времени с помощью редактора перетаскивания. Например, можно фильтровать события, вычислять агрегаты временных окон, присоединять несколько потоков или изменять формат полей без написания кода.

Вы можете отправить обработанный поток в одно или несколько поддерживаемых мест. Потоки событий могут предоставлять конечные точки Apache Kafka через настраиваемые источники и приемники конечных точек. Эта возможность позволяет продюсерам Kafka транслировать события в Fabric, а потребителям Kafka — потреблять события из Fabric.

Потоки событий не хранят данные постоянно. Они передают события через память и перенаправляют их в настроенные назначения. Благодаря этому потоки событий подходят для сценариев извлечения, преобразования, загрузки (ETL) и распределения потоковых данных в нескольких целевых объектах. Например, вы можете получать данные телеметрии из датчиков Интернета вещей, фильтровать и агрегировать данные в режиме реального времени, отправлять обработанный поток в Eventhouse для аналитики и перенаправлять события аномалий в Activator для оповещения.

Прием данных непосредственно в Eventhouse

Центры событий могут получать данные непосредственно из нескольких источников. Fabric включает интегрированный интерфейс получения данных в Eventhouse. Мастер подключается к таким источникам, как локальные файлы, служба хранилища Azure, Amazon S3, Центры событий Azure и OneLake. Данные можно загрузить в таблицу базы данных Языка запросов Kusto (KQL) в режиме реального времени или пакетного режима с помощью пользовательского интерфейса Eventhouse.

Вы также можете выбрать существующий поток событий в Fabric в качестве источника. Например, если вы используете поток событий, который отправляет данные из Центра Интернета вещей или Kafka, можно направлять выходные данные непосредственно в таблицу базы данных KQL без дополнительной настройки.

Пакетная загрузка данных

Data Factory предоставляет основную платформу для традиционных конвейеров извлечения, преобразования, загрузки (ETL) и извлечения, загрузки, преобразования (ELT). Она включает в себя большую библиотеку соединителей. Фабрика данных Fabric предоставляет список собственных соединителей для локальных и облачных хранилищ данных, в том числе баз данных, приложений saaS и файловых систем. Эти соединители помогают подключаться практически к любой исходной системе.

Оркестрация перемещения данных с помощью конвейеров

Вы можете создавать конвейеры , использующие эти соединители для копирования или перемещения данных в OneLake или аналитические хранилища. Этот подход поддерживает следующее:

  • Неструктурированные наборы данных, такие как изображения, видео и аудио
  • Частично структурированные наборы данных, такие как JSON, CSV и XML
  • Структурированные наборы данных из поддерживаемых систем реляционной базы данных

В конвейере объединяется несколько компонентов оркестрации, в том числе:

Конвейер можно запускать по запросу, по расписанию или в ответ на события. Например, можно запланировать выполнение конвейера каждые два часа в рабочие дни или активировать его при создании нового файла в OneLake.

Упростите перемещение данных с помощью задачи копирования

Задание копирования поддерживает несколько шаблонов доставки данных, включая массовое копирование, инкрементное копирование и репликацию захвата изменений данных (CDC). Задание копирования можно использовать для перемещения данных из источника в OneLake без создания конвейера, а также для доступа к дополнительным параметрам конфигурации. Задание копирования поддерживает множество источников и мест назначения. Он предлагает больший контроль, чем зеркальное отображение и меньшую операционную сложность, чем управление конвейерами, которые используют действие копирования.

Репликация данных с помощью зеркального отображения

Зеркальное отображение реплицирует данные из внешних систем в Fabric практически в режиме реального времени с помощью автоматической настройки. Вы подключаетесь к внешней системе, например Базе данных SQL Azure, SQL Server, Oracle, SAP или Snowflake. Структура постоянно реплицирует данные или метаданные в OneLake. Зеркальное отображение поддерживает три категории:

  • Зеркальное отображение базы данных реплицирует все базы данных и таблицы.
  • Зеркальное отображение метаданных синхронизирует такие метаданные, как имена каталогов, схемы и таблицы вместо физического перемещения данных. Этот подход использует упрощения, чтобы данные оставались в своей исходной системе, но при этом были доступны в системе Fabric.
  • Открытое зеркальное отображение использует открытый формат таблицы Delta Lake. Разработчики могут записывать изменения приложения непосредственно в зеркальный элемент базы данных в OneLake с помощью общедоступных API.

Fabric прослушивает изменения исходной системы (с помощью отслеживания измененных данных или аналогичных методов) и применяет эти изменения практически в реальном времени к зеркальной копии. Результатом является динамический, запрашиваемый набор данных, который остается в синхронизации с низкой задержкой без сложных конвейеров ETL.

Зеркальное отображение в настоящее время поддерживает различные источники, включая Базу данных Azure SQL, Управляемый экземпляр Azure SQL, Azure Cosmos DB, Базу данных Azure для PostgreSQL, Google BigQuery, Oracle, SAP, Snowflake и SQL Server. Он также поддерживает источники данных из партнерских решений, которые реализовали API открытого зеркального отображения. Зеркальные данные хранятся в OneLake в актуальной форме как Delta-таблицы. Структура автоматически поддерживает эти таблицы, чтобы их можно было использовать для аналитики в режиме реального времени или объединять их с другими данными Fabric. Эта возможность поддерживает сценарии гибридной транзакционной и аналитической обработки, в которых операционные данные постоянно передаются на платформу аналитики.

Зеркальное отображение устраняет необходимость вручную создавать конвейеры добавочной нагрузки. С точки зрения затрат зеркального отображения, вычислительные операции, которые поддерживают синхронизацию зеркальных баз данных, не используют единицы ёмкости (CUs) из ёмкости Fabric. Хранилище зеркальных данных в OneLake также предоставляется бесплатно до ограничений в терабайты в вашем SKU Fabric (например, F64 включает в себя 64 ТБ бесплатного зеркального хранилища данных).

Доступ к внешним данным с помощью сочетаний клавиш

Fabric предоставляет сочетания клавиш для включения виртуализации данных. Ярлык в OneLake ссылается на данные, хранящиеся во внешней системе, например Azure Data Lake Storage 2-го поколения, Amazon S3 или SharePoint. Ярлыки также могут ссылаться на данные внутри OneLake, включая данные из других рабочих областей и данные, общие между арендаторами через функции совместного использования данных OneLake. Вместо копирования данных ярлыки позволяют OneLake ссылаться на внешние и внутренние файлы как часть единого озера данных. Вы можете запрашивать или присоединять внешние данные с локальными данными, не выполняя начальную миграцию. Подход без копирования полезен, когда требования к размещению данных или проблемы с дублированием не позволяют перемещать данные. На следующей схеме показано, как сочетания клавиш подключают внешние системы хранилища к элементам Fabric без копирования данных:

Схема архитектуры сочетаний клавиш внешнего хранилища.

OneLake может обнаружить тип данных, на который ссылается ярлык, и применить преобразования файлов или преобразования ИИ , не требуя конвейера или пользовательского кода. Эти преобразования работают с любым целевым объектом ярлыка, включая данные, совместно используемые другими клиентами с помощью общего доступа к данным OneLake. OneLake автоматически поддерживает полученную таблицу Delta в синхронизации с источником. Например, можно преобразовать .csv файлы в таблицы Delta или применить анализ настроений на основе ИИ к .txt файлам в папке.

В сочетании с зеркальным отображением сочетания клавиш предоставляют гибкие шаблоны доступа к данным. Данные можно хранить на месте с помощью сочетаний клавиш или реплицировать данные с помощью зеркального отображения. В обоих случаях данные готовы к использованию средств аналитики Fabric без сложного ETL.

Руководство по принятию решений. Выбор стратегии перемещения данных

Microsoft Fabric предоставляет несколько вариантов переноса данных в Fabric, включая потоки событий для обработки в режиме реального времени, зеркалирование, конвейеры с действиями копирования, задания копирования и ссылки. Каждый вариант предлагает различные баланс управления, автоматизации и операционной сложности. Если вам нужен живой, управляемый доступ к данным, которые уже находятся в OneLake (будь то в том же клиенте или предоставленные другой организацией), рассмотрите возможность комбинирования общего доступа к данным OneLake с использованиями ярлыков вместо репликации данных.

Рекомендации по выбору подходящего подхода для вашего сценария см. в руководстве по принятию решений Microsoft Fabric. Выберите стратегию перемещения данных.