Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Microsoft Fabric предоставляет несколько способов переноса данных в среду аналитики. Необходимо ли обрабатывать события потоковой передачи в режиме реального времени, реплицировать операционные базы данных, оркестрировать пакетные конвейеры или получать доступ к данным без копирования, Fabric предлагает встроенные возможности для поддержки каждого сценария. Fabric также поддерживает управляемые шаблоны общего доступа к данным через OneLake, обеспечивая межтенантный и кросс-рабочий доступ к динамическим наборам данных без дублирования.
В этой статье описываются основные параметры приема и перемещения данных в Fabric. В нем рассматриваются следующие сведения:
- Прием данных в режиме реального времени с помощью Eventstreams и Eventhouse
- Пакетная оркестрация с конвейерами Data Factory и задачей копирования
- Репликация практически в режиме реального времени с зеркальным отображением
- Виртуализация данных с помощью сочетаний клавиш OneLake
Используйте этот обзор, чтобы понять, как работает каждый подход и выбрать стратегию, которая лучше всего соответствует вашим требованиям к рабочей нагрузке для задержки, преобразования и операционной сложности.
Прием данных в реальном времени
Потоки событий и элементы Eventhouse в рабочей нагрузке аналитики Real-Time поддерживают сценарии потоковой передачи данных. Потоки событий принимают и обрабатывают события в режиме реального времени, а хранилища событий сохраняют и осуществляют их запрос в масштабе. Обычно для записи и маршрутизации данных в хранилище событий используется поток событий. Вы также можете использовать каждую возможность независимо от ваших требований. На следующей схеме показано, как наборы данных в режиме реального времени перемещаются в Eventstream и Eventhouse в Fabric.
Прием и маршрутизация событий с помощью Eventstream
Eventstream предоставляет безкодовый интерфейс для приема событий в Fabric, применения преобразований в потоке и маршрутизации данных в несколько пунктов назначения. Поток событий действует как конвейер загрузки данных в режиме реального времени. Вы создаете поток событий и добавляете один или несколько исходных соединителей. Fabric поддерживает множество источников потоковой передачи, включая внутренние события Fabric, такие как события рабочей области Fabric, события файла OneLake и события задания в pipeline.
После запуска событий можно применить необязательные преобразования в режиме реального времени с помощью редактора перетаскивания. Например, можно фильтровать события, вычислять агрегаты временных окон, присоединять несколько потоков или изменять формат полей без написания кода.
Вы можете отправить обработанный поток в одно или несколько поддерживаемых мест. Потоки событий могут предоставлять конечные точки Apache Kafka через настраиваемые источники и приемники конечных точек. Эта возможность позволяет продюсерам Kafka транслировать события в Fabric, а потребителям Kafka — потреблять события из Fabric.
Потоки событий не хранят данные постоянно. Они передают события через память и перенаправляют их в настроенные назначения. Благодаря этому потоки событий подходят для сценариев извлечения, преобразования, загрузки (ETL) и распределения потоковых данных в нескольких целевых объектах. Например, вы можете получать данные телеметрии из датчиков Интернета вещей, фильтровать и агрегировать данные в режиме реального времени, отправлять обработанный поток в Eventhouse для аналитики и перенаправлять события аномалий в Activator для оповещения.
Прием данных непосредственно в Eventhouse
Центры событий могут получать данные непосредственно из нескольких источников. Fabric включает интегрированный интерфейс получения данных в Eventhouse. Мастер подключается к таким источникам, как локальные файлы, служба хранилища Azure, Amazon S3, Центры событий Azure и OneLake. Данные можно загрузить в таблицу базы данных Языка запросов Kusto (KQL) в режиме реального времени или пакетного режима с помощью пользовательского интерфейса Eventhouse.
Вы также можете выбрать существующий поток событий в Fabric в качестве источника. Например, если вы используете поток событий, который отправляет данные из Центра Интернета вещей или Kafka, можно направлять выходные данные непосредственно в таблицу базы данных KQL без дополнительной настройки.
Пакетная загрузка данных
Data Factory предоставляет основную платформу для традиционных конвейеров извлечения, преобразования, загрузки (ETL) и извлечения, загрузки, преобразования (ELT). Она включает в себя большую библиотеку соединителей. Фабрика данных Fabric предоставляет список собственных соединителей для локальных и облачных хранилищ данных, в том числе баз данных, приложений saaS и файловых систем. Эти соединители помогают подключаться практически к любой исходной системе.
Оркестрация перемещения данных с помощью конвейеров
Вы можете создавать конвейеры , использующие эти соединители для копирования или перемещения данных в OneLake или аналитические хранилища. Этот подход поддерживает следующее:
- Неструктурированные наборы данных, такие как изображения, видео и аудио
- Частично структурированные наборы данных, такие как JSON, CSV и XML
- Структурированные наборы данных из поддерживаемых систем реляционной базы данных
В конвейере объединяется несколько компонентов оркестрации, в том числе:
- Действия перемещения данных, такие как копирование данных и задание копирования
- Действия преобразования данных, такие как поток данных 2-го поколения, удаление данных, записная книжка Fabric и скрипт SQL
- Действия потока управления, такие как ForEach, Lookup, Set Variable и Webhook
Конвейер можно запускать по запросу, по расписанию или в ответ на события. Например, можно запланировать выполнение конвейера каждые два часа в рабочие дни или активировать его при создании нового файла в OneLake.
Упростите перемещение данных с помощью задачи копирования
Задание копирования поддерживает несколько шаблонов доставки данных, включая массовое копирование, инкрементное копирование и репликацию захвата изменений данных (CDC). Задание копирования можно использовать для перемещения данных из источника в OneLake без создания конвейера, а также для доступа к дополнительным параметрам конфигурации. Задание копирования поддерживает множество источников и мест назначения. Он предлагает больший контроль, чем зеркальное отображение и меньшую операционную сложность, чем управление конвейерами, которые используют действие копирования.
Репликация данных с помощью зеркального отображения
Зеркальное отображение реплицирует данные из внешних систем в Fabric практически в режиме реального времени с помощью автоматической настройки. Вы подключаетесь к внешней системе, например Базе данных SQL Azure, SQL Server, Oracle, SAP или Snowflake. Структура постоянно реплицирует данные или метаданные в OneLake. Зеркальное отображение поддерживает три категории:
- Зеркальное отображение базы данных реплицирует все базы данных и таблицы.
- Зеркальное отображение метаданных синхронизирует такие метаданные, как имена каталогов, схемы и таблицы вместо физического перемещения данных. Этот подход использует упрощения, чтобы данные оставались в своей исходной системе, но при этом были доступны в системе Fabric.
- Открытое зеркальное отображение использует открытый формат таблицы Delta Lake. Разработчики могут записывать изменения приложения непосредственно в зеркальный элемент базы данных в OneLake с помощью общедоступных API.
Fabric прослушивает изменения исходной системы (с помощью отслеживания измененных данных или аналогичных методов) и применяет эти изменения практически в реальном времени к зеркальной копии. Результатом является динамический, запрашиваемый набор данных, который остается в синхронизации с низкой задержкой без сложных конвейеров ETL.
Зеркальное отображение в настоящее время поддерживает различные источники, включая Базу данных Azure SQL, Управляемый экземпляр Azure SQL, Azure Cosmos DB, Базу данных Azure для PostgreSQL, Google BigQuery, Oracle, SAP, Snowflake и SQL Server. Он также поддерживает источники данных из партнерских решений, которые реализовали API открытого зеркального отображения. Зеркальные данные хранятся в OneLake в актуальной форме как Delta-таблицы. Структура автоматически поддерживает эти таблицы, чтобы их можно было использовать для аналитики в режиме реального времени или объединять их с другими данными Fabric. Эта возможность поддерживает сценарии гибридной транзакционной и аналитической обработки, в которых операционные данные постоянно передаются на платформу аналитики.
Зеркальное отображение устраняет необходимость вручную создавать конвейеры добавочной нагрузки. С точки зрения затрат зеркального отображения, вычислительные операции, которые поддерживают синхронизацию зеркальных баз данных, не используют единицы ёмкости (CUs) из ёмкости Fabric. Хранилище зеркальных данных в OneLake также предоставляется бесплатно до ограничений в терабайты в вашем SKU Fabric (например, F64 включает в себя 64 ТБ бесплатного зеркального хранилища данных).
Доступ к внешним данным с помощью сочетаний клавиш
Fabric предоставляет сочетания клавиш для включения виртуализации данных. Ярлык в OneLake ссылается на данные, хранящиеся во внешней системе, например Azure Data Lake Storage 2-го поколения, Amazon S3 или SharePoint. Ярлыки также могут ссылаться на данные внутри OneLake, включая данные из других рабочих областей и данные, общие между арендаторами через функции совместного использования данных OneLake. Вместо копирования данных ярлыки позволяют OneLake ссылаться на внешние и внутренние файлы как часть единого озера данных. Вы можете запрашивать или присоединять внешние данные с локальными данными, не выполняя начальную миграцию. Подход без копирования полезен, когда требования к размещению данных или проблемы с дублированием не позволяют перемещать данные. На следующей схеме показано, как сочетания клавиш подключают внешние системы хранилища к элементам Fabric без копирования данных:
OneLake может обнаружить тип данных, на который ссылается ярлык, и применить преобразования файлов или преобразования ИИ , не требуя конвейера или пользовательского кода. Эти преобразования работают с любым целевым объектом ярлыка, включая данные, совместно используемые другими клиентами с помощью общего доступа к данным OneLake. OneLake автоматически поддерживает полученную таблицу Delta в синхронизации с источником. Например, можно преобразовать .csv файлы в таблицы Delta или применить анализ настроений на основе ИИ к .txt файлам в папке.
В сочетании с зеркальным отображением сочетания клавиш предоставляют гибкие шаблоны доступа к данным. Данные можно хранить на месте с помощью сочетаний клавиш или реплицировать данные с помощью зеркального отображения. В обоих случаях данные готовы к использованию средств аналитики Fabric без сложного ETL.
Руководство по принятию решений. Выбор стратегии перемещения данных
Microsoft Fabric предоставляет несколько вариантов переноса данных в Fabric, включая потоки событий для обработки в режиме реального времени, зеркалирование, конвейеры с действиями копирования, задания копирования и ссылки. Каждый вариант предлагает различные баланс управления, автоматизации и операционной сложности. Если вам нужен живой, управляемый доступ к данным, которые уже находятся в OneLake (будь то в том же клиенте или предоставленные другой организацией), рассмотрите возможность комбинирования общего доступа к данным OneLake с использованиями ярлыков вместо репликации данных.
Рекомендации по выбору подходящего подхода для вашего сценария см. в руководстве по принятию решений Microsoft Fabric. Выберите стратегию перемещения данных.