Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Microsoft Fabric предоставляет несколько вариантов хранения, предназначенных для поддержки аналитики, обработки в режиме реального времени и операционных отчетов на единой платформе. Выбор правильного интерфейса хранения помогает оптимизировать производительность, управлять затратами и выравнивать архитектуру данных с требованиями к рабочей нагрузке. Независимо от источника или способа подготовки, все данные попадают в единую систему хранения, называемую OneLake.
В этой статье объясняется, как данные хранятся в Fabric и описываются основные возможности хранения. В следующих разделах рассматриваются следующие темы:
- OneLake — унифицированное логическое озеро данных, которое лежит в основе всех рабочих нагрузок Fabric.
- Lakehouse — хранение и анализ структурированных и неструктурированных данных с помощью таблиц Delta.
- Хранилище — хранение реляционных данных, оптимизированных для высокопроизводительной аналитики SQL.
- Eventhouse — хранение и запрос данных о событиях в режиме реального времени.
- Базы данных и другие возможности хранения. Общие сведения о дополнительных возможностях хранилища, доступных в Fabric.
Используйте этот обзор, чтобы понять, как работает каждый вариант хранения и выбрать оптимальный вариант для аналитических и операционных сценариев.
Lakehouse для гибкого хранилища данных
Lakehouse — это основной элемент хранения в Fabric, использующий OneLake для хранения данных в форматах файлов и таблиц. Lakehouse представляет курированную структуру папок в OneLake и включает интерфейс SQL. Lakehouse хранит данные в виде файлов Delta Parquet. Вы можете упорядочить необработанные файлы, такие как CSV-файлы или изображения в папках, и создавать управляемые таблицы Delta для структурированных данных. Эта модель поддерживает структурированные и неструктурированные данные в одной среде.
Структура автоматически подготавливает конечную точку аналитики SQL для каждого Lakehouse. Вы и такие инструменты, как Power BI, можете запрашивать Delta tables с помощью Transact-SQL, как при запросе реляционной базы данных. Lakehouse объединяет масштабируемость и гибкость озера данных с основными возможностями хранилища данных, включая прямой запрос к таблицам и управление схемами.
Хранилище для структурированной аналитики
Хранилище в Fabric предоставляет традиционный интерфейс хранилища данных SQL (с таблицами, представлениями SQL, хранимыми процедурами и многое другое) в едином хранилище Fabric. При создании хранилища он сохраняет данные в OneLake в формате Delta в виде упорядоченного набора таблиц Delta с интерфейсом ANSI SQL сверху. Хранилище обеспечивает выделенную производительность вычислений и точно настроенную производительность для сложных запросов SQL и рабочих нагрузок в стиле бизнес-аналитики. Она поддерживает такие функции, как индексирование, хранимые процедуры и надежные транзакции ACID в таблицах.
Хранилище и Lakehouse используют одно и то же базовое хранилище OneLake. Их можно интегрировать с помощью сочетаний клавиш или других функций взаимодействия при необходимости. Тем не менее, обычно они разделяются для разных вариантов использования. Хранилище идеально подходит для структурированных, реляционных данных звезд-схемы, которые необходимо разбивать на части и анализировать с помощью SQL. Конвейеры Fabric можно использовать для загрузки данных в хранилище. Power BI может подключаться с помощью Direct Lake или DirectQuery для получения данных без импорта.
Руководство по принятию решений: Lakehouse и Warehouse
Склады и Лейкхаусы выполняют разные, но дополняющие друг друга функции.
Склады данных оптимизированы для структурированного хранения данных в корпоративных масштабах, полностью поддерживаемого T-SQL, транзакций ACID и строгого соблюдения схем, что делает их идеальными для бизнес-аналитики и отчетности. Выберите хранилище для управляемых, высокопроизводительных рабочих нагрузок SQL и Lakehouse для обработки больших данных, исследовательской аналитики и сценариев, связанных с различными форматами данных или интеграцией с внешним озером.
Lakehouses предлагают гибкое, масштабируемое хранилище для структурированных и неструктурированных данных, поддерживая проектирование данных на основе Spark и аналитику SQL в режиме только чтение через автоматические конечные точки.
Многие организации получают преимущества от совместного использования: Lakehouses для приема и преобразования, а также хранилищ данных для уточненной аналитики и отчетности. Чтобы узнать больше, смотрите руководство по принятию решений.
Зеркальные базы данных для репликации почти в режиме реального времени
Зеркальная база данных в Fabric — это непрерывно реплицированная копия внешней операционной базы данных, например База данных SQL Azure, SQL Server, Azure Cosmos DB или Snowflake. Структура сохраняет зеркальные данные в OneLake в формате Delta Lake.
Зеркальное отображение синхронизирует изменения источника в Fabric практически в реальном времени, не требуя традиционного конвейера извлечения, преобразования и загрузки. После репликации данные становятся немедленно запрашиваемыми через конечные точки SQL и доступны в рабочих нагрузках Fabric, включая Power BI, записные книжки Spark и конвейеры.
Эта архитектура поддерживает сценарии гибридной транзакционной и аналитической обработки (HTAP), в которых анализируются операционные данные при сохранении целостности исходной системы. Если исходные данные уже хранятся в расположении, доступном через ярлыки OneLake (например, Azure Data Lake Storage или другую рабочую область Fabric), стоит рассмотреть использование ярлыков для доступа без копирования вместо зеркального отображения. Зеркалирование лучше всего подходит для оперативных баз данных, требующих непрерывного фиксирования изменений данных, а способы быстрого доступа идеальны для получения актуального доступа только для чтения без репликации.
Сочетания клавиш OneLake для доступа к данным нулевого копирования
Ярлыки OneLake — это логические ссылки, ссылающиеся на данные во внешних системах хранения или в других рабочих областях Fabric без копирования. Ярлыки делают так, что ссылки на данные отображаются как часть локального неймспейса OneLake, поэтому все вычислительные подсистемы Fabric (Spark, SQL, Power BI) могут запрашивать целевые объекты ярлыков наряду с собственными данными. Этот подход поддерживает единую версию истины и избегает дублирования хранилища.
Вы также можете использовать общий доступ к данным OneLake для расширения доступа к ярлыкам через границы клиента Microsoft Entra. Владельцы данных предоставляют разрешения OneLake внешним пользователям, а получатели создают ссылки на общие данные в своих рабочих областях. Политики управления остаются в силе в источнике. Дополнительные сведения см. в разделе "Ярлыки OneLake" и внешний общий доступ к данным.
Eventhouse для аналитики событий в режиме реального времени
Eventhouse предоставляет масштабируемую среду аналитики в режиме реального времени, предназначенную для приема, хранения и анализа больших объемов данных событий. Это базовый движок для рабочих нагрузок в рамках Real-Time Intelligence.
В Eventhouse размещаются одна или несколько баз данных, использующих язык запросов Kusto на основе подсистемы Kusto. Эти базы данных автоматически индексируют и разделяют данные по времени внесения. Вы запрашиваете данные с помощью языка запросов Kusto.
Eventhouse хорошо подходит для телеметрии, журналов безопасности, записей соответствия требованиям и финансовых транзакций, где требуется аналитика с низкой задержкой и высокомасштабная обработка.
База данных SQL для транзакционных рабочих нагрузок
Базы данных SQL в Fabric поддерживают рабочие нагрузки транзакционной и операционной аналитики. Они предоставляют полностью управляемый интерфейс реляционной базы данных с поддержкой T-SQL, включая определение данных (DDL), манипуляцию (DML) и возможности запросов (DQL). Для создания транзакционных и аналитических решений можно использовать хранимые процедуры, представления и функции.
Базы данных SQL используют службу автоматического зеркального отображения для репликации транзакционных таблиц в OneLake для аналитики. При создании базы данных SQL Fabric запускает подсистему репликации, которая записывает операции вставки, обновления и удаления с помощью канала изменений ядра SQL и записывает эти изменения в OneLake в виде файлов Delta Parquet. Репликация выполняется практически в режиме реального времени и запускается автоматически. Все поддерживаемые таблицы по умолчанию зеркально отображаются. Это поведение гарантирует, что копия OneLake остается синхронизированной с операционной базой данных.
Базы данных SQL интегрируются с другими интерфейсами Fabric, такими как Power BI, записные книжки, функции пользовательских данных, конвейеры и внешние средства с помощью протокола TDS. Эта интеграция позволяет создавать комплексные решения, начиная от приема данных и преобразования в визуализацию и отчеты, не выходя из среды Fabric. Платформа автоматически обрабатывает индексирование и оптимизацию производительности, поэтому вам не нужно вручную настраивать инфраструктуру или управлять ими.
Cosmos DB для распределенных рабочих нагрузок NoSQL
Cosmos DB в Microsoft Fabric — это полностью управляемая распределенная база данных NoSQL, предназначенная для высокопроизводительных и глобально распределенных приложений. Она поддерживает гибкие модели схем и полуструктурированные данные JSON.
Cosmos DB автоматически реплицируется в OneLake в формате Delta для поддержки аналитики, не влияя на операционную производительность. Репликация выполняется непрерывно и почти в режиме реального времени и не требует настройки вручную.
После репликации данные становятся доступными через конечную точку аналитики SQL. Данные можно запрашивать с помощью Transact-SQL, создания представлений и интеграции с Power BI, записными книжками и конвейерами.
Конечная точка аналитики SQL предоставляет интерфейс только для чтения зеркальных данных, что гарантирует, что аналитические запросы не влияют на операции транзакций. Эта архитектура поддерживает гибридную транзакционную и аналитическую обработку (HTAP), чтобы объединить операционные и аналитические рабочие нагрузки на одной платформе.
Семантическая модель для бизнес-логики и отчетов
Семантические модели предоставляют структурированный, курируемый слой, который определяет бизнес-логику, меры, иерархии, связи и метаданные на основе необработанных данных в Microsoft Fabric. Они делают данные интерпретируемыми и повторно используемыми на платформе для аналитики.
Семантические модели в Fabric тесно интегрированы с моделью емкости платформы и структурой рабочей области. Семантические модели поддерживают три режима запроса: импорт, DirectQuery и Direct Lake. Каждый режим предлагает различные компромиссы между производительностью, свежестью и масштабируемостью:
Режим импорта копирует данные из источника в семантику модели во время запланированных или ручных обновлений. Этот режим обеспечивает самую быструю производительность запросов, так как Power BI работает с данными в памяти, но это обеспечивает задержку между обновлениями источника и видимостью отчета. Режим импорта идеально подходит для высокопроизводительных панелей мониторинга, где данные в режиме реального времени не критически важны.
Режим DirectQuery отправляет запросы непосредственно в исходную систему во время выполнения без хранения данных в семантической модели. Этот подход обеспечивает актуальные результаты, но может привести к замедлению производительности в зависимости от отклика системы-источника. DirectQuery подходит для сценариев, когда свежесть данных важнее, чем скорость, например операционные отчеты.
Режим Direct Lake позволяет Power BI запрашивать таблицы Delta, хранящиеся в OneLake напрямую. Он объединяет характеристики производительности импорта с свежестью DirectQuery. Он избегает дублирования данных и использует архитектуру на основе озера для масштабируемой аналитики практически в режиме реального времени. Direct Lake рекомендуется для крупномасштабной аналитики данных под управлением Fabric.
Семантические модели также позволяют использовать диалоговый ИИ, семантический поиск, корпоративные отчеты и междоменное рассуждение, объединяя такие расширенные функции, как агенты данных Fabric, Power BI Copilot, Онтологии и отчеты Power BI. Бизнес-пользователи также могут получить доступ к семантических моделях с помощью Excel, где они могут изучать данные и аналитические сведения в интерфейсе сводной таблицы, использующего динамические данные из семантической модели.
Руководство по принятию решений. Выбор правильного хранилища данных
Microsoft Fabric предоставляет несколько параметров хранилища данных, оптимизированных для определенных рабочих нагрузок:
- Lakehouse для крупномасштабной инженерии данных и хранения в открытых форматах, таких как Delta и Iceberg, с поддержкой двигателей Spark и SQL.
- Хранилище для структурированной реляционной аналитики с высокопроизводительными возможностями SQL и корпоративными отчетами.
- Eventhouse для аналитики журналов и телеметрии в режиме реального времени с помощью языка запросов Kusto.
- База данных SQL для транзакционных рабочих нагрузок и операционной аналитики.
- Cosmos DB для глобально распределенных приложений NoSQL, приложений с несколькими моделями с доступом с низкой задержкой.
- Ярлыки OneLake для нулевого доступа к данным без копирования во внешнем хранилище или других рабочих областях и клиентах Fabric, в случае, если вам не нужна отдельная копия и вы хотите сохранить единую версию данных.
Выбор соответствующего хранилища зависит от структуры данных, требований к задержке, сложности запросов и интеграции. Если необходимые данные уже существуют в доступном расположении, сочетания клавиш могут полностью устранить необходимость репликации. Дополнительные рекомендации см. в разделе "Выбор правильного магазина".