Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Microsoft OneLake — это единое озеро данных для всей организации. Каждый клиент Microsoft Fabric автоматически включает OneLake, и это единственное место для всех данных аналитики. Это центральное хранилище, где можно хранить данные, управлять ими и контролировать их использование для аналитики и нагрузок ИИ во всей организации.
OneLake основан на Azure Data Lake Storage и хранит таблицы в формате Delta Parquet или Iceberg, два открытых стандарта, которые может читать любой инструмент. Это означает, что ваши данные не привязаны к проприетарным форматам.
OneLake предоставляет:
- Единое хранилище данных для всей организации с встроенным управлением и безопасностью
- Одна копия данных для использования с несколькими аналитическими подсистемами без дублирования
- Гибкие возможности подключения через проводник файлов, API ADLS Gen2 и интеграцию со службами Azure
- Защита данных и мониторинг со встроенной избыточностью, аварийным восстановлением и диагностикой доступа
Единое хранилище данных
Перед OneLake организации часто создают несколько озер для разных бизнес-групп, что привело к дополнительным затратам на управление несколькими ресурсами. Этот разложенный подход затрудняет совместную работу между командами, замедляет проекты данных и повышает риск дублирования.
OneLake решает эти проблемы, предоставляя центральную точку доступа к данным для всей организации. Каждый клиент Fabric поставляется с одним экземпляром OneLake. Вы не можете удалить OneLake или создать несколько OneLakes, и не существует инфраструктуры для подготовки или управления ими. Отделы, команды и проекты могут хранить свои данные в этом едином озере данных или подключаться к ним и упорядочивать их с помощью доменов, поддоменов и рабочих областей Fabric, у каждого из которых есть собственный администратор. Эта модель сохраняет право собственности на данные и обеспечивает федеративное управление, при этом позволяя авторизованным пользователям находить и использовать данные без лишних затруднений.
Централизованное управление распределенной собственностью
Данные в Fabric имеют следующую иерархию для организации и управления:
- Арендатор: политики на уровне арендатора автоматически защищают все данные, поступающие в OneLake, для обеспечения безопасности, соответствия требованиям и управления данными.
- Рабочая область. Вы можете создать любое количество рабочих областей в клиенте для упорядочивания данных. Рабочие области позволяют различным частям организации распространять политики владения и доступа. Каждое рабочее пространство является частью выделенного ресурса, привязанного к конкретному региону и оплачиваемого отдельно.
- Элементы данных: рабочие области содержат такие элементы данных, как lakehouses, хранилища, центры событий и базы данных KQL. Каждый тип элемента предназначен для конкретных рабочих нагрузок, таких как аналитика на основе Spark, запросы T-SQL, потоковая передача в режиме реального времени и многое другое.
Дополнительные сведения см. в разделе "Рабочие области".
Обнаружение и управление с помощью каталога OneLake
Каталог OneLake — это единственное место для специалистов по данным и бизнес-пользователей для обнаружения, управления и управления данными, которыми они владеет, и доступа к ним через OneLake.
Пользователи могут фильтровать по домену, рабочей области, типу элемента, подтверждениям и многому другому, чтобы найти именно то, что им нужно, с каждым элементом данных, обогащенным метаданными, такими как описания, владельцы, схема, происхождение и метрики использования.
Владельцы данных могут получать аналитическую информацию и рекомендации по повышению качества данных и соответствия требованиям, в том числе информацию об охвате метками конфиденциальности, наличии тегов, сертификации и расположении данных.
Дополнительные сведения см. в каталоге OneLake.
Security
Модель безопасности OneLake позволяет широко предоставлять доступ к данным, не раскрывая конфиденциальную информацию. С помощью ролей безопасности OneLake можно определить детализированные разрешения для элементов данных, вплоть до определенных папок, таблиц или даже строк и столбцов. Например, можно предоставить общий доступ к набору данных продаж команде, но ограничить доступ к Cost столбцу или позволить партнеру просматривать только строки.Region = "US" OneLake сохраняет эти роли и автоматически применяет их во всех интерфейсах аналитики. Таким образом, если у пользователя есть доступ только к части набора данных, это правило применяется к запросу через SQL, запуск записной книжки Spark или просмотр отчета Power BI. OneLake гарантирует, что они видят только то, что им разрешено видеть.
Этот унифицированный подход к безопасности означает, что пользователям не нужно поддерживать отдельные разрешения в разных модулях. Это также означает, что исходные владельцы данных всегда поддерживают контроль над тем, кто может получить доступ к источнику данных, даже если данные передаются в озеро или рабочую область, принадлежащей другому пользователю.
Метки конфиденциальности можно применять к элементам OneLake так же, как и к документу, и эти метки применяют ограничения шифрования или доступа, даже если данные экспортируются в Excel или другом инструменте. Аналогичным образом политики защиты от потери данных (DLP) могут обнаруживать отправку конфиденциальных данных или скачивание из OneLake и предотвращать или предупреждать о потенциальных утечках данных.
Дополнительные сведения см. в статье "Начало защиты данных в OneLake".
Одна копия данных
Все подсистемы аналитики Fabric работают с данными непосредственно в OneLake. Вам не нужно копировать данные для использования с другим механизмом или анализировать данные из нескольких источников.
Сочетания клавиш
Ярлык — это ссылка на данные, хранящиеся в других расположениях файлов. Эти расположения файлов могут находиться в одной рабочей области, другой рабочей области в OneLake или вне OneLake. Вы можете использовать ярлыки для OneLake, Azure Data Lake Storage, Azure Blob Storage, Amazon S3 и совместимых с S3 источников, источников, совместимых с Iceberg, Microsoft Dataverse, локальных источников данных и т. д. Независимо от расположения ярлыки делают файлы и папки похожими на то, что они хранятся локально.
Сочетания клавиш позволяют организации объединять данные в облаках и доменах без копирования. Teams могут работать независимо в отдельных рабочих областях и использовать сочетания клавиш для совместного использования данных друг с другом вместо дублирования. Например, одна команда может создать ярлык к набору данных в рабочей области другой команды или к внешнему S3-бакету, а затем объединить эти данные со своими в OneLake. Ярлык указывает на источник, поэтому при обновлении исходных данных эти изменения сразу же отображаются через OneLake. Таким образом, вы можете создавать виртуальные продукты или представления, которые объединяют данные из нескольких бизнес-групп, чтобы соответствовать определенной потребности, не перемещая или дублируя данные. С помощью сочетаний клавиш вы можете даже применить автоматические изменения к данным, таким как преобразование формата данных или удаление личных сведений (PII).
Дополнительные сведения об использовании сочетаний клавиш см. в разделе "Сочетания клавиш OneLake".
Mirroring
Зеркалирование в Fabric — это экономически эффективное решение с низкой задержкой, которое непрерывно реплицирует данные из различных систем в OneLake. Вы можете безопасно подключиться к внешнему источнику данных и автоматически зеркалировать (копировать) выбранные базы данных или таблицы в открытый формат OneLake, поддерживая их синхронизацию почти в реальном времени. Зеркальные данные хранятся в OneLake в формате Delta Parquet, поэтому эти данные сразу готовы для анализа любым механизмом Fabric.
Зеркальное отображение поддерживает такие источники, как База данных SQL Azure, Azure Cosmos DB, База данных Azure для PostgreSQL, Azure Databricks (каталог Unity), Snowflake и многое другое. Изменения в источнике непрерывно передаются, поэтому ваша копия в OneLake остается актуальной без ETL-процессов, запускаемых вручную. Вы можете выполнять аналитику, задачи ИИ или отчеты Power BI на актуальных данных без прямых запросов к рабочему источнику данных.
Дополнительные сведения см. в разделе "Что такое зеркальное отображение в Fabric?"
Работайте совместно в нескольких аналитических движках
Аналитические подсистемы Fabric (T-SQL, Apache Spark, Analysis Services и другие) хранят данные в OneLake в открытом формате Delta Parquet. Эта стандартизация позволяет вам использовать одни и те же данные в нескольких модулях. Вам не нужно копировать данные только для использования с другим движком или быть привязанным к использованию определённого движка, так как там ваши данные.
Например, команда инженеров SQL создает полностью транзакционный хранилище данных. Они используют подсистему T-SQL для создания таблиц, преобразования данных и загрузки данных в таблицы. Если специалист по обработке и анализу данных хочет использовать эти данные, он может подключить записную книжку Spark к OneLake и прочитать эти таблицы напрямую. Поскольку OneLake хранит таблицы в формате Delta, Spark может загружать их без каких-либо специальных коннекторов или экспорта данных. Запросы SQL и задания Spark работают с одной копией данных в OneLake.
Кроме того, бизнес-пользователи могут создавать Power BI отчеты на основе OneLake с помощью режима Direct Lake в подсистеме служб Analysis Services. Режим Direct Lake — это режим доступа к данным, который загружает и обновляет большие объемы данных быстро без копирования. Дополнительные сведения см. в обзоре Direct Lake.
Совместимость с открытым форматом таблиц
OneLake поддерживает форматы таблиц Delta Lake и Apache Iceberg с помощью виртуализации метаданных. Эта функция автоматически создает виртуальные метаданные, чтобы таблицы Iceberg можно было читать как таблицы Delta Lake в разных рабочих нагрузках Fabric, а таблицы Delta Lake — внешними средствами чтения, поддерживающими Iceberg. Вы можете напрямую записывать таблицы Iceberg в OneLake или создавать ярлыки к таблицам Iceberg, хранящимся во внешнем хранилище, и OneLake делает их доступными для всех движков Fabric без ручного преобразования. Аналогичным образом любая таблица Delta Lake в OneLake может быть доступна для служб, совместимых с Apache Iceberg, например Snowflake.
Для получения дополнительной информации см. Использование таблиц Iceberg с OneLake.
Подключение к OneLake
Вы можете получить доступ к данным OneLake с портала Fabric, Windows, существующих средств Azure или любого приложения, поддерживающего API-интерфейсы ADLS 2-го поколения.
Проводник OneLake для Windows
Вы можете получить доступ к данным OneLake в Windows с помощью Проводника файлов OneLake для Windows. Вы можете перемещаться по всем рабочим областям и элементам данных, легко загружать, загружать или изменять файлы так же, как и в Office. Обозреватель файлов OneLake упрощает работу с озерами данных, поэтому даже нетехнические бизнес-пользователи могут использовать их.
Дополнительные сведения см. в проводнике OneLake.
API-интерфейсы и пакеты SDK для ADLS 2-го поколения
OneLake поддерживает api-интерфейсы и пакеты SDK 2-го поколения Azure Data Lake Storage (ADLS), чтобы использовать существующие приложения ADLS 2-го поколения. Каждая рабочая область отображается как контейнер, а элементы данных отображаются в виде папок в этих контейнерах. Дополнительные сведения см. в статье о доступе и API OneLake.
Так как OneLake совместим с приложениями ADLS 2-го поколения, вы можете подключиться к OneLake из служб Azure. Рассмотрим пример.
Защита и мониторинг данных
OneLake включает встроенные возможности для обеспечения безопасности данных и предоставления вам сведений о том, как он используется.
Аварийное восстановление и защита данных
OneLake автоматически защищает ваши данные благодаря встроенной избыточности. В регионах, поддерживающих зоны доступности, OneLake использует хранилище с зональной избыточностью (ZRS) для репликации данных между несколькими центрами обработки данных. В других регионах используется локально избыточное хранилище (LRS). Для дополнительной защиты от сбоев на уровне региона можно включить непрерывность бизнес-процессов и аварийное восстановление (BCDR) для геореплицирования данных в парный Azure регион. OneLake также поддерживает мягкое удаление, при котором удаленные файлы хранятся в течение семи дней, чтобы их можно было восстановить после случайного удаления.
Дополнительные сведения см. в разделе "Аварийное восстановление" и "Защита данных" для OneLake.
Диагностика
Диагностика OneLake предоставляет представление о доступе к данным и использовании в среде Fabric. При включении диагностики на уровне рабочей области он передает события доступа к данным в виде журналов в lakehouse. Вы можете отслеживать, кто обращается к данным, когда и как. Это ведение журнала охватывает действия пользователей в пользовательском интерфейсе Fabric, программный доступ через API и подсистемы аналитики, а также доступ между рабочими областями через сочетания клавиш.
Дополнительные сведения см. в разделе диагностики OneLake.