Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Azure Data Lake Storage — это набор возможностей, предназначенных для аналитики больших данных, основанных на Хранилище BLOB-объектов Azure. В этой статье представлены ключевые функции, поддерживаемые интеграции и архитектура Azure Data Lake Storage, которые помогут оценить ее для рабочих нагрузок аналитики.
Azure Data Lake Storage основывается на возможностях, созданных Azure Data Lake Storage 1-го поколения, объединяя их с Хранилище BLOB-объектов Azure. Например, Data Lake Storage обеспечивает семантику файловой системы, безопасность на уровне файлов и масштабирование. Поскольку эти возможности основаны на Хранилище BLOB-объектов, вы также получаете недорогое многоуровневое хранение, высокую доступность и возможности аварийного восстановления.
Data Lake Storage делает служба хранилища Azure основой для построения корпоративных озёр данных в Azure. Разработан с самого начала для обслуживания нескольких петабайтов информации при поддержании сотен гигабит пропускной способности, Data Lake Storage позволяет легко управлять большим объемом данных.
Что такое озеро данных
Озеро данных — это единый централизованный репозиторий, в котором можно хранить все ваши данные, как структурированные, так и неструктурированные. Озеро данных позволяет организации быстро и легко сохранять, использовать и анализировать разнообразные данные в одном месте. При использовании озера данных вам не нужно выполнять согласование данных в соответствии с существующей структурой. Вместо этого можно хранить данные в необработанном или собственном формате, обычно в виде файлов или больших двоичных объектов (BLOB-объектов).
Azure Data Lake Storage — это облачное корпоративное решение озера данных. Оно предназначено для хранения больших объемов данных в любом формате и упрощения выполнения аналитических рабочих нагрузок с большими данными. Используйте его для сбора данных любого типа и скорости приема данных в одном расположении для простого доступа и анализа с помощью различных платформ.
возможности Azure Data Lake Storage
Azure Data Lake Storage не является выделенной службой или типом учетной записи. Вместо этого это реализовано в виде набора возможностей, который используется со службой хранилища BLOB-объектов в вашей учетной записи служба хранилища Azure. Разблокируйте эти возможности, включив параметр иерархического пространства имен.
Data Lake Storage включает следующие возможности.
Доступ, совместимый с Hadoop
Иерархическая структура каталога
Оптимизированная стоимость и производительность
Более точной модели безопасности зерна
Впечатляющая масштабируемость
Доступ, совместимый с Hadoop
Azure Data Lake Storage в основном предназначен для работы с Hadoop и всеми платформами, которые используют распределенную файловую систему Apache Hadoop (HDFS) в качестве уровня доступа к данным. Дистрибутивы Hadoop включают драйвер Файловой системы BLOB-объектов Azure (ABFS), который позволяет многим приложениям и платформам напрямую получать доступ к данным Хранилище BLOB-объектов Azure. Драйвер ABFS оптимизирован специально для аналитики больших данных. Соответствующие интерфейсы REST API доступны через конечную точку dfs.core.windows.net.
Платформы анализа данных, использующие HDFS в качестве уровня доступа к данным, могут обратиться к данным Azure Data Lake Storage напрямую через ABFS. Примерами таких платформ являются подсистема аналитики Apache Spark и обработчик SQL-запросов Presto.
Дополнительные сведения о поддерживаемых службах и платформах см. в разделах Службы Azure, поддерживающие Azure Data Lake Storage и Платформы с открытым исходным кодом, поддерживающие Azure Data Lake Storage.
Иерархическая структура каталога
Иерархическое пространство имен — это ключевая функция, которая позволяет Azure Data Lake Storage обеспечивать высокопроизводительный доступ к данным при масштабируемости и стоимости хранилища объектов. Эта функция позволяет упорядочить все объекты и файлы в учетной записи хранения в иерархии каталогов и вложенных подкаталогов. Иными словами, организация данных Azure Data Lake Storage во многом походит на организацию файлов на компьютере.
Такие операции, как переименование или удаление каталога, становятся одними атомарными операциями метаданных в каталоге. Больше не нужно перечислять или обрабатывать все объекты с общим префиксом имени каталога.
Оптимизированная стоимость и производительность
Стоимость Azure Data Lake Storage соответствует уровню цен Хранилище BLOB-объектов Azure. Он основывается на Хранилище BLOB-объектов Azure возможностях, таких как автоматическое управление политиками жизненного цикла и выравнивание на уровне объектов для управления затратами на хранилище больших данных.
Производительность улучшается, так как перед анализом не требуется копировать или преобразовывать данные. Функция иерархического пространства имен Azure Data Lake Storage обеспечивает эффективный доступ и навигацию. Эта архитектура означает, что обработка данных требует меньше вычислительных ресурсов, что сокращает время и затраты на доступ к данным.
Более точной модели безопасности зерна
Модель управления доступом в Azure Data Lake Storage поддерживает как управление доступом на основе ролей Azure (Azure RBAC), так и списки управления доступом переносимого интерфейса операционной системы для UNIX (POSIX) (ACL). Также существует несколько дополнительных параметров безопасности, относящихся к Azure Data Lake Storage. Задайте разрешения на уровне каталога или файла. Azure Data Lake Storage шифрует все данные при хранении с помощью ключей шифрования, управляемых Microsoft или клиентом.
Впечатляющая масштабируемость
Azure Data Lake Storage предлагает объемное хранилище и принимает многочисленные типы данных для аналитики. В нем нет никаких ограничений на размер учетной записи, размер файлов или объем данных, которые могут храниться в озере данных. Отдельные файлы могут иметь размеры, которые варьируются от нескольких килобайт (КБИТ) до сотен терабайтов (TBS). Azure Data Lake Storage обрабатывает запросы с почти постоянной задержкой на каждый запрос, измеряемой на уровнях службы, учетной записи и файла.
Эта конструкция означает, что Azure Data Lake Storage может легко и быстро масштабироваться до удовлетворения самых требовательных рабочих нагрузок. Она также может с такой же лёгкостью сократить ресурсы, когда спрос падает.
На базе Хранилища BLOB-объектов Azure
Данные, которые вы отправляете, сохраняются в качестве больших двоичных объектов в учетной записи хранения. Служба, которая управляет BLOB-объектами, — это служба хранилища BLOB-объектов Azure. Data Lake Storage описывает возможности или "улучшения" этой службы, которые удовлетворяют требованиям рабочих нагрузок аналитики больших данных.
Поскольку эти возможности реализованы на основе Хранилище BLOB-объектов, для вашей учетной записи доступны такие функции, как ведение диагностических журналов, уровни доступа и политики управления жизненным циклом. Большинство функций хранилища BLOB-объектов полностью поддерживаются, но некоторые функции могут поддерживаться только на уровне предварительной версии, и некоторые из них еще не поддерживаются. Полный список сведений о поддержке см. в разделе Поддержка функций хранилища BLOB-объектов в учетных записях хранения Azure. Состояние каждой указанной функции изменяется с течением времени, так как поддержка продолжает расширяться.
Терминология: BLOB-объекты, файлы и контейнеры
Оглавление Хранилище BLOB-объектов Azure включает два раздела. В разделе Data Lake Storage содержатся рекомендации и лучшие практики по использованию возможностей Data Lake Storage. В разделе Хранилище BLOB-объектов представлены рекомендации по возможностям учетной записи, которые не относятся непосредственно к Data Lake Storage.
При перемещении между разделами можно заметить некоторые незначительные различия в терминологии. Например, содержимое, представленное в документации Хранилище BLOB-объектов, использует термин BLOB-объект вместо файла. Технически, файлы, которые вы загружаете в свою учетную запись хранения, становятся BLOB-объектами в этой учетной записи. Так что это корректный термин. Однако термин blob может вызывать путаницу, если вы привыкли к термину file. Вы также можете встретить термин контейнер, используемый для обозначения файловой системы. Эти термины можно считать синонимами.
См. также
- Общие сведения о Azure Data Lake Storage (модуль обучения)
- Рекомендации по использованию Azure Data Lake Storage
- Известные проблемы с Azure Data Lake Storage
- Multi-protocol access on Azure Data Lake Storage (preview) (Доступ с использованием нескольких протоколов на Azure Data Lake Storage (предварительная версия))