Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Azure Data Lake Storage est un ensemble de fonctionnalités dédiées à l’analytique du Big Data et basées sur le Stockage Blob Azure. Cet article présente les principales fonctionnalités, les intégrations prises en charge et l’architecture de Azure Data Lake Storage pour vous aider à l’évaluer pour vos charges de travail d’analyse.
Azure Data Lake Storage s’appuie sur les fonctionnalités avancées par Azure Data Lake Storage Gen1, en les combinant avec Stockage Blob Azure. Par exemple, Data Lake Storage fournit une sémantique du système de fichiers, une sécurité au niveau des fichiers et la mise à l’échelle. Étant donné que ces fonctionnalités sont basées sur Stockage Blob, vous bénéficiez également d’un stockage hiérarchisé à faible coût, avec des fonctionnalités de haute disponibilité et de récupération d’urgence.
Data Lake Storage fait du stockage Azure la base pour créer des dépôts Data Lake d’entreprise sur Azure. Conçu dès le départ pour traiter plusieurs téraoctets d’informations tout en assurant des centaines de gigaoctets de débit, Data Lake Storage vous permet de facilement gérer d'importants volumes de données.
Qu’est-ce qu’un lac de données ?
Un lac de données est un référentiel centralisé unique dans lequel vous pouvez stocker toutes vos données, structurées et non structurées. Un lac de données permet à votre organisation de stocker, d’accéder et d’analyser rapidement et facilement un large éventail de données dans un même emplacement. Avec un lac de données, vous n’avez pas besoin de vous conformer à vos données pour les adapter à une structure existante. Au lieu de cela, vous pouvez stocker vos données dans un format brut ou natif, généralement sous la forme de fichiers ou d’objets BLOB (Binary Large Object).
Azure Data Lake Storage est une solution de lac de données d’entreprise basée sur le cloud. Il est conçu pour stocker de gros volumes de données dans n’importe quel format et pour faciliter les charges de travail analytiques Big Data. Utilisez-la pour capturer des données de n’importe quel type et vitesse d’ingestion dans un emplacement unique pour faciliter l’accès et l’analyse à l’aide de divers frameworks.
fonctionnalités de Azure Data Lake Storage
Azure Data Lake Storage n’est ni un type de compte ni un service dédié. Il est en revanche implémenté sous la forme d’un ensemble de fonctionnalités que vous utilisez avec le service de stockage Blob de votre compte de stockage Azure. Déverrouillez ces fonctionnalités en activant le paramètre d’espace de noms hiérarchique.
Data Lake Storage inclut les fonctionnalités suivantes.
Accès compatible Hadoop
Structure hiérarchique de répertoires
Coût et performances optimisés
Modèle de sécurité plus fin
Scalabilité massive
Accès compatible Hadoop
Azure Data Lake Storage est principalement conçu pour fonctionner avec Hadoop et toutes les infrastructures qui utilisent le système de fichiers DFS (HDFS) Apache Hadoop comme couche d’accès aux données. Les distributions Hadoop incluent le pilote Azure Blob File System (ABFS)), qui permet à de nombreuses applications et infrastructures d’accéder directement aux données du stockage Blob Azure. Le pilote ABFS est optimisé spécifiquement pour l’analytique Big Data. Les API REST correspondantes sont disponibles via le point de terminaison dfs.core.windows.net.
Les infrastructures d’analyse de données qui utilisent HDFS comme couche d’accès aux données peuvent accéder directement aux données Azure Data Lake Storage par le biais de ABFS. Le moteur d’analyse Apache Spark et le moteur de requête Presto SQL sont des exemples de ces infrastructures.
Pour plus d’informations sur les services et plateformes pris en charge, consultez Services Azure qui prennent en charge Azure Data Lake Storage et les plateformes open source qui prennent en charge Azure Data Lake Storage.
Structure hiérarchique de répertoires
L’espace de noms hiérarchique est une fonctionnalité clé qui permet à Azure Data Lake Storage de fournir un accès aux données hautes performances à l’échelle et au prix du stockage d’objets. Utilisez cette fonctionnalité pour organiser tous les objets et fichiers de votre compte de stockage dans une hiérarchie de répertoires et de sous-répertoires imbriqués. En d’autres termes, vos données Azure Data Lake Storage sont organisées de façon très similaire à celle des fichiers sur votre ordinateur.
Les opérations telles que le changement de nom ou la suppression d’un répertoire deviennent des opérations de métadonnées atomiques uniques sur le répertoire. Il n’est pas nécessaire d’énumérer et de traiter tous les objets qui partagent le préfixe du nom du répertoire.
Coût et performances optimisés
Azure Data Lake Storage est facturé à tous les niveaux d’Stockage Blob Azure. Il s’appuie sur des fonctionnalités Stockage Blob Azure telles que la gestion automatisée des stratégies de cycle de vie et la hiérarchisation au niveau des objets pour gérer les coûts de stockage Big Data.
Les performances s’améliorent, car vous n’avez pas besoin de copier ou de transformer des données avant l’analyse. La fonctionnalité d’espace de noms hiérarchique d’Azure Data Lake Storage permet un accès et une navigation efficaces. Cette architecture signifie que le traitement des données nécessite moins de ressources de calcul, ce qui réduit le temps et le coût d’accès aux données.
Modèle de sécurité plus fin
Le modèle de contrôle d’accès Azure Data Lake Storage prend en charge le contrôle d’accès en fonction du rôle (Azure RBAC) et les listes de contrôle d’accès (ACL) de l’interface du système d’exploitation portable pour UNIX POSIX (Portable Operating System Interface for Unix). Certains paramètres de sécurité supplémentaires sont également spécifiques à Azure Data Lake Storage. Définissez les autorisations au niveau du répertoire ou du fichier. Azure Data Lake Storage chiffre toutes les données au repos à l’aide de clés de chiffrement gérées par Microsoft ou gérées par le client.
Scalabilité massive
Azure Data Lake Storage offre un stockage massif et accepte de nombreux types de données à des fins d’analyse. Il n’impose aucune limite de taille de compte, de taille de fichier ou de quantité de données stockées dans un lac de données. Les fichiers individuels peuvent avoir des tailles allant de quelques kilo-octets (Ko) à des centaines de téraoctets (TB). Azure Data Lake Storage traite les requêtes à des latences quasi constantes par requête mesurées au niveau du service, du compte et du fichier.
Cette conception signifie qu’Azure Data Lake Storage peut facilement et rapidement subir un scale-up afin de répondre aux charges de travail les plus exigeantes. De même, il peut également être facile à mettre à l’échelle en cas de chute de la demande.
Basé sur le stockage Blob Azure
Les données que vous ingérez sont conservées sous forme de blobs dans le compte de stockage. Le service qui gère les objets blob est le service de stockage Blob Azure. Data Lake Storage décrit les fonctionnalités ou les « améliorations » de ce service qui répondent aux exigences des charges de travail analytiques Big Data.
Ces fonctionnalités étant basées sur le stockage Blob, des éléments tels que la journalisation des diagnostics, les niveaux d’accès et les stratégies de gestion du cycle de vie sont disponibles sur votre compte. La plupart des fonctionnalités de stockage Blob sont entièrement prises en charge, mais certaines peuvent être prises en charge uniquement au niveau de la préversion et d’autres ne sont pas encore prises en charge. Pour obtenir une liste complète des instructions de support, consultez Prise en charge des fonctionnalités de stockage Blob dans des comptes de stockage Azure. L’état de chaque fonctionnalité répertoriée change au fil du temps, car la prise en charge continue de s’étendre.
Terminologie : objets blob, fichiers et conteneurs
La table des matières du stockage Blob Azure comporte deux sections. La section Data Lake Storage fournit les bonnes pratiques et des conseils d’utilisation des fonctionnalités de Data Lake Storage. La section Stockage Blob fournit des conseils sur les fonctionnalités de compte non spécifiques à Data Lake Storage.
Lorsque vous passez d’une section à l’autre, il est possible que vous remarquiez quelques légères différences terminologiques. Par exemple, le contenu présenté dans la documentation Stockage Blob utilise le terme blob au lieu du fichier. Techniquement, les fichiers que vous ingérez dans votre compte de stockage deviennent des objets Blob dans votre compte. Par conséquent, le terme est correct. Toutefois, le terme blob peut prêter à confusion si vous êtes habitué au terme fichier. Vous voyez également le terme conteneur utilisé pour faire référence à un système de fichiers. Considérez ces termes comme des synonymes.