Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Azure Data Lake Storage es un conjunto de funcionalidades dedicadas al análisis de macrodatos basado en Azure Blob Storage. En este artículo se presentan las características clave, las integraciones admitidas y la arquitectura de Azure Data Lake Storage para ayudarle a evaluarla para las cargas de trabajo de análisis.
Azure Data Lake Storage se basa en las funcionalidades pioneras en Azure Data Lake Storage Gen1, combinándolas con Azure Blob Storage. Por ejemplo, Data Lake Storage proporciona la semántica del sistema de archivos, la seguridad de nivel de archivo y la escala. Dado que estas funcionalidades se basan en Blob Storage, también obtiene almacenamiento en niveles de bajo costo, con funcionalidades de alta disponibilidad y recuperación ante desastres.
Data Lake Storage convierte a Azure Storage en los cimientos para crear lagos de datos empresariales en Azure. Diseñado desde el principio para servir varios petabytes de información y mantener cientos de gigabits de rendimiento, Data Lake Storage le ofrece una forma fácil de administrar cantidades masivas de datos.
¿Qué es un lago de datos?
Un lago de datos es un repositorio único y centralizado donde puede almacenar todos los datos, tanto estructurados como no estructurados. Un lago de datos permite a su organización almacenar y analizar una amplia variedad de datos, y acceder a ellos, en una sola ubicación, de forma rápida y sencilla. Con un lago de datos, no es necesario adecuar los datos para que se ajusten a una estructura existente. En su lugar, puede almacenar los datos en su formato nativo o sin formato, normalmente como archivos o como objetos binarios grandes (blobs).
Azure Data Lake Storage es una solución de lago de datos empresarial basada en la nube. Está diseñado para almacenar grandes cantidades de datos en cualquier formato y facilitar las cargas de trabajo analíticas de macrodatos. Úselo para capturar datos de cualquier tipo y velocidad de ingesta en una sola ubicación para facilitar el acceso y el análisis mediante varios marcos.
funcionalidades de Azure Data Lake Storage
Azure Data Lake Storage no es un servicio dedicado ni un tipo de cuenta. En su lugar, se implementa como un conjunto de funcionalidades que se usan con el servicio Blob Storage de la cuenta de Azure Storage. Desbloquee estas funcionalidades habilitando la configuración del espacio de nombres jerárquico.
Data Lake Storage incluye las siguientes funcionalidades.
Acceso compatible con Hadoop
Estructura jerárquica de directorios
Coste y rendimiento optimizados
Modelo de seguridad más preciso
Escalabilidad masiva
Acceso compatible con Hadoop
Azure Data Lake Storage está diseñado principalmente para trabajar con Hadoop y todos los marcos que usan Sistema de archivos distribuido (HDFS) de Apache Hadoop como capa de acceso a los datos. Las distribuciones de Hadoop incluyen el controlador Azure Blob File System (ABFS), que permite que muchas aplicaciones y marcos accedan directamente a los datos de Azure Blob Storage. El controlador ABFS está optimizado específicamente para el análisis de macrodatos. Las API REST correspondientes están disponibles a través del punto de conexión dfs.core.windows.net.
Los marcos de análisis de datos que usan HDFS como capa de acceso a los datos pueden acceder directamente a Azure Data Lake Storage datos mediante ABFS. El motor de análisis Apache Spark y el motor de consulta SQL Presto son ejemplos de estos marcos.
Para obtener más información sobre los servicios y plataformas admitidos, consulte Servicios de Azure que admiten Azure Data Lake Storage y Plataformas de código abierto compatibles con Azure Data Lake Storage.
Estructura jerárquica de directorios
El espacio de nombres jerárquico es una característica clave que permite a Azure Data Lake Storage proporcionar acceso a datos de alto rendimiento a un precio y escala de almacenamiento de objetos. Use esta característica para organizar todos los objetos y archivos de la cuenta de almacenamiento en una jerarquía de directorios y subdirectorios anidados. En otras palabras, los datos de Azure Data Lake Storage se organizan de la misma manera que los archivos que se organizan en el equipo.
Las operaciones como cambiar el nombre o eliminar un directorio se convierten en operaciones de metadatos atómicas únicas en el directorio. No es necesario enumerar y procesar todos los objetos que comparten el prefijo del nombre del directorio.
Coste y rendimiento optimizados
El precio de Azure Data Lake Storage se establece en los niveles de Azure Blob Storage. Se basa en las capacidades de Azure Blob Storage, como la administración automatizada de directivas de ciclo de vida y la asignación de niveles por objeto, para gestionar los costes de almacenamiento de datos masivos.
El rendimiento mejora porque no es necesario copiar ni transformar datos antes del análisis. La capacidad de espacio de nombres jerárquico de Azure Data Lake Storage permite un acceso y una navegación eficaces. Esta arquitectura significa que el procesamiento de datos requiere menos recursos computacionales, lo que reduce tanto el tiempo como el costo de acceder a los datos.
Modelo de seguridad más preciso
El modelo de control de acceso de Azure Data Lake Storage admite el control de acceso basado en roles de Azure (RBAC de Azure) y las listas de control de acceso (ACL) de Portable Operating System Interface for Unix (POSIX). También hay algunas configuraciones de seguridad adicionales que son específicas de Azure Data Lake Storage. Establezca permisos en el nivel de directorio o archivo. Azure Data Lake Storage cifra todos los datos en reposo mediante claves de cifrado administradas por Microsoft o administradas por el cliente.
Escalabilidad masiva
Azure Data Lake Storage ofrece almacenamiento masivo y acepta numerosos tipos de datos para el análisis. No se impone ningún límite al tamaño de cuenta, el tamaño de archivo o la cantidad de datos que se pueden almacenar en el lago de datos. Los archivos individuales pueden tener tamaños que van de unos pocos kilobytes (KB) a cientos de terabytes (MB). Azure Data Lake Storage procesa las solicitudes en latencias casi constantes por solicitud medida en los niveles de servicio, cuenta y archivo.
Este diseño significa que Azure Data Lake Storage puede escalar verticalmente de forma sencilla y rápida para satisfacer las cargas de trabajo más exigentes. También puede reducir verticalmente con facilidad cuando se reduce la demanda.
Basado en Azure Blob Storage
Los datos que ingiere se conservan como blobs en la cuenta de almacenamiento. El servicio que administra blobs es el servicio Azure Blob Storage. Data Lake Storage describe las funcionalidades o "mejoras" de este servicio que satisfacen las demandas de cargas de trabajo analíticas de macrodatos.
Dado que estas funcionalidades se basan en Blob Storage, las características como el registro de diagnóstico, los niveles de acceso y las directivas de administración del ciclo de vida están disponibles para su cuenta. La mayoría de las características de Blob Storage son totalmente compatibles, pero es posible que algunas características solo se admitan en el nivel de versión preliminar y que todavía no se admitan algunas de ellas. Para obtener una lista completa de las instrucciones de soporte técnico, consulte Compatibilidad de características de Blob Storage en cuentas de Azure Storage. El estado de cada característica enumerada cambia a lo largo del tiempo a medida que la compatibilidad continúa expandiéndose.
Terminología: blobs, archivos y contenedores
La tabla de contenido de Azure Blob Storage presenta dos secciones de contenido. La sección de Data Lake Storage del contenido proporciona procedimientos recomendados e instrucciones para usar las funcionalidades de Data Lake Storage. La sección de Blob Storage del contenido proporciona instrucciones para las características de cuenta no específicas de Data Lake Storage.
A medida que se mueva entre secciones, es posible que note algunas ligeras diferencias de terminología. Por ejemplo, el contenido destacado en la documentación de Blob Storage usa el término blob en lugar de archivo. Técnicamente, los archivos que ingiere en la cuenta de almacenamiento se convierten en blobs en su cuenta. Por lo tanto, el término es correcto. Sin embargo, el término blob puede causar confusión si está acostumbrado al término archivo. También verá el término contenedor usado para hacer referencia a un sistema de archivos. Puede considerar estos términos como sinónimos.