Patrones y capacidades fundamentales de Microsoft OneLake

Este artículo presenta patrones comunes de OneLake y las capacidades de la plataforma que puedes utilizar para implementarlos. Utiliza la información de este artículo para pensar en cómo quieres organizar tu entorno de datos y luego elige los patrones que se adapten a tus necesidades empresariales, técnicas y de gobernanza.

Cada patrón describe cómo organizar los datos y la propiedad para lograr un objetivo arquitectónico específico. Para implementar un patrón, se combina una o más capacidades fundamentales de OneLake : virtualización de datos, interoperabilidad de datos abiertos, gobernanza centralizada y análisis e inteligencia artificial integrados. Cada funcionalidad depende a su vez de funciones específicas del producto como accesos directos, espejado, seguridad OneLake y modo Direct Lake. La misma capacidad y característica suelen aparecer en más de un patrón.

Note

Este artículo se basa en patrones identificados en el libro blanco de la guía arquitectónica de OneLake.

Considera estos cinco patrones como bloques de construcción para tu diseño de OneLake. La mayoría de los entornos combinan más de uno. Elige los patrones que se ajusten a tus objetivos:

Acceso unificado a los datos con replicación mínima

Si tus datos están distribuidos en múltiples nubes, sistemas locales o lagos externos, copiarlos todos en un solo lugar puede no ser práctico, ni siquiera posible. El acceso unificado a los datos con un patrón de replicación mínimo trata OneLake como una única capa lógica de datos entre esas fuentes. En lugar de construir pipelines de ingesta para cada fuente, usas atajos para referenciar datos en el lugar y espejar cuando necesitas una copia sincronizada y optimizada para consultas.

Use este patrón cuando:

  • Tus datos están distribuidos en múltiples nubes, sistemas locales o lagos externos.
  • Replicar datos en un almacén central generaría almacenamiento excesivo, latencia o sobrecarga de cumplimiento.
  • Necesitas incorporar nuevas fuentes rápidamente sin necesidad de crear pipelines completos de extracción, transformación y carga (ETL).
  • Quieres mantener las inversiones en lagos de datos, almacenes de datos y almacenes operativos existentes.

Aplicar acceso unificado a los datos

Para poner en práctica este patrón, comienza con dos enfoques principales de acceso a datos que no requieren construir u operar procesos de movimiento de datos: la virtualización hace que los datos fuente estén disponibles a través de OneLake sin copiarlos, y el mirroring zero-ETL incorpora una copia sincronizada y gestionada por la plataforma a OneLake como tablas Delta listas para analítica. Solo usa herramientas de movimiento de datos Fabric cuando estos enfoques no soportan la fuente o no cumplen tus requisitos. Para orientación adicional sobre cómo elegir y combinar estos enfoques, consulte Unificar datos con atajos y espejamiento de OneLake.

  1. Haz un inventario de tus fuentes de datos para determinar a cuáles puede acceder OneLake mediante virtualización o replicación zero-ETL: almacenamiento de objetos en la nube, catálogos externos, bases de datos operativas y Dataverse. Marca cualquier fuente restante que requiera un enfoque de movimiento de datos.

  2. Elige la técnica de acceso a datos adecuada para cada fuente soportada. Prefiero virtualización cuando el código fuente admite acceso sin copia. Utiliza el reflejo zero-ETL cuando el código fuente requiera una copia sincronizada y optimizada para consultas:

Datos de origen Cómo acceder a él Manejo de datos
Almacenamiento de objetos en la nube (Azure Data Lake Storage Gen2, Amazon S3, Google Cloud Storage) y almacenamiento local compatible con S3 Accesos directos Virtualización: Pon a disposición los datos fuente sin copiarlos
Datos gestionados en un catálogo externo que quieres poner a disposición sin copiar (por ejemplo, Azure Databricks Unity Catalog) Reflejo de metadatos : sincroniza solo los metadatos de catálogo (esquemas, tablas) y accede a los datos fuente mediante atajos Virtualización: Pon a disposición los datos fuente sin copiarlos
Bases de datos operativas que necesitan una copia optimizada para consultas (Azure SQL Database, Azure Cosmos DB, Snowflake, PostgreSQL, SQL Server 2025, Oracle Database, Google BigQuery) Espejo de bases de datos, o espejo abierto para soluciones personalizadas y de socios compatibles Duplicación Zero-ETL: crea una copia Delta sincronizada
Dataverse (datos de Dynamics 365 y Power Platform) Atajos o Vínculo a Microsoft Fabric para acceder sin copiar los datos Virtualización: Pon a disposición los datos fuente sin copiarlos
  1. Transforma los datos fuente cuando sea necesario. Las transformaciones de acceso directo pueden procesar archivos compatibles expuestos mediante un acceso directo, tanto si los archivos están almacenados externamente como si ya están en OneLake. Utiliza transformaciones de archivos de acceso directo para convertir archivos estructurados en tablas Delta o transformaciones de IA de atajos para procesar texto no estructurado. Las transformaciones de acceso directo crean una salida Delta transformada y la mantienen sincronizada con los datos referenciados por el acceso directo.

  2. Utiliza herramientas de movimiento de datos Fabric cuando la virtualización y el espejado no soporten una fuente o cuando necesites transformaciones complejas, orquestación, una cadencia de movimiento programada o la ingesta de streaming. Para ayuda para elegir entre pipelines, flujos de datos, trabajos de copia y flujos de eventos, consulte Elegir una estrategia de movimiento de datos.

Cuando optes por mover datos, deposita los datos copiados en un formato de tabla abierto, como Delta Parquet o Iceberg. El espejo y las transformaciones de acceso directo ya generan salida Delta. Usar formatos abiertos mantiene legibles los datos virtualizados, las copias sincronizadas y la salida transformada de Delta para los motores de Fabric y las plataformas externas.

  1. Registra el motivo cada vez que crees una copia sincronizada, una salida Delta transformada o una copia mediante las herramientas de movimiento de datos de Fabric. Este registro hace que la decisión sea auditable. Crea una copia solo cuando una fuente necesite un diseño físico optimizado para consultas o no pueda cumplir virtualmente con tus requisitos de frescura, coste de transformación, cumplimiento o procesamiento.

  2. Aplicar la seguridad de OneLake a los datos disponibles a través de OneLake para que las mismas políticas cubran datos virtualizados, copias sincronizadas y salida transformada de Delta.

  3. Respalda y describe los datos resultantes en el catálogo de OneLake para que los consumidores puedan encontrarlos y confiar en ellos.

Capacidades unificadas de acceso a datos

  • Virtualización de datos y replicación zero-ETL - Exponer datos que residen en otros sistemas y nubes mediante referencias sin copia o copias sincronizadas listas para el análisis. Funciones:
  • Gobernanza centralizada - Aplica seguridad y descubrimiento consistentes a fuentes virtualizadas igual que lo harías con los datos nativos de OneLake. Funciones:
  • Interoperabilidad de datos abiertos - Mantener los datos virtualizados y las copias gestionadas por la plataforma legibles tanto por los motores Fabric como por plataformas externas. Funciones:

Arquitectura de medallón (bronce, plata, oro)

Poner los datos a disposición en OneLake es solo el primer paso. Los datos en bruto de los sistemas fuente normalmente no son seguros para usar directamente en analítica o IA. A menudo contiene duplicados, errores, formatos inconsistentes o campos sensibles. Cuando varios equipos construyen sobre los mismos datos fuente, necesitan una definición compartida de para qué se confía cada etapa de los datos.

El patrón de arquitectura de medallón organiza los datos en OneLake en tres capas de calidad: bronce para datos de origen brutos e inmutables; plata para datos depurados y armonizados; y oro para tablas certificadas y listas para el negocio, y modelos semánticos. Cada capa es una etapa definida en la que los consumidores posteriores pueden confiar. Las tablas de plata y oro son reutilizables en cargas de BI, analítica e IA, por lo que los equipos no reconstruyen la misma lógica de limpieza o modelado en herramientas separadas.

Use este patrón cuando:

  • Varios equipos construyen sobre la misma fuente de datos y necesitan calidad constante.
  • Necesitas un linaje rastreable desde entradas en bruto hasta salidas certificadas.
  • Necesitas un contrato claro entre la ingeniería de datos y los consumidores de analítica o de IA.

Para más información sobre este patrón, véase Entender la arquitectura de medallones para Fabric con OneLake. Ese artículo cubre el diseño de capas, modelos de despliegue, formatos de almacenamiento, vistas materializadas de lagos y optimización de tablas Delta.

Cómo aplicarlo

Un medallón de trabajo depende de una idea: cada capa es un contrato con los consumidores posteriores, y los datos solo avanzan a la siguiente capa después de cumplir con los estándares de calidad de dicha capa.

  1. Identifica tus fuentes en bruto y los consumidores que dependen de datos certificados.

  2. Define qué pertenece a cada capa y aplica estas definiciones de forma consistente entre dominios:

    Nivel Contenido Consumidores típicos
    Bronce Datos brutos e inmutables capturados directamente de fuentes sin aplicación de esquema Ingenieros de datos (acceso limitado)
    Plata Depurado, deduplicado y armonizado con definiciones de negocio compartidas Ingenieros de datos y analistas formados
    Oro Tablas seleccionadas y modelos semánticos listos para su uso empresarial Todos los consumidores de BI, analítica e IA
  3. Produce cada capa con la carga de trabajo adecuada de Fabric: normalmente Ingeniería de Datos (Spark) o Data Factory para bronce y plata, y modelos semánticos de Data Warehouse o Power BI para oro. Conserva la fidelidad al origen en bronce usando el formato original, un acceso directo a los datos de origen, Parquet o Delta, según corresponda. Usa tablas Delta para plata y oro para que las cargas de trabajo de Fabric puedan leer y escribir los datos refinados de forma fiable.

  4. Aplica políticas de acceso en función de la capa. Utiliza la seguridad de OneLake para los elementos soportados y los permisos Fabric y SQL aplicables para almacenes. Restringir el acceso al bronce, poner la plata a disposición de analistas y conceder acceso al oro según las necesidades del consumidor y los estándares de menor privilegio.

  5. Utiliza resultados de oro seleccionados para análisis posteriores. Construye modelos semánticos de capa dorada en modo Direct Lake para que Power BI pueda leer datos de OneLake sin crear una copia importada ni requerir actualizaciones programadas.

  6. Confirma que toda producción de oro tiene un linaje rastreable a través de la plata hasta sus fuentes de bronce. Luego, avala tablas de capa de oro y modelos semánticos certificados en el catálogo de OneLake. Esta validación ayuda a los consumidores a identificar qué datos están listos para su uso en producción.

  7. Reutiliza modelos semánticos dorados para poner en marcha las ontologías de Fabric IQ. Este paso proporciona a los agentes de IA un contexto empresarial gobernado y basado en datos certificados.

Capacidades fundamentales

  • Análisis e IA integrados - las capas de bronce, plata y oro alimentan todas las cargas de trabajo de análisis e IA en OneLake sin copias específicas para cada motor. Funciones:
  • Gobernanza centralizada - Aplicar diferentes políticas de acceso y puertas de calidad en cada capa para que los consumidores solo vean datos apropiados para su función. Funciones:
  • Interoperabilidad de datos abiertos - Almacena las capas en formatos abiertos para que los motores externos puedan leerlas junto con Fabric. Funciones:

Malla de datos orientada a dominio en una plataforma compartida

Si tienes varios equipos de negocio produciendo y consumiendo datos, enrutar cada solicitud a través de un único equipo central de datos puede ralentizar la entrega. Los equipos de negocio suelen comprender mejor sus propios datos y requisitos, pero descentralizar la propiedad sin gobernanza compartida puede conducir a una seguridad, calidad y linaje inconsistentes.

El patrón de malla de datos orientado a dominios otorga a cada dominio empresarial la propiedad de sus propios productos de datos, mientras que todos los dominios siguen estándares compartidos sobre una base OneLake. Cada dominio publica sus propios productos de datos, y otros dominios acceden a ellos mediante atajos y los consumen con Fabric Analytics y cargas de trabajo de IA. Las políticas centralizadas de identidad, seguridad y gobernanza se aplican de forma uniforme en todos los dominios.

Use este patrón cuando:

  • Un único equipo central de datos se convierte en un cuello de botella para la entrega.
  • Diferentes dominios de negocio tienen datos, requisitos y ritmos de lanzamiento distintos.
  • Necesitas una responsabilidad clara sobre la calidad de los datos a nivel de dominio sin renunciar a la gobernanza a nivel empresarial.

Aplicar una malla de datos orientada al dominio

Encuentra el equilibrio adecuado entre descentralización y coherencia. Traslada la propiedad al dominio que mejor conoce los datos y mantén la identidad, la seguridad y el linaje centralizados para que los productos de datos de cada dominio cumplan con los mismos estándares.

  1. Identifica tus dominios de negocio. Cada dominio debe representar un área coherente del negocio con un equipo que pueda poseer y operar sus productos de datos de principio a fin.

  2. Crea un dominio para cada área de negocio y asigna espacios de trabajo a él. Configura un dominio central separado para infraestructura compartida y datos empresariales reutilizables.

  3. Definir estándares de productos de datos que cada dominio debe cumplir, por ejemplo, requisitos de endoso o certificación, esquemas documentados, metadatos de propiedad, versionado y acuerdos de nivel de servicio (SLA). Estos estándares hacen que cada producto sea un contrato reutilizable y descubrible, en lugar de solo una carpeta de espacio de trabajo.

  4. Utiliza la seguridad de OneLake para aplicar controles de acceso a datos basados en roles a nivel de carpeta, tabla, fila y columna, de modo que los productores puedan publicar productos de datos sin exponer todo en su espacio de trabajo.

  5. Aplica la gobernanza a nivel de inquilino con el catálogo OneLake para el descubrimiento y linaje entre dominios, y Microsoft Purview para etiquetas de sensibilidad y auditoría. Extiende el mismo modelo de identidades y políticas a los agentes de IA que consumen productos de datos del dominio, de modo que el acceso de los agentes se gestione igual que el de cualquier otro consumidor.

  6. Que los dominios de consumo usen atajos para hacer referencia a los productos de datos de los dominios productores en lugar de copiarlos. Los consumidores pueden entonces utilizar los productos de datos referenciados en la carga de trabajo de Fabric que se adapten a sus necesidades. Para modelos semánticos de Power BI, utiliza el modo Direct Lake para leer datos directamente de OneLake. Utiliza Fabric Data Agents o Fabric IQ para crear experiencias de IA basadas en productos de datos de dominio gobernado.

  7. Si los dominios publican en catálogos fuera de Fabric, planifica la sincronización de control de acceso para que los permisos se mantengan consistentes entre OneLake y el catálogo externo.

    Tip

    El acelerador de código abierto de Microsoft Policy Weaver puede automatizar esta sincronización para Azure Databricks (Unity Catalog), Snowflake y fuentes Dataverse. Refleja las políticas de acceso a los datos en los roles de seguridad de OneLake, complementando la duplicación (que traslada los datos, pero no los permisos).

Capacidades de malla de datos

  • Gobernanza centralizada - Descentraliza la propiedad de los dominios manteniendo centralizada la identidad, la seguridad y el linaje. Funciones:
  • Virtualización de datos - Permite que los dominios de consumo utilicen productos de datos propiedad del productor mediante referencias en lugar de copias. Funciones:
    • Los atajos permiten compartir copia cero entre dominios.
  • Análisis integrados e IA - Haz que los productos de datos de cada dominio sean consumibles en las cargas de trabajo de Fabric. Funciones:

Consolidación de plataformas para análisis e IA

Si ejecutas varias plataformas de análisis una al lado de la otra —herramientas separadas para almacenamiento de datos, inteligencia empresarial, ciencia de datos, análisis en tiempo real e IA—, cada herramienta viene con sus propias copias de datos, pipelines y modelo de gobernanza. Esa fragmentación aumenta los costes y dificulta aplicar una seguridad consistente o obtener una única respuesta a una pregunta empresarial.

El patrón de consolidación de plataformas traslada estas cargas de trabajo a Fabric, donde OneLake proporciona una base de datos compartida y gobernada. Las cargas de trabajo de Fabric acceden, transforman, sincronizan o analizan datos a través de esta base en lugar de depender de modelos de datos y gobernanza separados para cada herramienta.

Use este patrón cuando:

  • Estás usando varias plataformas de analítica con capacidades superpuestas.
  • Las copias de datos y las canalizaciones específicas de cada sistema aumentan los costes y la sobrecarga de mantenimiento.
  • Necesitas un modelo único de gobernanza y seguridad para todas las cargas de trabajo de analítica e IA.

Aplica la consolidación de plataformas

Apunta a menos plataformas, no más integraciones. Consolida las cargas de trabajo en Fabric en lugar de integrar herramientas entre sí, y recurre a motores externos solo cuando todavía no puedas retirarlos.

  1. Haz inventario de las herramientas y pipelines de analítica, almacenamiento de datos, ciencia de datos, inteligencia de negocio (BI) e IA que utilices hoy en día. Anota qué cargas de trabajo sirve cada herramienta y qué datos copia.

  2. Mapea cada carga de trabajo existente a la carga de trabajo de Fabric que puede reemplazarla:

    Carga de trabajo heredada Carga de trabajo de Fabric
    Orquestación de datos y ETL Fábrica de Datos
    Cuadernos de Spark y procesamiento de lakehouse Ingeniería de datos
    almacenamiento de datos SQL Almacén de datos
    Transmisión y análisis con KQL Inteligencia en tiempo real
    Entrenamiento de modelos de aprendizaje automático y seguimiento de experimentos Ciencia de Datos
    Bases de datos operativas Bases de datos (base de datos SQL en Fabric y Cosmos DB en Fabric)
    Visualización BI y modelos semánticos Power BI con modo Direct Lake
    IA conversacional basada en datos empresariales Fabric Data Agents, Copilot para Fabric, Fabric IQ
  3. Establecer un modelo de gobernanza y seguridad para todas las cargas de trabajo utilizando la seguridad de OneLake, Microsoft Purview y el catálogo de OneLake. Configurar claves gestionadas por el cliente cuando los elementos Fabric soportados requieren otra capa de cifrado.

  4. Consolida los datos analíticos en OneLake utilizando el formato Delta o Iceberg para que las cargas de trabajo puedan compartir una base de datos gobernada. Incluye cargas de trabajo operativas consolidándolas en bases de datos Fabric, que permiten que los datos analíticos sincronizados estén disponibles en OneLake.

  5. Basa la IA en los datos consolidados. Crea ontologías (versión preliminar) sobre tu capa de datos curada y ponlas a disposición de los agentes a través del servidor MCP de ontologías, para que Fabric Data Agents, Microsoft 365 Copilot y las herramientas externas razonen sobre el mismo contexto gobernado. Puedes generar definiciones de ontologías a partir de modelos semánticos de Power BI en modo Import, Direct Lake o DirectQuery. Utiliza el modo Direct Lake cuando necesites enlaces generados a datos de OneLake compatibles y revisa las limitaciones actuales de la ontología.

  6. Para motores externos que aún no puedes retirar, expón los datos de OneLake a través de la integración de Azure Databricks, la interoperabilidad de Iceberg con Snowflake, o el acceso y APIs de OneLake.

  7. Retira las herramientas, las copias de datos y las canalizaciones sustituidas una vez validado su equivalente en Fabric. De este modo, la consolidación elimina costes, licencias y transferencias en lugar de añadir otra plataforma al montón.

Capacidades de consolidación de plataformas

Compartición externa de datos entre organizaciones

Si intercambias datos con socios, proveedores, clientes u otras divisiones de forma continua, las exportaciones por lotes, transferencias de archivos y sistemas duplicados aguas abajo añaden brechas de latencia, coste y gobernanza. El patrón de intercambio externo de datos ofrece a los consumidores externos a tu organización o división de negocio acceso directo a datos seleccionados de OneLake sin exportaciones recurrentes. Los consumidores pueden acceder a los datos mediante el intercambio entre inquilinos de Fabric o desde plataformas externas de análisis como Snowflake y Azure Databricks utilizando las capacidades de interoperabilidad de OneLake.

Los consumidores ven las actualizaciones a medida que las publicas. Controlas el acceso a los datos fuente mediante el mecanismo de compartición o interoperabilidad que soporta la plataforma del consumidor.

Use este patrón cuando:

  • Intercambias datos con organizaciones externas de forma continua.
  • Las exportaciones por lotes o transferencias de archivos añaden latencia, complejidad o lagunas de gobernanza.
  • Necesitas rastrear y revocar el acceso externo de forma centralizada.

Aplicar el intercambio externo de datos

El intercambio externo funciona mejor cuando usas virtualización en lugar de exportar datos. Compara el método de acceso con lo que cada consumidor pueda leer y aplica los controles de acceso soportados por ese mecanismo de compartición o interoperabilidad.

  1. Identifica los productos de datos que quieres compartir externamente y los consumidores que los necesitan (socios, proveedores, clientes). Normalmente, compartes tablas y archivos seleccionados que están bien definidos y documentados.

  2. Elige el enfoque de compartir adecuado para cada consumidor:

    Tipo de consumidor Enfoque recomendado
    Usuarios de Fabric en otro inquilino Compartición externa de datos para acceso virtualizado entre inquilinos de solo lectura
    Usuarios de Snowflake en Azure Interoperabilidad de Iceberg con Snowflake para leer tablas Fabric expuestas en formato Iceberg
    Usuarios de Azure Databricks Federación de catálogos OneLake en Azure Databricks para consultar tablas OneLake a través de Unity Catalog sin copiar datos
    Aplicaciones o herramientas que soportan ADLS Gen2 o APIs Blob Acceso a OneLake y APIs para acceder a datos de OneLake a través de APIs compatibles

    Para incorporar datos de Dataverse a OneLake antes de compartirlos, utiliza el patrón de acceso unificado a los datos.

  3. Alcance el acceso externo con los permisos soportados por el mecanismo de compartición seleccionado. Para el intercambio externo de datos de Fabric, el recurso compartido concede acceso de solo lectura a cualquier usuario en el inquilino principal del usuario invitado. Las políticas de seguridad y gobernanza del lado del proveedor, incluyendo la seguridad de OneLake, las etiquetas de sensibilidad y las políticas de prevención de pérdida de datos, no se aplican en el inquilino del consumidor. El cliente debe gestionar el acceso posterior en su entorno.

  4. Acordad desde el principio los términos de cada relación de compartición - qué se comparte, con quién y durante cuánto tiempo. Para el intercambio externo de datos de Fabric, revoca el acceso desde la pestaña Compartidos de datos externos en la página de Gestionar permisos. Para otros enfoques, revoca el acceso mediante el mecanismo de compartición seleccionado. Confirma que el consumidor pierde visibilidad.

  5. Aplica etiquetas de sensibilidad, auditoría y prevención de pérdida de datos con Microsoft Purview en el entorno Fabric del proveedor.

  6. Avala y documenta los productos de datos fuente en el catálogo de OneLake para que los proveedores puedan encontrarlos y gobernarlos antes de compartirlos. El catálogo de OneLake no publica productos de datos para inquilinos externos ni plataformas de análisis.

Capacidades externas de intercambio de datos

  • Virtualización de datos - Compartir datos mediante referencias sin copia sin gestionar las canalizaciones de exportación. Funciones:
  • Interoperabilidad de datos abiertos - Comparte con los consumidores que no usan Fabric publicando en formatos abiertos. Funciones:
  • Gobernanza centralizada - Gobernar los datos fuente en Fabric y controlar el acceso externo a través de cada mecanismo de compartición. Funciones:
    • La seguridad de OneLake delimita el acceso a los datos de origen en Fabric.
    • Microsoft Purview aplica etiquetas de sensibilidad, auditoría y prevención de pérdida de datos en el entorno Fabric del proveedor.
    • El catálogo de OneLake permite el descubrimiento y endoso por parte del proveedor antes de compartir.