Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
El proyecto sdp-meta de Databricks Labs proporciona herramientas para generar canalizaciones a partir de los metadatos que mantienes.
Note
El proyecto código abierto sdp-meta, como todos los proyectos en la cuenta de GitHub de databrickslabs, existe solo con fines de exploración. Azure Databricks no lo admite ni proporciona acuerdos de nivel de servicio (SLA) para él. No presente tickets de soporte de Azure Databricks para problemas relacionados con este proyecto. En su lugar, abra una incidencia en GitHub, que se revisará cuando el tiempo lo permita.
¿Qué es sdp-meta?
Las canalizaciones de Lakeflow permiten especificar mediante declaración una tabla y generar un flujo en una canalización que crea la tabla y la mantiene actualizada a medida que cambian los datos de origen. Sin embargo, si su organización tiene cientos de tablas, la generación y administración de estas canalizaciones consume mucho tiempo y puede provocar prácticas incoherentes.
El proyecto sdp-meta es un marco de metaprogramación basado en metadatos diseñado para funcionar con pipelines Lakeflow. Este marco permite la automatización de canalizaciones de datos bronce y plata aprovechando los metadatos registrados en un conjunto de archivos JSON y YAML. En tiempo de ejecución, los pipelines genéricos leen tus metadatos y construyen dinámicamente los flujos descritos en ellos. El procesamiento de bronce y plata puede funcionar en tuberías separadas o juntas en una tubería combinada. Generas los metadatos sobre tus pipelines, y sdp-meta genera tus pipelines.
Con la lógica centralizada en un solo lugar (los metadatos), el sistema es más rápido, reutilizable y fácil de mantener.
Note
El proyecto sdp-meta se llamaba dlt-metaanteriormente , en referencia a la antigua función Delta Live Tables en Azure Databricks.
Delta Live Tables ha sido reemplazado por oleoductos Lakeflow, y sdp-meta trabaja con los oleoductos Lakeflow. Si vas a actualizar una instalación existente dlt-meta , consulta la guía de migración en la documentación de sdp-meta.
Beneficios del sdp-meta
Existen dos casos principales de uso para sdp-meta:
- Importe y limpie varias tablas de manera simple.
- Aplique estándares de ingeniería de datos en varias canalizaciones y usuarios.
Entre las ventajas del uso de un enfoque controlado por metadatos se incluyen:
- El mantenimiento de metadatos se puede realizar sin tener conocimiento del código de Python o SQL.
- El mantenimiento de metadatos, en lugar del código, requiere menos sobrecarga y reduce los errores.
- El código se genera con sdp-meta, por lo que se mantiene consistente y tiene menos código personalizado entre pipelines y tablas publicadas.
- Puede agrupar fácilmente tablas en canalizaciones dentro de los metadatos, generando el número de canalizaciones necesarias para actualizar los datos de forma más eficaz.
Cómo funciona el sdp-meta
La siguiente imagen muestra una visión general del sistema sdp-meta:
- Creas los archivos de metadatos como entrada para sdp-meta, para especificar tus archivos fuente y salidas, las reglas de calidad y el procesamiento requerido. Estos archivos de incorporación pueden escribirse en JSON o YAML.
- Ejecutas la tarea de incorporación de sdp-meta. El motor compila los archivos de incorporación en una especificación de flujo de datos, llamada DataflowSpec, y los almacena en tablas Delta (
bronze_dataflowspecysilver_dataflowspec) para su uso posterior. - En tiempo de ejecución, una tubería genérica lee el DataflowSpec y construye dinámicamente el grafo de procesamiento bronce. Lee tus datos de origen (archivos, flujos o CDC) y aplica las expectativas de datos adecuadas para que se ajusten a tus reglas de calidad, generando tus tablas bronce y poniendo en cuarentena los registros que no cumplen esas reglas.
- El procesamiento de plata puede ejecutarse en una tubería genérica separada, que es la opción predeterminada para los paquetes de automatización declarativa, o en la misma tubería cuando se usa el modo combinado. La canalización utiliza DataflowSpec para aplicar las transformaciones adecuadas y otras operaciones de procesamiento, lo que genera tablas de plata limpias, enriquecidas y listas para el análisis.
Ejecutas las pipelines generadas por sdp-meta para mantener la salida actualizada a medida que se actualizan tus datos fuente.
Get started
Para usar sdp-meta, debes:
- Desplega y configura la solución sdp-meta.
- Prepare los metadatos para las tablas de la capa bronce y plata.
- Cree un trabajo para incorporar los metadatos.
- Use los metadatos para crear canalizaciones para las tablas.
El proyecto sdp-meta soporta varias interfaces de despliegue: paquetes (recomendado), una CLI interactiva, una aplicación Databricks con interfaz gráfica basada en navegador, un servidor MCP para la configuración asistida por IA y un Agent Skill portátil para agentes de IA conscientes de la habilidad.
La documentación sdp-meta en GitHub tiene un tutorial para ayudarte a empezar este proceso. Para más información, consulta cómo empezar con sdp-meta en GitHub.