Traslado de un archivo de preparación de datos visuales a producción

Cada archivo de preparación de datos visuales que compile en Lakeflow Designer está respaldado por código listo para producción y se almacena como un cuaderno denominado <name>.designer.ipynb. Puede moverlo a producción con las mismas herramientas que usa para otros Azure Databricks código: almacenarlo en Git, ejecutarlo como trabajo e implementarlo con paquetes de automatización declarativos.

En esta página se explica cómo tomar un archivo de preparación de datos visuales de prototipo a producción.

Almacenamiento y versión en Git

El área de trabajo almacena archivos de preparación de datos visuales de forma nativa. Para obtener una versión de un archivo de preparación de datos visuales, colóquelo en una carpeta de Git y realice un seguimiento de él como cualquier otro cuaderno:

  1. Cree una carpeta git en el área de trabajo.
  2. Mueva el archivo de preparación de datos visuales a esa carpeta git.
  3. Realice un seguimiento, confirme y versione el archivo como cualquier otro cuaderno de Git. En Git, el archivo aparece como <file_name>.designer.ipynb.

Para obtener más información sobre las carpetas de Git, consulte Azure Databricks carpetas de Git. Para exportar o importar un archivo de preparación de datos visuales, consulte Exportación e importación de un archivo de preparación de datos visuales.

Programación como trabajo

Puede automatizar un archivo de preparación de datos visuales programandolo como un trabajo.

  • Programar directamente: haga clic en el botón Programar del menú superior para crear un trabajo programado para el archivo de preparación de datos visuales.
  • Agregar a un trabajo: cree un trabajo de Azure Databricks y agregue su archivo de preparación visual de datos como una tarea. Esto le permite combinar ese archivo de preparación visual de datos con otras tareas en un flujo de trabajo más amplio. En la lista desplegable Tipo de tarea, seleccione Preparación de datos visuales y, a continuación, seleccione el archivo.

Las ejecuciones programadas muestran cada operador como un nodo individual en el gráfico de tareas de Jobs, para que pueda inspeccionar los resultados de cada operador en cada ejecución igual que en el lienzo.

Para ver y administrar las programaciones existentes, haga clic en Programar de nuevo para abrir la lista. Haga clic en Agregar programación para crear otra, o abra el menú kebab de una programación en el Icono de menú Kebab para Editar, Ejecutar ahora, Pausar, Clonar, Ver en Tareas o Eliminar.

Mostrar salida del operador en una ejecución

De forma predeterminada, una ejecución programada genera resultados solo para los operadores terminales (operadores sin conexión aguas abajo), como un operador de Salida. Para ver los resultados de cada operador en la ejecución, expanda Configuración avanzada en el cuadro de diálogo programación y seleccione Mostrar salida del operador.

Control de programación de LFD para automatizar un archivo de preparación visual de datos como tarea.

Desactive esta opción para lienzos grandes para evitar superar el límite de tamaño de salida de ejecución.

Selección del entorno sin servidor

Al trabajar con un archivo de preparación de datos visuales, puede seleccionar el entorno sin servidor que se usa para ejecuciones interactivas y trabajos programados. Configúrelo desde el icono Entorno.Panel lateral del entorno en la barra lateral derecha, de la misma manera que lo hace para un cuaderno. En Entorno base, seleccione una versión del entorno. Consulte Configuración del entorno sin servidor.

Parametrizar entre entornos

Los parámetros son valores con nombre definidos para el archivo de preparación de datos visuales como un todo al que puede hacer referencia desde operadores SQL y Python. Para obtener más información sobre cómo definir y hacer referencia a parámetros, consulte Parámetros.

Los parámetros permiten ejecutar el mismo archivo de preparación de datos visuales en distintos entornos, por ejemplo, un catálogo de pruebas durante el desarrollo y un catálogo de producción en producción.

  • Al programar un trabajo en la interfaz de usuario: invalide los valores de parámetro para cada programación. Por ejemplo, cree una programación que se ejecute con un parámetro environment establecido en test y otra que se ejecute con él establecido en production.
  • Al implementar con un paquete: establezca los valores de los parámetros mediante el parameters del trabajo y use destinos del paquete para proporcionar valores distintos para cada entorno. Los objetivos de desarrollo y producción del paquete permiten desplegar el mismo trabajo en entornos separados con configuraciones específicas de cada entorno. Consulte Declarative Automation Bundles deployment modes y Declarative Automation Bundles configuration.

En tiempo de ejecución, un archivo de preparación de datos visuales lee sus parámetros de la misma manera si se ejecuta interactivamente o como un trabajo, por lo que el mismo archivo funciona en todos los entornos sin cambios.

Lectura de tablas diferentes por entorno

Para leer desde una tabla de origen diferente en cada entorno, use un operador SQL con parámetros en lugar de un operador source fijo. Defina los parámetros catalog, schema y table y, a continuación, haga referencia a ellos con la cláusula IDENTIFIER() para construir dinámicamente el nombre de la tabla:

SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)

Anule los parámetros catalog, schema o table para cada programación o destino del paquete, de modo que el mismo archivo de preparación visual de datos apunte a datos de prueba durante el desarrollo y a datos de producción en producción. Para obtener más información sobre la cláusula IDENTIFIER(), consulte la cláusula IDENTIFIER.

Desplegar con paquetes de automatización declarativa

Los paquetes de automatización declarativa le permiten definir y desplegar recursos de Azure Databricks, como trabajos, en archivos fuente, para que pueda aplicar prácticas recomendadas de ingeniería de software, como el control de código fuente, la revisión de código, las pruebas y CI/CD, a sus archivos de preparación visual de datos. Consulte ¿Qué son los conjuntos de automatización declarativos?.

Para desplegar un archivo de preparación visual de datos con un paquete, defina una tarea de notebook y haga referencia a la ruta de acceso del archivo .designer.ipynb en notebook_task.notebook_path. En un paquete, un archivo de preparación visual de datos utiliza la clave notebook_task, aunque la interfaz de usuario de Trabajos lo muestre como un tipo de tarea de Preparación visual de datos.

En el ejemplo siguiente se define un trabajo que ejecuta un archivo de preparación de datos visuales situado junto al archivo de configuración de agrupación:

resources:
  jobs:
    daily_prep_job:
      name: daily_prep_job
      tasks:
        - task_key: run_visual_data_prep
          notebook_task:
            notebook_path: ./my_transformation.designer.ipynb

Implemente y ejecute la agrupación con la CLI de Azure Databricks:

databricks bundle deploy
databricks bundle run daily_prep_job

Para obtener el conjunto completo de claves de tarea del cuaderno, consulte Tarea cuaderno. Para ver un tutorial completo sobre cómo definir un trabajo en una agrupación, consulte Desarrollo de un trabajo con agrupaciones de automatización declarativa.

Automatiza con CI/CD

Para validar y desplegar paquetes de preparación visual de datos automáticamente, intégrelos en una canalización de CI/CD. Para obtener un ejemplo de uso de Acciones de GitHub, consulte Acciones de GitHub.

Recursos adicionales