Déplacer un fichier de préparation visuelle des données en production

Chaque fichier de préparation des données visuelles que vous générez dans Lakeflow Designer est soutenu par du code prêt pour la production et stocké en tant que notebook nommé <name>.designer.ipynb. Vous pouvez le déplacer en production avec les mêmes outils que ceux que vous utilisez pour d’autres Azure Databricks code : stockez-le dans Git, exécutez-le en tant que travail et déployez-le avec des bundles Automation déclaratifs.

Cette page explique comment faire passer un fichier de préparation visuelle des données du stade de prototype à la production.

Stocker et version dans Git

L’espace de travail stocke les fichiers de préparation de données visuelles en mode natif. Pour gérer les versions d’un fichier de préparation visuelle des données, placez-le dans un dossier Git et suivez-le comme n’importe quel autre notebook :

  1. Créez un dossier Git dans votre espace de travail.
  2. Déplacez le fichier de préparation des données visuelles dans ce dossier Git.
  3. Effectuez le suivi, la validation et la version du fichier comme n’importe quel autre notebook dans Git. Dans Git, le fichier apparaît sous la forme <file_name>.designer.ipynb.

Pour plus d’informations sur les dossiers Git, consultez Azure Databricks dossiers Git. Pour exporter ou importer un fichier de préparation de données visuelles, consultez Exporter et importer un fichier de préparation de données visuelles.

Planifier comme tâche

Vous pouvez automatiser un fichier de préparation des données visuelles en le planifiant en tant que travail.

  • Planifier directement : cliquez sur le bouton Planifier dans le menu supérieur pour créer un travail planifié pour votre fichier de préparation des données visuelles.
  • Ajouter à un travail : créez un travail Azure Databricks et ajoutez votre fichier de préparation de données visuelles en tant que tâche. Cela vous permet de combiner ce fichier de préparation des données visuelles avec d’autres tâches dans un pipeline plus volumineux. Dans la liste déroulante Type de tâche, sélectionnez Préparation des données visuelles, puis sélectionnez le fichier.

Les exécutions planifiées affichent chaque opérateur sous la forme d’un nœud distinct dans le graphe de tâches Jobs, afin que vous puissiez examiner les résultats de chaque opérateur dans une exécution de la même manière que sur le canevas.

Pour afficher et gérer les planifications existantes, cliquez à nouveau sur Planification pour ouvrir la liste. Cliquez sur Ajouter une planification pour créer une autre ou ouvrez l’icône de menu Kebab d’une planification. Menu kebab pour modifier, exécuter maintenant, suspendre, cloner, afficher dans les travaux ou le supprimer .

Afficher la sortie de l’opérateur dans une exécution

Par défaut, une exécution planifiée génère la sortie uniquement pour les opérateurs de terminal (opérateurs sans connexion en aval), comme un opérateur de sortie. Pour afficher les résultats de chaque opérateur de l’exécution, développez les paramètres avancés dans la boîte de dialogue planification et sélectionnez Afficher la sortie de l’opérateur.

Contrôle de planification LFD pour automatiser un fichier de préparation de données visuelles en tant que travail.

Désactivez cette option pour les grands canevas afin d’éviter de dépasser la limite de taille de sortie d’exécution.

Sélectionner l’environnement serverless

Lorsque vous utilisez un fichier de préparation des données visuelles, vous pouvez sélectionner l’environnement serverless utilisé pour les exécutions interactives et les travaux planifiés. Configurez-le à partir de l’icône Environnement.Volet latéral environnement dans la barre latérale droite, de la même façon que pour un bloc-notes. Sous Environnement de base, sélectionnez une version d’environnement. Consultez Configurer l’environnement serverless.

Paramétrer entre les environnements

Les paramètres sont des valeurs nommées définies pour le fichier de préparation des données visuelles dans l’ensemble que vous pouvez référencer à partir de SQL et d’opérateurs Python. Pour plus d’informations sur la définition et le référencement des paramètres, consultez Paramètres.

Les paramètres vous permettent d’exécuter le même fichier de préparation de données visuelles sur différents environnements, par exemple un catalogue de tests pendant le développement et un catalogue de production en production.

  • Lorsque vous planifiez un travail dans l’interface utilisateur : remplacez les valeurs des paramètres pour chaque planification. Par exemple, créez une planification qui s’exécute avec un paramètre environment défini sur test, et une autre qui s’exécute avec ce paramètre défini sur production.
  • Lorsque vous effectuez un déploiement à l’aide d’un bundle : définissez les valeurs des paramètres via le parameters du job et utilisez les cibles du bundle pour fournir des valeurs différentes selon l’environnement. Les cibles de développement et de production groupées vous permettent de déployer le même travail dans des environnements distincts avec des paramètres spécifiques à l’environnement. Consultez les modes de déploiement des bundles Automation déclaratifs et la configuration des bundles Automation déclaratifs.

Au moment de l’exécution, un fichier de préparation des données visuelles lit ses paramètres de la même façon qu’il s’exécute de manière interactive ou en tant que travail, de sorte que le même fichier fonctionne dans tous vos environnements sans modification.

Lire dans différentes tables selon l’environnement

Pour lire à partir d’une table source différente dans chaque environnement, utilisez un opérateur SQL avec des paramètres au lieu d’un opérateur source fixe. Définissez catalog, schemaet table les paramètres, puis référencez-les avec la IDENTIFIER() clause pour générer dynamiquement le nom de la table :

SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)

Redéfinissez les paramètres catalog, schema ou table pour chaque planification ou cible de bundle afin que le même fichier de préparation visuelle des données pointe vers des données de test pendant le développement et vers des données de production en production. Pour plus d’informations sur la IDENTIFIER() clause, consultez IDENTIFIER clause.

Déployer avec des ensembles d’automatisation déclaratifs

Les offres groupées Automation déclaratives vous permettent de définir et de déployer des ressources Azure Databricks telles que des travaux comme des fichiers sources. Vous pouvez donc appliquer des bonnes pratiques d’ingénierie logicielle telles que le contrôle de code source, la révision du code, les tests et CI/CD à vos fichiers de préparation de données visuelles. Voir Qu’est-ce que les paquets d’automatisation déclarative ?.

Pour déployer un fichier de préparation visuelle des données avec un bundle, définissez une tâche de notebook et indiquez le chemin du fichier .designer.ipynb dans notebook_task.notebook_path. Dans un bundle, un fichier de préparation visuelle des données utilise la clé notebook_task, même si l’interface utilisateur Jobs l’affiche comme type de tâche Préparation visuelle des données.

L’exemple suivant définit un travail qui exécute un fichier de préparation de données visuelles situé en regard du fichier de configuration de l’offre groupée :

resources:
  jobs:
    daily_prep_job:
      name: daily_prep_job
      tasks:
        - task_key: run_visual_data_prep
          notebook_task:
            notebook_path: ./my_transformation.designer.ipynb

Déployez et exécutez le bundle avec l’interface CLI Azure Databricks :

databricks bundle deploy
databricks bundle run daily_prep_job

Pour l’ensemble complet des clés de tâche de notebook, consultez Notebook task. Pour obtenir un guide complet sur la définition d’un job dans un bundle, consultez Développer un job avec des bundles d’automatisation déclaratifs.

Automatiser avec CI/CD

Pour valider et déployer automatiquement des bundles de préparation des données visuelles, intégrez-les dans un pipeline CI/CD. Pour obtenir un exemple utilisant GitHub Actions, consultez GitHub Actions.

Ressources supplémentaires