Créer une préparation de données visuelles dans le Concepteur Lakeflow

Lakeflow Designer vous permet de créer des flux de travail de transformation de données sur un canevas visuel, glisser-déplacer. Cette page explique comment créer une préparation visuelle des données, de l’ajout d’une source de données et de l’enchaînement des opérateurs à la prévisualisation des résultats et à l’écriture dans Unity Catalog.

Exigences

Pour utiliser Lakeflow Designer, vous devez disposer des éléments suivants :

  • Un espace de travail Azure Databricks avec Unity Catalog activé.
  • CAN USE autorisation d’utiliser au moins une ressource de calcul à usage général (serverless ou polyvalente).

Sélectionnez le calcul à utiliser dans le sélecteur de calcul en haut à droite du Concepteur, en regard du bouton Planification .

Créer une préparation visuelle des données

Pour créer une préparation des données visuelles, cliquez sur l’icône Plus.Nouveautés de la barre latérale et sélectionnez Préparation des données visuelles.

Designer s’ouvre sur un écran d’accueil où vous pouvez ajouter une source de données ou explorer un exemple de préparation visuelle des données.

Pour rechercher vos fichiers de préparation de données visuelles existants, ouvrez la page de préparation des données visuelles à partir de la barre latérale. Cette page répertorie tous vos fichiers de préparation de données visuelles et inclut une vidéo de prise en main pour vous aider à commencer à utiliser Lakeflow Designer.

Ajouter une source de données

Chaque préparation des données visuelles commence par une ou plusieurs sources de données. L’opérateur Source représente une source de données sur le canevas.

Pour ajouter une source de données :

  1. Ajoutez un opérateur Source. Dans l’écran d’accueil, cliquez sur Sélectionner l’opérateur source. Dans le canevas, ouvrez le menu opérateur et sélectionnez Source.
  2. Dans le volet De configuration source , choisissez comment importer vos données :
    • Sélectionnez une table existante.
    • Chargez un fichier CSV ou Excel local.
    • Créez une table à partir d’un fichier.
    • Importez à partir de Google Drive ou SharePoint.
  3. Sélectionnez ou configurez votre source de données. L’opérateur Source apparaît sur le canevas.

Vous pouvez également faire glisser-déplacer un fichier CSV ou Excel directement sur le canevas pour créer rapidement un opérateur source.

Pour modifier la source ultérieurement, ouvrez l’opérateur Source et cliquez sur Sélectionner une nouvelle source de données. La modification de la source invalide le cache de sortie pour tous les opérateurs en aval.

Pour plus d’informations sur chaque option d’ingestion, consultez Ingestion de données dans Lakeflow Designer.

Ajouter et configurer des opérateurs

Pour ajouter un opérateur, ouvrez le menu opérateur dans le volet latéral sur le côté gauche du canevas. Cliquez sur un opérateur pour l’ajouter au canevas ou faites glisser un opérateur du menu vers le canevas. Vous pouvez également cliquer sur le + bouton en regard de n’importe quel opérateur existant pour ajouter un nouvel opérateur avec une connexion automatique.

Menu opérateur LFD avec glisser-déplacer sur le canevas.

Pour configurer un opérateur, double-cliquez dessus ou pointez dessus, puis cliquez sur l’icône Crayon. (Opérateur Modifier) pour ouvrir le volet de configuration. Définissez les options de ce type d’opérateur, puis cliquez sur Appliquer.

Pour plus d’informations sur chaque opérateur disponible, consultez les opérateurs intégrés dans Lakeflow Designer. Pour plus d’informations sur la création de vos propres opérateurs définis par l’utilisateur, consultez Les opérateurs définis par l’utilisateur dans Lakeflow Designer.

Opérateurs de connexion

Pour connecter deux opérateurs, cliquez et faites glisser de la poignée de sortie (le petit cercle sur le bord droit d’un opérateur) vers la poignée d’entrée (le petit cercle sur le bord gauche de l’opérateur suivant). Cela spécifie que les données circulent du premier opérateur dans la seconde. Les données circulent de gauche à droite via la préparation des données visuelles.

Canevas LFD montrant une connexion entre deux opérateurs.

Certains opérateurs, tels que Join and Combine, acceptent plusieurs entrées.

Pour supprimer une connexion, survolez-la et cliquez sur l’icône Corbeille dans la barre d’outils qui apparaît au-dessus de la connexion.

Utiliser le code Genie

À tout moment lors de la modification dans Lakeflow Designer, vous pouvez créer des commandes vers Genie Code afin d'obtenir de l'aide. Voir Le code Genie.

Prompt de code de LFD Genie

Lorsque vous utilisez Genie Code, les boutons suivants fournissent des fonctionnalités supplémentaires :

  • Icône Paperclip.  : Attache un fichier à utiliser dans le cadre de l’invite.
  • Icône arobase.  : sert à mentionner des objets, tels que des tables ou des fichiers, à utiliser comme partie du message de prompt.
  • Bulle vocale plus icône.  : démarre un nouveau thread de conversation avec un nouveau contexte d’agent.
  • Icône mode Lecteur.  : ouvre le volet latéral de l’historique des conversations et une vue plus détaillée de ce que fait l’agent.

Genie Code affiche un résumé d’une ligne de sa modification la plus récente au-dessus de la zone d’entrée.

Aperçu des résultats

Sélectionnez n’importe quel opérateur pour afficher les résultats dans le volet de sortie en bas de l’écran. Pour la plupart des types d’opérateurs, les données d’entrée se situent à gauche et les données de sortie se situent à droite. Les opérateurs qui produisent des résultats non table, tels que des tracés, du code HTML ou des images, affichent ces sorties directement dans le volet de sortie.

Utilisez le contrôle d’affichage dans le volet de sortie pour basculer entre l’entrée et la sortie (valeur par défaut), l’entrée uniquement ou la sortie uniquement. Dans l’affichage combiné, faites glisser le séparateur pour redimensionner les volets d’entrée et de sortie.

Volet de sortie LFD sous le canevas.

Par défaut, les opérateurs traitent un échantillon limité de données, pour les préversions. Utilisez le menu déroulant Lignes analysées dans le volet de sortie pour contrôler le nombre de lignes à traiter :

  • Lignes analysées : Limite : traite les premières lignes d’entrée N. Spécifiez le nombre de lignes dans le champ à côté du menu déroulant.
  • Lignes analysées : Max : traite toutes les lignes d’entrée.

Avertissement

L’exécution avec Lignes analysées : Max réexécute tous les opérateurs en amont avec l’ensemble complet des données, sans limite. Ce processus peut être chronophage.

Le paramètre Lignes analysées contrôle uniquement le traitement de l’aperçu. Les exécutions planifiées et les exécutions de travaux traitent toujours le jeu de données complet.

Écrire des résultats

Ajoutez un opérateur de sortie pour écrire vos résultats. L’opérateur Output peut écrire dans une table de catalogue Unity, publier des résultats en tant qu’affichage matérialisé ou écrire un fichier CSV, Excel ou JSON dans un volume de catalogue Unity.

  1. Ouvrez le menu opérateur et sélectionnez Sortie, ou cliquez à côté de votre dernier opérateur et sélectionnez +.
  2. Connectez le handle de sortie de votre dernière transformation au handle d’entrée de l’opérateur de sortie s’il n’est pas déjà connecté.
  3. Double-cliquez sur l’opérateur Sortie pour ouvrir son volet de configuration.
  4. Sélectionnez un type de sortie et configurez la destination. Pour une table, entrez un nom de table, sélectionnez l’emplacement de sortie (catalogue et schéma), puis sélectionnez un mode Écriture.
  5. Cliquez sur Exécuter.

Pour obtenir l’ensemble complet des types de sortie et des modes d’écriture, consultez Sortie.

Planifier ou exécuter en production

Vous pouvez automatiser vos flux de travail en les planifiant en tant que travaux. Cliquez sur le bouton Planifier dans le menu supérieur pour créer un travail planifié pour la préparation des données visuelles ou ajoutez la préparation des données visuelles à un travail de Azure Databricks plus volumineux en tant que tâche.

Pour déplacer une préparation de données visuelles vers la production, notamment le stocker dans Git, le déployer avec des bundles Automation déclaratifs et le paramétrer dans les environnements, consultez Déplacer un fichier de préparation de données visuelles en production.

Contrôle de planification LFD pour automatiser une préparation visuelle des données sous forme de travail.

Exporter et importer un fichier de préparation de données visuelles

Les fichiers de préparation des données visuelles sont stockés en mode natif dans l’espace de travail. Vous pouvez les exporter et les importer pour les déplacer entre des espaces de travail ou les partager.

Pour exporter un fichier de préparation de données visuelles :

  1. Cliquez sur l’icône de menu Kebab. Dans le coin supérieur droit.
  2. Sélectionnez Exportation de fichier>.
  3. Le fichier est exporté en tant que <file_name>.designer.ipynb.

Pour importer un fichier de préparation des données visuelles :

  1. Dans le système de fichiers de l’espace de travail, cliquez sur l’icône du menu Kebab..
  2. Cliquez sur Importer.
  3. Sélectionnez le fichier de préparation des données visuelles à importer.

Pour versionr un fichier de préparation de données visuelles avec Git et le mettre en production, consultez Déplacer un fichier de préparation de données visuelles en production.

Renommer un fichier de préparation des données visuelles

Pour renommer un fichier de préparation des données visuelles, cliquez sur l’onglet affichant son nom en haut de l’éditeur, puis entrez un nouveau nom.

Supprimer un fichier de préparation de données visuelles

Pour supprimer un fichier de préparation visuelle des données, ouvrez le menu Icône de menu kebab du fichier et sélectionnez Déplacer vers la corbeille.

Pour supprimer plusieurs fichiers de préparation de données visuelles à la fois, ouvrez l’espace de travail à partir du volet de navigation gauche, sélectionnez les fichiers que vous souhaitez supprimer, puis sélectionnez Déplacer vers la corbeille en haut de la liste.

Conseils supplémentaires lors de l’utilisation du canevas

Les actions suivantes sont disponibles sur le canevas pour vous aider à modifier la préparation de vos données visuelles.

  • Renommer un opérateur : cliquez sur la zone située en haut de n’importe quel volet de configuration pour renommer l’opérateur. Les noms descriptifs facilitent la compréhension de la préparation de vos données visuelles en un clin d’œil. Certains opérateurs, tels que l’opérateur SQL, peuvent référencer la sortie d’autres opérateurs par nom.
  • Copiez un opérateur : pointez sur un opérateur et cliquez sur Copier l’icône. Ou sélectionnez un opérateur, puis appuyez sur Cmd/Ctrl+C , puis Sur Cmd/Ctrl+V.
  • Supprimer un opérateur : pointez sur un opérateur et cliquez sur l’icône Corbeille. Dans la barre d’outils qui apparaît au-dessus de celle-ci, ou sélectionnez l’opérateur, puis appuyez sur Supprimer.
  • Mise en page automatique : cliquez sur l’icône horizontale DAG. Dans la barre d’outils d’en-tête, organisez automatiquement tous les opérateurs dans une disposition compacte.
  • Affichage ajusté : cliquez sur Zoomez pour ajuster l’icône. dans la barre d’outils d’en-tête pour afficher tous les opérateurs dans la fenêtre d’affichage actuelle.
  • Annuler et rétablir : appuyez sur Cmd/Ctrl+Z et Cmd/Ctrl+Maj+Z, ou utilisez les boutons annuler et rétablir dans la barre d’outils d’en-tête.
  • Ouvrez la palette de commandes : appuyez sur Cmd+Maj+P sur macOS ou Ctrl+Maj+P sur Windows pour accéder rapidement aux actions de l’éditeur.
  • Afficher le code généré : ouvrez l’onglet Table des matières dans le menu de gauche, sélectionnez un opérateur, puis développez la section Code généré pour voir le code que Designer génère pour cet opérateur. Pour plus d’informations, consultez la table des matières.
  • Afficher l’historique des versions : cliquez sur l’icône Historique. dans le volet de droite pour ouvrir l’historique des versions de la préparation visuelle des données, qui répertorie ses modifications. Sélectionnez une version pour la comparer à la version suivante.

Ressources supplémentaires