Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Lakeflow Designer inclut des opérateurs intégrés pour les tâches courantes de préparation et de transformation des données. Ouvrez le menu opérateur dans le volet latéral de gauche pour parcourir les opérateurs par catégorie, ou utilisez Rechercher un opérateur... en haut du volet. La recherche d’opérateurs suggère des opérateurs en fonction de votre intention. Par exemple, la saisie average by month retourne l’opérateur Aggregate . Pour configurer un opérateur après l’avoir ajouté au canevas, double-cliquez dessus ou pointez dessus, puis cliquez sur (Opérateur Modifier) pour ouvrir le volet de configuration.
Chaque opérateur affiche une description générée par l’IA de ce qu’il fait. La description agit également en tant qu’éditeur pour l’opérateur : la modification de la description reconfigure l’opérateur pour qu’elle corresponde à votre description.
Pour savoir comment créer vos propres opérateurs définis par l’utilisateur, consultez les opérateurs définis par l’utilisateur dans Lakeflow Designer.
Source et sortie
Source
Importe des données dans le Concepteur à partir d’une table de catalogue Unity ou d’une autre source prise en charge. Pour sélectionner une source, recherchez une table ou un fichier par nom, ou parcourez le catalogue et le schéma. Vous pouvez également créer une table à partir de ce volet.
Après avoir sélectionné une table, le volet affiche le nom, le propriétaire et l’heure de la dernière mise à jour de la table. Cliquez sur Sélectionner une nouvelle source de données pour modifier la source. La modification de la source invalide le cache de sortie pour tous les opérateurs en aval.
Vous pouvez également utiliser une vue de métrique du catalogue Unity comme source. Lorsque vous sélectionnez une vue de métrique, sélectionnez les dimensions et les mesures à inclure, et le Concepteur génère la requête agrégée pour vous.
Pour obtenir la plage complète d’options d’ingestion de données, notamment le ciblage d’un volume ou d’un dossier de catalogue Unity entier, consultez Ingestion de données dans Lakeflow Designer.
Entrer des données
Crée une table en tapant des valeurs dans un éditeur de style feuille de calcul. Utilisez cet opérateur pour ajouter de petites quantités de données de référence, telles que des valeurs de recherche ou des données de test, sans créer de table source distincte.
| Champ | Description |
|---|---|
| Données de table | Entrez vos données sous forme de table. La première ligne définit les en-têtes de colonne et les lignes restantes sont les données. Le concepteur déduit le type de données de chaque colonne à partir de ses valeurs. |
Sortie
Exporte les données hors du Concepteur. L’opérateur Output peut écrire des résultats dans une table de catalogue Unity, les publier en tant qu’affichage matérialisé ou les écrire dans un fichier dans un volume de catalogue Unity. Sélectionnez la destination avec le type de sortie.
| Type de sortie | Description |
|---|---|
| Table | Écrit les résultats dans une table de catalogue Unity managée. Définissez un nom de table et un emplacement de sortie (catalogue et schéma), puis sélectionnez un mode Écriture. |
| Vue matérialisée | Publie les résultats sous la forme d’une vue matérialisée dans le catalogue Unity qui s’actualise lorsque la préparation des données visuelles s’exécute. |
| File | Écrit les résultats dans un fichier dans un volume de catalogue Unity. Sélectionnez un type de fichier CSV, Excel ou JSON, puis définissez le volume cible et le nom de fichier. |
Pour une sortie table ou fichier , sélectionnez la façon dont chaque exécution écrit dans la destination en mode Écriture :
| Mode Écriture | Description |
|---|---|
| Remplacer | Remplace le contenu existant par les résultats de l’exécution actuelle. Il s’agit de la valeur par défaut. |
| Ajouter | Ajoute les résultats de l’exécution actuelle aux lignes existantes. |
| Merge | Upserts lignes dans la table cible en correspondant sur les clés de fusion que vous spécifiez. Disponible pour les sorties de table. |
Cliquez sur Exécuter pour exécuter la préparation des données visuelles et écrire les résultats. Pour une sortie de table, si la table n’existe pas, l’opérateur le crée. Les exécutions planifiées écrivent dans la destination à l’aide du même mode d’écriture.
FONCTION IA
Exécute une opération IA intégrée sur vos données. Dans le volet de configuration, ouvrez Sélectionner une fonction et sélectionnez l’une des fonctions du tableau suivant. Chaque fonction expose des options dans le volet pour les entrées (par exemple, les colonnes, les invites, les étiquettes ou les langues) et les sorties.
| Function | Description |
|---|---|
ai_analyze_sentiment |
Effectue une analyse des sentiments sur le texte d’entrée. |
ai_classify |
Classifie le texte ou les documents analysés à l’aide d’étiquettes que vous fournissez. |
ai_extract |
Extrait des données structurées à partir de documents texte ou analysés à l’aide de champs que vous définissez. |
ai_fix_grammar |
Corrige les erreurs grammaticales dans le texte. |
ai_forecast |
Prévision des données de série chronologique jusqu’à un horizon que vous spécifiez.
ai_forecast est une fonction table qui traite l’intégralité de la table d’entrée. |
ai_gen |
Répond à une invite fournie par l’utilisateur par rapport à l’entrée. |
ai_mask |
Masque les entités spécifiées dans le texte (par exemple, pour la dé-identification). |
ai_parse_document |
Extrait du texte, des tableaux et de la disposition à partir de documents non structurés. |
ai_prep_search |
Transforme la sortie de document analysée en blocs prêts pour la recherche pour les pipelines de recherche et de génération augmentée de récupération (RAG). |
ai_query |
Répond à une invite à l’aide de n’importe quel modèle de base pris en charge, pour une tâche à usage général et une flexibilité de modèle. |
ai_similarity |
Compare deux chaînes et retourne un score de similarité sémantique. |
ai_summarize |
Génère un résumé du texte. |
ai_translate |
Traduit du texte dans une langue cible que vous spécifiez. |
Pour plus d’informations sur chaque fonction, consultez Enrichir des données à l’aide d’AI Functions.
Transformations
Les opérateurs suivants effectuent des transformations sur vos données.
Aggregate
Résume les lignes en regroupant les données et en calculant les valeurs d’agrégation.
| Champ | Description |
|---|---|
| Agréger par | Sélectionnez une colonne, sélectionnez une fonction d’agrégation et fournissez un nom pour la colonne de sortie. Cliquez sur + Ajouter une agrégation pour en ajouter d’autres. Fonctions prises en charge : AVG, MEANMINCOUNTSTDDEVMAXVARIANCEMEDIANPERCENTILESUM. |
| Regrouper par | Sélectionnez les colonnes à regrouper. Cliquez sur + Ajouter un regroupement pour en ajouter d’autres. Les colonnes utilisées dans Group by sont automatiquement incluses dans la sortie. |
Combinaison
Fusionne les données de plusieurs tables avec des schémas correspondants en une seule sortie.
| Champ | Description |
|---|---|
| Opération de réglage | Sélectionnez Union, Intersect ou Except. |
| Stratégie de fusion | Sélectionnez Distinct pour exclure les lignes dupliquées de la sortie, ou Toutes pour conserver toutes les lignes, y compris les doublons. |
Filtrer
Fractionne les lignes selon qu’elles répondent à une ou plusieurs conditions, à l’aide d’un générateur de conditions graphiques.
| Champ | Description |
|---|---|
| Pathologie | Pour chaque condition, sélectionnez une colonne, un type de condition et une valeur à mettre en correspondance conditionnellement. Types de conditions pris en charge :
Pour les conditions sur les colonnes de date, le sélecteur de dates prend en charge la navigation entre les années et les mois. |
L’opérateur Filter a deux sorties pour que vous puissiez créer des données de branche selon qu’elles répondent aux conditions suivantes :
| Sortie | Description |
|---|---|
| Included | Lignes qui répondent aux conditions de filtre. |
| Exclu | Lignes qui ne remplissent pas les conditions de filtre, y compris les lignes où la condition prend la valeur Null. |
Join
Lie deux tables sur une clé en combinant deux jeux de données d’entrée en fonction des valeurs de colonne correspondantes.
| Champ | Description |
|---|---|
| Tables d’entrée | Sélectionnez les deux tables d’entrée à joindre. |
| Condition de jointure | Spécifiez au moins une condition de jointure en sélectionnant les colonnes correspondantes dans les deux tables. Cliquez sur + Ajouter une expression de jointure pour ajouter d’autres conditions. Facultatif : cliquez sur la flèche entre les tables de gauche et de droite pour ajouter une condition de jointure personnalisée, puis modifiez la description générée par l’IA ou écrivez SQL. |
| Cas de correspondance | Lorsqu’elles sont désactivées (valeur par défaut), les clés de jointure de chaîne correspondent à l’insensible à la casse (et ignorent l’espace blanc de début et de fin). Activez la casse Match pour qu’elle corresponde exactement aux touches de chaîne. Cette option s’applique aux clés de jointure, et non aux conditions de jointure personnalisées. |
| Type de jointure | Sélectionnez le type de jointure. Par défaut, l’opérateur Join fractionne ses résultats sur trois sorties (voir la section suivante). Sélectionnez Jointure complète, jointure interne, jointure gauche ou jointure droite pour produire une seule sortie jointe à la place. |
| Colonnes de sortie | Facultatif : sélectionnez les colonnes à inclure. Par défaut, toutes les colonnes des deux tables sont incluses. Les noms de colonnes en double reçoivent un préfixe de nom de table. |
| Colonnes d’expression personnalisées | Facultatif : ajoutez des colonnes d’expression personnalisée en fonction du résultat joint. |
Par défaut, l’opérateur Join a trois sorties pour vous permettre de brancher un flux de travail en fonction des résultats de jointure :
| Sortie | Description |
|---|---|
| Sans correspondance de gauche | Lignes de l’entrée de gauche qui n’ont aucune correspondance dans l’entrée de droite. |
| Correspondait | Lignes qui correspondent aux deux entrées. |
| Droite sans correspondance | Lignes de l’entrée de droite qui n’ont aucune correspondance dans l’entrée de gauche. |
Lorsque vous sélectionnez un type de jointure spécifique (complet, interne, gauche ou droite), l’opérateur produit une seule sortie jointe au lieu des trois sorties fractionnées.
Limit
Limite le nombre de lignes en passant uniquement jusqu’au nombre maximal de lignes que vous spécifiez.
| Champ | Description |
|---|---|
| Nombre maximal de lignes | Spécifiez le nombre maximal de lignes à passer. |
Ajouter un tableau croisé dynamique
Remodele les données tabulaires dans deux directions. Utilisez les onglets en haut du volet de configuration pour sélectionner le mode.
Lignes → colonnes (pivot)
Transforme les valeurs distinctes d’une colonne en nouveaux en-têtes de colonne, remplies de valeurs agrégées d’une autre colonne.
| Champ | Description |
|---|---|
| Colonne de tableau croisé dynamique | Sélectionnez la colonne dont les valeurs distinctes deviennent les nouveaux en-têtes. |
| Valeur &agrégation | Sélectionnez la colonne dont les valeurs remplissent les cellules pivotées, puis sélectionnez une fonction d’agrégation (par exemple, SUM, , AVGCOUNT, , MINou MAX). Configurez la façon dont les valeurs manquantes sont gérées (par exemple, null ou zéro), si elles sont disponibles dans le volet. |
Colonnes → lignes (unpivot)
Plie une ou plusieurs colonnes en lignes.
| Champ | Description |
|---|---|
| Supprimer un tableau croisé dynamique de colonnes | Sélectionnez les colonnes à annuler. |
| Colonnes clé et valeur | Définissez les noms des colonnes clé et valeur de sortie. |
Inclure des colonnes
Pour l’un ou l’autre mode, sélectionnez les colonnes qui restent dans la sortie en même temps que les valeurs pivotées ou non croisés dynamiques et supprimez les colonnes dont vous n’avez pas besoin avant la transformation. Le concepteur déduit les colonnes fixes (regroupement) des colonnes que vous n’affectez pas aux rôles pivot, valeur ou non croisé dynamique.
Trier
Commande des lignes sur une ou plusieurs colonnes.
| Champ | Description |
|---|---|
| Ordre de tri | Sélectionnez ASC (croissant) ou DESC (décroissant) pour chaque colonne. Cliquez sur + Ajouter une expression de tri pour trier par des colonnes supplémentaires. Le tri suit l’ordre lexical standard. |
SQL
Écrit du code SQL personnalisé pour toute transformation non couverte par les autres opérateurs.
| Champ | Description |
|---|---|
| Éditeur SQL | Tapez une instruction SQL SELECT . Pour référencer la sortie d’un opérateur d’entrée, utilisez le nom de cet opérateur comme nom de table dans votre requête. Par exemple:SELECT COUNT(*)FROM aggregate_2WHERE 1 = 1Cliquez sur |
| Parameters | Pour référencer un paramètre de préparation de données visuelles, utilisez la syntaxe de marqueur de paramètre nommée, par :environmentexemple . Le concepteur montre un exemple au-dessus de l’éditeur lorsque vous ouvrez l’opérateur pour modification. Voir Paramètres. |
Sélectionnez
Sélectionne, renomme et réorganise les colonnes à partir des données d’entrée.
| Champ | Description |
|---|---|
| Inclure ou exclure des colonnes | Sélectionnez Démarrer avec toutes les colonnes ou Démarrer sans colonne, puis cochez les cases pour inclure ou exclure des colonnes individuelles. Faites glisser des colonnes pour les réorganiser. |
| Renommer une colonne | Tapez un nouveau nom dans le champ Renommer en regard de n’importe quelle colonne. |
Prepare
Nettoie et dérive des colonnes en chaînant une ou plusieurs actions sur les données d’entrée. Cliquez sur + Ajouter une action et sélectionnez une action. Ajoutez autant d’actions que nécessaire. Ils s’appliquent dans l’ordre.
| Action | Description |
|---|---|
| Formule | Créez une colonne ou remplacez une colonne existante à l’aide du langage naturel ou d’une expression SQL. |
| Type de modification | Convertissez une colonne en un autre type de données. |
| Remplacer la valeur | Recherchez et remplacez des valeurs dans une colonne. |
| Remplir des valeurs Null | Remplacez les valeurs null par une constante. |
| Cas de texte | Modifiez la casse en minuscules, en majuscules ou en titre. |
| Supprimer les espaces | Supprimez l’espace blanc d’une ou des deux extrémités. |
| Remplacement d’expression régulière | Remplacez le texte correspondant à un modèle regex. |
| Extraire | Extrayez une sous-chaîne correspondant à un groupe regex. |
| Date d’analyse | Analysez une chaîne dans une date ou un horodatage. |
Pour supprimer une action, pointez sur sa ligne, puis cliquez sur
Colonnes personnalisées
L’action Formule ouvre l’éditeur d’expressions, où vous pouvez créer une colonne ou remplacer une colonne existante à l’aide du langage naturel ou du code SQL. L’éditeur a deux zones d’entrée et est bidirectionnel :
- Description : Tapez une description du langage naturel de ce que vous souhaitez que la colonne fasse. Le concepteur utilise Genie pour générer l’expression de code correspondante ci-dessous.
- Expression : si vous préférez écrire ou modifier du code directement, cliquez sur le bouton Modifier l’expression. La modification de l’expression génère automatiquement une description du langage naturel.
Python
Exécute des Python personnalisés (PySpark) sur les données d’entrée.
| Champ | Description |
|---|---|
result |
Affectez un DataFrame unique à result, qui devient la sortie de l’opérateur. |
inputs["data"] |
Liste des DataFrames d’entrée, dans l’ordre en amont. Le volet détails de l’opérateur affiche le nom de chaque entrée, dans l’ordre. Par exemple : Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales). |
| Parameters | Appelez dbutils.widgets.get(), par exemple dbutils.widgets.get("environment"), pour référencer un paramètre de préparation de données visuelles. Le concepteur montre un exemple au-dessus de l’éditeur lorsque vous ouvrez l’opérateur pour modification. Voir Paramètres. |
Un modèle minimal consiste à utiliser la première entrée lorsqu’elle est présente ou à un DataFrame vide dans le cas contraire :
# inputs["data"] is a list of input DataFrames
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
À partir de là, vous pouvez chaîner des opérations dataFrame (par exemple, select, , filterwithColumnou jointures) result avant la fin de l’affectation, ou remplacer result par un nouveau DataFrame créé à partir de inputs["data"].
Organisation
Note
Ajoute une note sur le canevas pour vous permettre de documenter le flux de travail lui-même : son objectif, ses hypothèses, ses mises en garde ou son contexte de transfert pour toute personne qui ouvre la préparation des données visuelles ultérieurement.
| Champ | Description |
|---|---|
| Contenu | Modifiez le contenu de la note inline sur le canevas avec un éditeur de texte enrichi. Vous pouvez ajouter des titres, des styles de texte, des liens, des images et des tableaux où le texte brut n’est pas suffisant. Les notes n’affectent pas la façon dont les données transitent par les opérateurs. |
Group
Regroupe visuellement des opérateurs sur le canevas sans modifier la façon dont les données circulent entre elles, ce qui est utile lorsqu’une préparation visuelle des données augmente ou que vous souhaitez refléter les étapes logiques.
| Champ | Description |
|---|---|
| Ajouter au groupe | Faites glisser un ou plusieurs opérateurs sur un groupe pour les ajouter. |
| Créer à partir de la sélection | Sélectionnez un ou plusieurs opérateurs, ouvrez le menu contextuel (clic droit), puis sélectionnez Créer un groupe pour encapsuler la sélection dans un nouveau groupe. |
| Name | Donnez au groupe un nom descriptif. |
| Réduire / développer | Cliquez sur Réduire ou développer pour afficher ou masquer le contenu du groupe sur le canevas. |
Visualization
Crée une visualisation à partir des données d’entrée et les affiche directement sur le canevas. Connectez un opérateur visualisation à n’importe quel opérateur qui produit des données tabulaires pour graphiquer les résultats sans quitter le Concepteur.
Pour configurer la visualisation, ouvrez l’opérateur et sélectionnez un type de visualisation , puis mappez vos colonnes au graphique.
| Champ | Description |
|---|---|
| Visualization | Type de graphique à afficher, tel que barre, zone ou compteur. |