Utilisation de valeurs en double

Vous pouvez utiliser des jeux de valeurs en double via des transformations qui peuvent supprimer des doublons de vos données. Vous pouvez également filtrer vos données pour afficher uniquement les doublons. Vous pouvez donc vous concentrer sur ces données.

Avertissement

Power Query respecte la casse. Lorsque vous utilisez des valeurs en double, Power Query considère le cas du texte, ce qui peut entraîner des résultats indésirables. Pour contourner ce problème, vous pouvez appliquer une transformation en majuscules ou en minuscules avant de supprimer des doublons.

Pour cet article, les exemples utilisent le tableau suivant avec les colonnes ID, Catégorie et Total .

Capture d’écran de l’exemple de tableau initial contenant les colonnes ID, Catégorie et Total.

Note

L'application d'une étape pour supprimer des doublons peut augmenter considérablement la consommation de mémoire si Power Query ne peut pas décharger cette opération sur la source de données back-end (appelée « repli »).

Supprimer les lignes dupliquées dans Power Query

Utilisez Supprimer des doublons pour supprimer des lignes où les colonnes sélectionnées contiennent des valeurs répétées. Power Query est sensible à la casse lors de la comparaison des valeurs. Appliquez donc d'abord une conversion en majuscules ou en minuscules si la casse ne doit pas affecter la comparaison.

  1. Sélectionnez les colonnes qui contiennent des valeurs en double.

  2. Accédez à l’onglet Accueil .

  3. Dans le groupe Réduire les lignes , sélectionnez Supprimer les lignes.

  4. Dans le menu déroulant, sélectionnez Supprimer les doublons.

    Capture d’écran montrant l’emplacement de l’option Supprimer les doublons sous Supprimer les lignes.

Avertissement

Power Query ne garantit pas qu'elle conserve la première instance dans un ensemble de doublons lorsqu'elle supprime les doublons. Pour en savoir plus sur la conservation du tri, consultez Conserver le tri.

Supprimer les doublons de plusieurs colonnes

À l’aide de l’exemple de tableau avec des colonnes ID, Catégorie et Total , cet exemple supprime les lignes dupliquées en fonction de toutes les colonnes.

Capture d’écran de la table initiale avec des doublons dans plusieurs colonnes mises en évidence.

Vous avez quatre lignes qui sont des doublons. Votre objectif est de supprimer ces lignes dupliquées afin qu’il n’y ait que des lignes uniques dans votre table. Sélectionnez toutes les colonnes de votre table, puis sélectionnez Supprimer les doublons.

La table de sortie contient uniquement des lignes avec des combinaisons uniques sur toutes les colonnes.

Capture d’écran du tableau final avec des doublons supprimés de toutes les colonnes.

Note

Vous pouvez également effectuer cette opération avec un sous-ensemble de colonnes.

Supprimer les doublons d’une seule colonne

À l’aide du même exemple de tableau, cet exemple supprime les lignes dupliquées en fonction de la seule colonne Catégorie .

Capture d’écran de la table initiale qui identifie les doublons dans la colonne Catégorie.

Vous souhaitez supprimer ces doublons et conserver uniquement des valeurs uniques. Pour supprimer les doublons de la colonne Catégorie , sélectionnez-la, puis supprimez les doublons.

La table de sortie conserve uniquement la première ligne pour chaque valeur catégorie unique.

Capture d’écran du tableau final avec des doublons supprimés de la colonne Category.

Conserver les lignes en double dans Power Query

Utilisez Conserver les doublons pour filtrer votre table afin qu’elle affiche uniquement les lignes qui ont des valeurs répétées dans les colonnes sélectionnées. Power Query respecte la casse lors de la comparaison des valeurs.

  1. Sélectionnez les colonnes qui contiennent des valeurs en double.

  2. Accédez à l’onglet Accueil .

  3. Dans le groupe Réduire les lignes , sélectionnez Conserver les lignes.

  4. Dans le menu déroulant, sélectionnez Conserver les doublons.

    Capture d’écran montrant l’emplacement de l’option Conserver les doublons sous Conserver les lignes.

Conserver les doublons de plusieurs colonnes

À l’aide de l’exemple de table avec des colonnes ID, Catégorie et Total , cet exemple conserve uniquement les lignes qui apparaissent plusieurs fois sur toutes les colonnes.

Capture d’écran de la table initiale pour conserver les doublons de plusieurs colonnes.

Vous avez quatre lignes qui sont des doublons. Votre objectif dans cet exemple est de conserver uniquement les lignes qui sont dupliquées dans votre table. Sélectionnez toutes les colonnes de votre table, puis choisissez l'option Conserver les doublons.

La table de sortie contient uniquement les lignes ayant des valeurs correspondantes dans une autre ligne.

Capture d’écran du tableau final avec uniquement des lignes dupliquées de plusieurs colonnes.

Conserver les doublons d’une seule colonne

À l’aide du même exemple de tableau, cet exemple conserve uniquement les lignes où la valeur de colonne ID apparaît plusieurs fois.

Table initiale pour conserver les doublons d’une seule colonne.

Dans cet exemple, vous avez plusieurs doublons que vous souhaitez conserver dans votre table. Pour conserver les doublons de la colonne ID , sélectionnez la colonne ID , puis conservez les doublons.

La table de sortie contient toutes les lignes où la valeur d’ID apparaît plusieurs fois.

Tableau final avec uniquement des lignes dupliquées à partir d’une seule colonne.

Outils de profilage des données