This page is available in English. Switch to English

Questions · Dédoublonnage

Excel ne trouve pas les doublons : pourquoi, et que faire ?

« Supprimer les doublons » et les comparaisons par formule regardent le texte lettre par lettre : deux lignes identiques sont trouvées, deux lignes qui disent la même chose autrement, non. Le moyen de les trouver vraiment est de remettre d'abord l'adresse en ordre et de reconnaître les prénoms abrégés, et de comparer seulement ensuite.

Ce que fait vraiment « Supprimer les doublons »

La fonction compare le contenu des cellules que vous choisissez, colonne par colonne, caractère par caractère. Elle trouve la ligne identique : même texte, mêmes majuscules, mêmes espaces. Tout ce qui s'en écarte, même d'un détail, n'est pas considéré comme égal, et la ligne reste dans le fichier comme si c'était une autre personne.

En pratique, il faut très peu pour faire échouer la comparaison : une espace de trop après le numéro, « Dubois Sophie » au lieu de « Sophie Dubois », « pl. de la Comédie » à la place de « place de la Comédie ». Aucun de ces cas n'est rare : c'est la façon normale dont les gens écrivent un fichier, pas une exception. Celui qui a saisi la deuxième ligne n'a rien fait de mal : il a seulement écrit les mêmes informations avec ses mots, à un autre moment, peut-être depuis un autre formulaire.

La même limite vaut pour les formules qui comparent deux colonnes à la main, ou pour une RECHERCHEV ou un NB.SI sur le nom et l'adresse : c'est toujours une comparaison de texte, et le texte de deux vrais doublons ne coïncide presque jamais caractère par caractère.

Pourquoi deux lignes qui semblent différentes sont souvent la même personne

  • Majuscules, accents et espaces. « SOPHIE DUBOIS » et « Sophie Dubois » (avec une espace finale) sont pour Excel deux textes différents ; « Comedie » et « Comédie » aussi.
  • Abréviations de la voie. « 10 pl. de la Comédie » et « 10 place de la Comédie » n'ont pas toutes leurs lettres à la même position.
  • Nom et prénom inversés. Un import avec les colonnes interverties produit « Dubois Sophie » à côté de « Sophie Dubois », et aucune des formules courantes ne les rapproche.
  • Prénom abrégé. « DUBOIS S. » et « Sophie Dubois » ne partagent même pas le prénom en entier.
  • Code postal écrit autrement sur une seule ligne. « 34 000 » d'un côté et « 34000 » de l'autre suffisent à casser une comparaison exacte sur plusieurs colonnes ; une cellule vide fait de même.

Excel ne se trompe pas : il fait exactement ce que vous lui avez demandé, une comparaison littérale. Le problème est qu'un vrai fichier n'est jamais écrit de façon uniforme.

Ce que vous perdez en jetant une ligne au hasard

Même quand deux lignes sont reconnues comme égales (par exemple parce qu'elles ont été copiées l'une sur l'autre), en écarter une au hasard est risqué : si l'e-mail n'était enregistré que sur une ligne et le téléphone que sur l'autre, en n'en gardant qu'une vous perdez une coordonnée. Et si le choix est manuel, sur un fichier de quelques milliers de lignes cela devient un travail long et aussi sujet aux erreurs que celui qu'on veut résoudre : il faut ouvrir chaque paire suspecte, la comparer à l'œil, décider laquelle garder et recopier à la main les données qui manquent de l'autre.

Il y a aussi un risque moins visible : écarter la mauvaise ligne quand les deux ne sont pas du tout la même personne, mais seulement deux personnes du même nom dans la même commune. Une comparaison purement textuelle n'a aucun moyen de distinguer les deux cas, alors que c'est précisément là que la plus grande prudence serait nécessaire.

Ce que fait au contraire une vraie comparaison

Le dédoublonnage de RadarAddress travaille en deux temps. D'abord il remet chaque adresse dans sa forme correcte — type de voie en toutes lettres, code postal en cinq chiffres, commune bien écrite — pour que deux graphies de la même voie deviennent la même voie avant même d'être comparées. Puis il compare les noms, en reconnaissant le prénom abrégé ou réduit à l'initiale, l'ordre inversé du nom et du prénom, une coquille dans le nom, les majuscules et les accents.

Le résultat n'est pas une ligne supprimée : c'est une fiche principale qui prend dans chaque doublon le meilleur champ, e-mail et téléphone compris, avec écrit d'où vient chaque information. Et chaque groupe porte un niveau de certitude — certain, probable, ambigu — pour savoir lesquels fusionner les yeux fermés et lesquels regarder vous-même, au lieu de devoir le décider ligne par ligne comme dans un tableur.

Sur un fichier chargé, la comparaison tourne sur toute la liste en un seul traitement, jusqu'à 100 000 fiches : pas besoin de trier, de regrouper ou de croiser des feuilles à la main.

Le même cas, deux résultats différents

Avant
Ligne 12 : Sophie Dubois, 10 pl. de la Comédie, 34000 Montpellier
Ligne 340 : DUBOIS S., 10 place de la Comédie, 34 000 montpellier
Après
Excel · Supprimer les doublons : aucune ligne supprimée
RadarAddress : même personne, niveau certain

Les deux lignes n'ont pas une seule cellule identique — prénom réduit à l'initiale, majuscules, abréviation de la voie, espace dans le code postal — et pourtant c'est la même adresse et la même personne. Le nom est inventé à des fins de démonstration ; toute référence à des personnes réelles est purement fortuite.

Les questions qui suivent

Pourquoi une formule RECHERCHEV ne trouve-t-elle pas ces doublons ?

Parce qu'elle compare elle aussi le texte tel qu'il est écrit : s'il n'y a pas de correspondance exacte entre les cellules, elle ne renvoie rien, même quand les deux lignes parlent de la même personne.

Puis-je au moins uniformiser les majuscules et les espaces dans Excel avant ?

Vous pouvez réduire quelques cas avec des formules de nettoyage du texte, mais vous ne résolvez ni les abréviations de la voie, ni les prénoms abrégés, ni l'ordre inversé du nom et du prénom : il faut une comparaison qui comprenne l'adresse, pas seulement le texte.

Comment savoir quelle ligne garder entre deux doublons ?

Pas besoin de le décider : le dédoublonnage construit une fiche principale qui réunit les meilleurs champs des lignes concernées, au lieu de vous faire choisir laquelle écarter.

Cela marche-t-il aussi sur un fichier de dizaines de milliers de lignes ?

Oui : un traitement par lots va jusqu'à 100 000 fiches, et le résultat indique pour chaque ligne si et avec qui elle forme un groupe.

Dois-je installer quelque chose dans Excel ?

Non. Vous chargez le fichier tel quel (Excel ou CSV) sur le site et vous retéléchargez le résultat : aucun complément à installer.

Combien coûte le dédoublonnage d'un fichier ?

Les tarifs sont sur la page des tarifs ; avant de lancer le traitement, vous voyez toujours ce qu'il implique, et les opérations ne sont prélevées qu'à la confirmation.

Les colonnes qui n'ont rien à voir avec le nom et l'adresse restent-elles intactes ?

Oui. Le fichier de résultat ajoute les colonnes avec le niveau de certitude et la fiche principale, mais tout ce que vous aviez déjà dans le fichier revient dans l'ordre de départ.

Voir le dédoublonnage

Deux fiches de la même personne, écrites différemment, et le verdict du moteur avec son motif.

Voir le dédoublonnage

Lire aussi : Trouver les doublons même écrits différemment · Vérifier les adresses d'un fichier Excel · Tarifs du dédoublonnage