Questions · Dédoublonnage
Comment trouver les doublons d'un fichier, même écrits différemment ?
D'abord on remet chaque adresse dans sa forme correcte, puis on compare les noms en tenant compte des prénoms abrégés, des fautes de frappe et de l'ordre inversé du nom et du prénom. Le résultat n'est pas un doublon oui ou non : c'est un niveau de certitude, avec le motif écrit à côté.
Pourquoi une recherche exacte ne les trouve pas
Deux fiches de la même personne ne sont presque jamais écrites pareil. Celui qui les a saisies a utilisé une abréviation, une initiale, a inversé nom et prénom, ou a écrit l'adresse avec le raccourci du moment. Une recherche qui compare des chaînes de caractères ne reconnaît rien de tout cela : pour elle, « 10 pl. de la Comédie » et « 10 place de la Comédie » sont deux adresses différentes, alors qu'un facteur y lirait le même endroit.
C'est pour cela que la comparaison se fait en deux temps, pas en un. D'abord on met chaque adresse dans sa forme correcte avec le même moteur que RadarAddress utilise pour la normalisation : type de voie en toutes lettres, code postal en cinq chiffres, commune bien écrite. Ce n'est que lorsque deux adresses sont dans la même forme qu'il a un sens de se demander si elles coïncident — comparer d'abord et corriger ensuite ne produit que des faux négatifs, parce que la comparaison continue de voir deux graphies et non une seule adresse.
Il en va de même pour le nom : celui qui cherche « Dubois » en s'attendant à trouver la fiche déjà dans le fichier, alors que la fiche existe mais au nom de « Dubois Sophie » au lieu de « Sophie Dubois », ne la trouve tout simplement pas. La conséquence la plus courante n'est pas une erreur visible : c'est une nouvelle fiche ouverte de bonne foi, qui vient s'ajouter à celle qui existait déjà.
Ce que la comparaison reconnaît
- Un prénom abrégé ou réduit à l'initiale. « S. Dubois » et « Sophie Dubois », sans confondre des personnes différentes.
- Nom et prénom inversés. « Dubois Sophie » et « Sophie Dubois » viennent presque toujours d'un import avec les colonnes interverties.
- Une coquille dans le nom. Une petite faute de frappe n'empêche pas la reconnaissance, si le reste de la fiche coïncide.
- Les majuscules et les accents. « DUBOIS » et « Dubois », « Comedie » et « Comédie » sont lus comme le même mot.
- Les abréviations de la voie, parce qu'avant de comparer les adresses nous les remettons en ordre.
- Un lieu-dit ou une commune déléguée écrits à la place de la commune, quand le référentiel les rattache à la même commune.
Le verdict : certain, probable, ambigu
Tous les doublons ne se valent pas. Quand deux fiches coïncident sur tout après la remise en ordre, le verdict est certain. Quand entrent en jeu un prénom abrégé ou une abréviation, il reste probable : presque toujours juste, mais cela vaut un coup d'œil. Quand le rapprochement est faible — par exemple des noms semblables — le groupe est ambigu, et la décision de fusionner les fiches reste la vôtre. Chaque groupe porte son motif : vous savez toujours pourquoi deux fiches ont été rapprochées.
Le niveau de recherche est aussi à vous, pas seulement la lecture du résultat : vous choisissez à quel point la comparaison doit être large, du plus strict (seulement nom et adresse qui coïncident) au plus étendu (même les rapprochements faibles, que vous regardez ensuite). Le réglage par défaut, celui avec lequel tournent la plupart des traitements, reconnaît déjà les prénoms abrégés, les abréviations et les petites coquilles.
La fiche principale : le doublon ne se jette pas, il se fusionne
Écarter l'une des deux fiches est le choix le plus commode et celui qui coûte le plus : si l'e-mail n'était que sur l'une et le téléphone que sur l'autre, en n'en gardant qu'une vous perdez l'autre coordonnée. RadarAddress construit une fiche principale en prenant dans chacune le meilleur champ — l'adresse de la fiche la plus complète, le nom dans sa forme canonique, e-mail et téléphone là où ils sont — et pour chaque champ il reste écrit de quelle fiche il vient, pour que vous puissiez contrôler d'où arrive chaque information.
Où le faire : sur le site, depuis un fichier, depuis l'API
Sur le site, avec votre compte, vous comparez deux ou trois fiches à la fois et vous voyez tout de suite le verdict : c'est la façon la plus rapide de comprendre comment cela fonctionne ou de contrôler un cas douteux avant de charger le fichier entier. Pour un fichier entier, vous le chargez : les traitements par lots vont jusqu'à 100 000 fiches, et à la fin vous trouvez la colonne avec la fiche à conserver et le groupe auquel appartient chaque ligne. Si vous travaillez depuis du code, le point d'accès /api/v1/dedupe compare jusqu'à 500 fiches par appel, avec le même verdict certain/probable/ambigu et la même fiche principale fusionnée. Les tarifs sont sur la page des tarifs : avant de lancer un traitement par lots, vous voyez toujours ce qu'il implique, et les opérations ne sont prélevées qu'à la confirmation.
Deux fiches, la même personne
Fiche B : DUBOIS S., 10 place de la Comédie, 34 000 montpellier
Fiche principale : Dubois Sophie, 10 Place de la Comédie, 34000 MONTPELLIER
Le prénom réduit à l'initiale, les majuscules et l'adresse écrite de deux façons ne sont reconnus qu'après que les deux adresses ont été remises dans leur forme correcte. Le nom est inventé à des fins de démonstration ; toute référence à des personnes réelles est purement fortuite.
Les questions qui suivent
Faut-il préparer le fichier avant de le charger ?
Non. Vous chargez le fichier tel quel : la remise en ordre des adresses est la première étape de la comparaison, pas un travail à faire à la main avant.
Les doublons sont-ils supprimés automatiquement ?
Non. Chaque groupe de doublons reste à votre disposition avec le verdict et le motif : c'est vous qui décidez si et comment le fusionner, RadarAddress ne supprime rien de lui-même.
Que se passe-t-il si deux personnes différentes portent le même nom dans la même commune ?
La comparaison le signale comme ambigu au lieu de le déclarer certain : un rapprochement faible reste sous votre décision, il n'est pas forcé.
Combien de fiches puis-je comparer ensemble ?
Sur le site, deux ou trois, pour vous faire une idée. Depuis un fichier chargé, jusqu'à 100 000 fiches en un seul traitement. Depuis l'API, jusqu'à 500 par appel.
La fiche que j'obtiens perd-elle des données par rapport aux deux de départ ?
Non : la fiche principale prend le meilleur champ de chacune, e-mail et téléphone compris, et il reste écrit d'où vient chaque information.
Cela marche-t-il aussi si le nom a une faute de frappe ?
Oui, dans une marge raisonnable : une petite coquille n'empêche pas la reconnaissance si le reste de la fiche coïncide.
Dois-je m'inscrire pour comparer mes fiches ?
Oui : la page de dédoublonnage du site montre un exemple choisi par nous, sans données en entrée, pour que vous voyiez comment cela fonctionne. Pour travailler sur vos fiches, il faut un compte gratuit.
Voir le dédoublonnage
Deux fiches de la même personne, écrites différemment, et le verdict du moteur avec son motif.
Voir le dédoublonnageLire aussi : Pourquoi Excel ne trouve pas les doublons · Vérifier les adresses d'un fichier Excel · Tarifs du dédoublonnage