This page is available in English. Switch to English

Deux fiches,
une seule personne.

Un exemple avec des adresses de France : deux fiches écrites différemment, et pourquoi c'est la même personne.

Avec un compte gratuit, vous travaillez sur vos propres adresses, de tous les pays : depuis le site, depuis un fichier ou via l'API. Inscrivez-vous ou connectez-vous.

Fiche A

Fiche B

Les exemples utilisent des adresses de bâtiments publics et de rues du centre-ville ; les noms, lorsqu'ils apparaissent, sont inventés à des fins de démonstration : toute ressemblance avec des personnes réelles est purement fortuite.

Deux fiches, une seule personne

Un doublon n'est pas une fiche en trop à supprimer : c'est l'histoire d'une personne coupée en deux. La recoller produit quatre effets concrets.

Répondre une seule fois, et en connaissance de cause

Celui qui répond regarde une fiche : si la commande est enregistrée sur l'autre, cette personne ne reçoit rien — et s'en aperçoit. Avec une seule fiche, la confirmation part toujours, et la communication arrive une fois : pas deux à la même adresse, parfois avec le nom écrit de deux façons différentes.

Chaque enveloppe en trop, c'est de l'argent jeté

Un doublon, c'est une impression, une enveloppe et un timbre payés pour une personne que votre communication a déjà atteinte. Dans une campagne de volume, c'est la dépense la plus facile à couper : pas un destinataire de moins, seulement les envois qui servent.

Reconnaître qui vaut le plus

Qui a acheté trois fois sur une fiche et deux fois sur l'autre apparaît dans les rapports comme deux contacts tièdes au lieu d'un client fidèle. En réunissant les fiches, l'histoire redevient entière, et cela change qui il vaut la peine d'appeler, à qui réserver un traitement différent, à qui proposer davantage.

Les comptes sont justes

Combien de clients ai-je vraiment ? Combien vaut un contact en moyenne ? Avec une base pleine de doublons, chaque réponse est gonflée, et les décisions qui en découlent naissent faussées. Avant d'analyser, il faut compter juste.

Ce ne sont pas des erreurs d'inattention

Les doublons naissent de trois situations ordinaires, qui se répètent dans toute base destinée à grandir.

1

La commande arrive et on est pressé

La personne qui saisit a une pile de formulaires à traiter (ou de bulletins de soutien, dans une association) et ne s'arrête pas pour vérifier si cette personne est déjà dans la base. Ouvrir une nouvelle fiche prend trente secondes ; la chercher vraiment, parmi les variantes du nom et de l'adresse, prend beaucoup plus de temps.

2

La fiche existe, mais la recherche ne la trouve pas

C'est le cas le plus fréquent et le plus difficile à éviter : la fiche existe, mais elle est écrite de façon à peine différente de la manière dont on la cherche — « Via Giovanni Pascoli 4 » contre « Pascoli », « V.le » contre « Viale ». La recherche ne renvoie rien, et la fiche est recréée de bonne foi.

3

Une liste entière entre

Les inscriptions depuis le site, une liste collectée lors d'un événement, un fichier reçu d'un fournisseur : ils entrent en bloc sans être comparés à la base existante. Cela arrive moins souvent que les deux autres cas, mais quand cela arrive, les doublons entrent par centaines.

Les trois se règlent de la même façon : un contrôle de la base à intervalles réguliers, et un avant chaque campagne importante.

D'abord nous corrigeons, ensuite nous comparons

Comparer deux fiches mot à mot ne mène pas loin : Daniela et Dany sont la même personne, V. Roma 12 et Via Roma, 12 sont la même adresse, et aucune comparaison littérale ne s'en rend compte. C'est pourquoi nous travaillons en deux temps : d'abord nous corrigeons les deux adresses — nom de voie en toutes lettres, code postal corrigé, bonne commune — et seulement ensuite nous les comparons, avec le nom, l'e-mail et le téléphone. Deux graphies de la même voie deviennent la même voie avant que la comparaison commence.

Le résultat n'est pas un oui ou un non. Quand le verdict n'est pas net, nous le déclarons — certain, probable ou ambigu, avec la raison à côté : deux personnes différentes peuvent porter le même nom dans la même commune, et réunir deux fiches reste votre décision, à prendre en sachant sur quoi elle repose.

Normalisation, détection des doublons, dédoublonnage, enrichissement

Quatre opérations différentes, qui finissent d'ordinaire toutes sous le mot « nettoyage ». Les distinguer est utile, parce que chacune est le préalable de la suivante.

Normalisation

Ramener chaque adresse à une écriture unique et correcte, en complétant ce qui manque : le code postal, la province, le nom de la voie en toutes lettres.

« Via S. Caterina 20 » et « Strada Santa Caterina 20 » deviennent la même ligne.

Détection des doublons

Reconnaître que deux fiches désignent le même sujet même si elles sont écrites différemment : « V. Roma 12 » et « Via Roma 12 », Dany et Daniela, nom et prénom inversés.

Elle vient après la normalisation, et ce n'est pas un hasard : sans elle, on compare des chaînes de caractères au lieu d'adresses.

Dédoublonnage

Décider quoi faire des doublons trouvés : quelle fiche garder, quels champs prendre de l'une et lesquels de l'autre.

Le doublon ne se jette pas : il s'intègre, et l'origine de chaque information reste écrite.

Enrichissement

Ajouter ce qui manque ou ce qui se déduit de ce qui existe : la formule d'appel à partir du prénom, le titre, le complément du numéro de voie, le codice fiscale.

Des données que personne ne vous a fournies, mais que votre base contient déjà de façon implicite.

Pourquoi cela compte, au-delà du nettoyage : celui qui reçoit deux fois la même lettre le remarque, et celui qui ne reçoit pas le remerciement parce que le don était enregistré sur une fiche pendant que vous regardiez l'autre le remarque encore plus.

Vous choisissez la précision de la comparaison, nous vous disons à quel point nous sommes sûrs

Nous ne vous demandons pas de décider quelles fiches réunir : c'est nous qui le faisons, et pour chaque groupe nous disons avec quelle certitude. Le seul réglage est la précision de la comparaison, c'est-à-dire à quel point deux fiches peuvent différer et rester le même sujet. Trois valeurs : depuis le site et les fichiers, c'est la valeur par défaut qui s'applique ; depuis l'API, vous choisissez avec livello_minimo. À ne pas confondre avec la précision de la normalisation de l'adresse, qui est autre chose et compte cinq niveaux.

1 · uguale

Précision stricte

Nom et adresse coïncident après normalisation. Aucun groupe que vous n'auriez pas fait à la main.

2 · poco diverso

La valeur par défaut

Entrent les variantes du même prénom (Dany et Daniela), les abréviations et les petites fautes de frappe. C'est le réglage avec lequel tournent la plupart des traitements.

3 · diverso

Précision large

Les rapprochements faibles aussi : même adresse et noms proches. Elle trouve plus, et vous avez plus à regarder.

Le verdict renvoyé sur chaque groupe — certain, probable, ambigu — est notre classification, pas votre choix : il dit à quel point le groupe est solide, et sert à décider ce que vous pouvez accepter les yeux fermés et ce qui mérite d'être revu.

Le doublon ne se jette pas : il se fusionne

C'est la différence qui compte. Celui qui dédoublonne garde d'ordinaire une fiche et écarte l'autre — et avec elle, l'e-mail qui n'existait que là. Nous construisons une fiche nouvelle en prenant de chacune le meilleur champ.

Exemple de fusion de deux fiches : quel champ reste et d'où il vient
ChampFiche AFiche BFiche qui reste
PrénomDany RossiRossi DanielaDaniela Rossi forme canonique, champs remis à leur place
Adressev. leopardi 4, milanoVia G. Leopardi 4, MilanoVia Giacomo Leopardi 4 de la fiche la plus complète
Code postal et ville—Milano20123 MILANO MI complété lors de la normalisation
E-maildany.rossi@gmail.com—dany.rossi@gmail.com n'existait que sur A
Téléphone—347 032 89593470328959 n'existait que sur B

En gardant A, vous auriez perdu le téléphone ; en gardant B, l'e-mail. La fiche fusionnée a les deux, et pour chaque champ reste écrit de quelle fiche il vient : si un jour la fusion ne vous convainc pas, vous savez exactement quoi toucher.

Les mêmes doublons qui échappent à une recherche exacte

  • Dany Rossi=Daniela Rossi prénom équivalent
  • Rossi Mario=Mario Rossi nom et prénom inversés
  • V. Roma 12=Via Roma 12 abréviation développée
  • Rossi Daniela, via leopardi 4, milano=Daniela Rossi, Via Giacomo Leopardi 4, 20123 MILANO MI adresse corrigée avant la comparaison

Nous reconnaissons aussi une faute de frappe dans le nom ; le titre devant le nom, qui ne compte pas dans la comparaison (Dott.ssa Maria Bianchi est la même personne que Maria Bianchi) ; et le quartier ramené à sa commune, parce que Sampierdarena est un quartier de Gênes.