Twee records,
één persoon.
Een voorbeeld met adressen uit Nederland: twee records die verschillend geschreven zijn, en waarom het dezelfde persoon is.
Met een gratis account werk je met je eigen adressen, uit elk land: via de website, vanuit een bestand of via de API. Registreer of log in.
Twee records, één persoon
Een dubbele is niet zomaar een extra record om te wissen: het is de geschiedenis van één persoon, in tweeën gebroken. Die weer samenvoegen heeft vier concrete effecten.
Antwoord één keer, en met kennis van zaken
Wie antwoordt, kijkt naar één record: staat de bestelling op het andere, dan krijgt die persoon niets — en merkt dat. Met één record gaat de bevestiging altijd de deur uit, en komt de communicatie één keer aan: niet twee keer op hetzelfde adres, misschien met de naam op twee manieren gespeld.
Elke envelop te veel is weggegooid geld
Een dubbele is een afdruk, een envelop en een postzegel, betaald voor iemand die je communicatie al heeft bereikt. In een grote campagne is het de makkelijkste kostenpost om te schrappen: geen ontvanger minder, alleen de zendingen die nodig zijn.
Herken wie meer waard is
Wie drie keer heeft gekocht onder het ene record en twee keer onder het andere, verschijnt in de rapporten als twee lauwe contacten in plaats van één trouwe. Door de records samen te voegen wordt de geschiedenis weer heel, en verandert wie het waard is om te bellen, wie een andere behandeling verdient, aan wie je meer kunt aanbieden.
De cijfers kloppen
Hoeveel klanten heb ik echt? Wat is een contact gemiddeld waard? Met een bestand vol dubbelen is elk antwoord opgeblazen, en de beslissingen die eruit volgen zijn van meet af aan scheef. Voordat je analyseert, moet je goed tellen.
Het zijn geen slordigheidsfouten
Dubbelen ontstaan uit drie gewone situaties, die zich herhalen in elk bestand dat moet groeien.
De bestelling komt binnen en er is haast
Wie de gegevens invoert, heeft een stapel formulieren weg te werken (of acceptgiro's, bij een goed doel) en stopt niet om te controleren of die persoon al in het bestand staat. Een nieuw record aanmaken kost dertig seconden; er echt naar zoeken, tussen de varianten van de naam en het adres, kost veel meer tijd.
Het record bestaat, maar de zoekfunctie vindt het niet
Het is het meest voorkomende geval en het moeilijkst te vermijden: het record bestaat, maar is net iets anders geschreven dan hoe ernaar gezocht wordt — ‘Via Giovanni Pascoli 4’ tegenover ‘Pascoli’, ‘V.le’ tegenover ‘Viale’. De zoekopdracht levert niets op, en het record wordt te goeder trouw opnieuw aangemaakt.
Er komt een hele lijst binnen
Inschrijvingen via de website, een lijst verzameld op een evenement, een bestand van een leverancier: ze komen in één keer binnen zonder vergeleken te worden met het bestaande bestand. Het gebeurt minder vaak dan de andere twee gevallen, maar als het gebeurt, komen de dubbelen met honderden tegelijk binnen.
Alle drie worden ze op dezelfde manier opgelost: een controle van het bestand op vaste tijden, en één vóór elke belangrijke campagne.
Eerst herstellen, dan vergelijken
Twee records woord voor woord vergelijken brengt je niet ver: Daniela en Dany zijn dezelfde persoon, V. Roma 12 en Via Roma, 12 zijn hetzelfde adres, en geen enkele letterlijke vergelijking merkt dat. Daarom werken we in twee stappen: eerst herstellen we de twee adressen — straatnaam voluit, postcode gecorrigeerd, de juiste plaats — en pas daarna vergelijken we ze, samen met de naam, het e-mailadres en het telefoonnummer. Twee schrijfwijzen van dezelfde straat worden dezelfde straat voordat de vergelijking begint.
Het resultaat is geen ja of nee. Als het oordeel niet eenduidig is, zeggen we dat — zeker, waarschijnlijk of onzeker, met de reden ernaast: twee verschillende mensen kunnen dezelfde naam hebben in dezelfde plaats, en twee records samenvoegen blijft jouw beslissing, te nemen in de wetenschap waarop ze berust.
Normalisatie, dubbelen opsporen, ontdubbelen, verrijken
Vier verschillende bewerkingen, die meestal allemaal onder het woord ‘opschonen’ vallen. Ze uit elkaar houden is nuttig, want de ene is de voorwaarde voor de andere.
Normalisatie
Elk adres terugbrengen tot één correcte schrijfwijze, en aanvullen wat ontbreekt: de postcode, de provincie, de straatnaam voluit.
‘Via S. Caterina 20’ en ‘Strada Santa Caterina 20’ worden dezelfde regel.
Dubbelen opsporen
Herkennen dat twee records dezelfde persoon zijn, ook al zijn ze anders geschreven: ‘V. Roma 12’ en ‘Via Roma 12’, Dany en Daniela, achternaam en voornaam omgewisseld.
Het komt na de normalisatie, en niet toevallig: zonder vergelijk je tekenreeksen in plaats van adressen.
Ontdubbelen
Beslissen wat er met de gevonden dubbelen gebeurt: welk record je bewaart, welke velden je uit het ene neemt en welke uit het andere.
De dubbele wordt niet weggegooid: hij wordt ingevoegd, en er blijft vastgelegd waar elk gegeven vandaan komt.
Verrijking
Toevoegen wat ontbreekt of wat af te leiden is uit wat er is: de aanhef uit de voornaam, de titel, de huisnummertoevoeging, de fiscale code.
Gegevens die niemand je heeft gegeven, maar die je bestand al impliciet bevat.
Waarom het telt, los van het opschonen: wie dezelfde brief twee keer krijgt, merkt dat, en wie het bedankje niet krijgt omdat de donatie op het ene record stond terwijl jij naar het andere keek, merkt dat nog meer.
Jij kiest hoe strikt de vergelijking is, wij zeggen hoe zeker we zijn
We vragen je niet te beslissen welke records je samenvoegt: dat doen wij, en voor elke groep zeggen we met hoeveel zekerheid. De enige knop is de striktheid van de vergelijking, dus hoeveel twee records mogen verschillen en toch dezelfde persoon blijven. Drie waarden: de website en de bestandsopdrachten gebruiken de standaard, via de API kies je met livello_minimo. Niet te verwarren met de nauwkeurigheid van de adresnormalisatie, die iets anders is en vijf niveaus heeft.
Strikt
Naam en adres vallen samen na de normalisatie. Geen enkele groep die je niet zelf met de hand gemaakt zou hebben.
De standaard
Varianten van dezelfde naam (Dany en Daniela), afkortingen en kleine typefouten tellen mee. Het is de instelling waarmee de meeste opdrachten draaien.
Ruim
Ook de zwakke verbanden: hetzelfde adres en vergelijkbare namen. Vindt meer, en je moet meer nakijken.
Het oordeel dat bij elke groep terugkomt — zeker, waarschijnlijk, onzeker — is onze classificatie, niet jouw keuze: het zegt hoe solide de groep is, en helpt je te beslissen wat je blind kunt accepteren en wat de moeite van het nakijken waard is.
De dubbele wordt niet weggegooid: hij wordt samengevoegd
Dat is het verschil dat telt. Wie ontdubbelt, houdt meestal één record en gooit het andere weg — en daarmee ook het e-mailadres dat alleen daar stond. Wij bouwen een nieuw record en nemen uit elk het beste veld.
| Veld | Record A | Record B | Record dat overblijft |
|---|---|---|---|
| Voornaam | Dany Rossi | Rossi Daniela | Daniela Rossi canonieke vorm, velden weer op hun plaats |
| Adres | v. leopardi 4, milano | Via G. Leopardi 4, Milano | Via Giacomo Leopardi 4 uit het meest volledige record |
| Postcode en plaats | — | Milano | 20123 MILANO MI aangevuld tijdens de normalisatie |
| dany.rossi@gmail.com | — | dany.rossi@gmail.com stond alleen op A | |
| Telefoon | — | 347 032 8959 | 3470328959 stond alleen op B |
Had je A gehouden, dan was je het telefoonnummer kwijt; met B het e-mailadres. Het samengevoegde record heeft ze allebei, en voor elk veld blijft vastgelegd uit welk record het komt: mocht de samenvoeging je later niet overtuigen, dan weet je precies wat je moet aanpassen.
Dezelfde dubbelen die aan een exacte zoekopdracht ontsnappen
- Dany Rossi=Daniela Rossi gelijkwaardige naam
- Rossi Mario=Mario Rossi achternaam en voornaam omgewisseld
- V. Roma 12=Via Roma 12 afkorting voluit geschreven
- Rossi Daniela, via leopardi 4, milano=Daniela Rossi, Via Giacomo Leopardi 4, 20123 MILANO MI adres hersteld vóór de vergelijking
We herkennen ook een typefout in de achternaam; de titel vóór de naam, die in de vergelijking niet meetelt (Dott.ssa Maria Bianchi is dezelfde persoon als Maria Bianchi); en de woonkern die naar haar gemeente wordt teruggebracht, omdat Sampierdarena een wijk van Genua is.
Verwante vragen
- Hoe verifieer en corrigeer je een klantenbestand?
- Hoe vind ik dubbele records in een bestand, ook als ze anders geschreven zijn?
- Excel vindt de duplicaten niet: waarom, en wat doe je eraan?
Alle vragen, met het antwoord, in Vragen en antwoorden.