Vragen · Ontdubbelen
Hoe vind ik dubbele records in een bestand, ook als ze anders geschreven zijn?
Eerst wordt elk adres in zijn juiste vorm gezet, dan worden de namen vergeleken met oog voor afgekorte voornamen, typefouten en de omgewisselde volgorde van achternaam en voornaam. Het resultaat is niet “dubbel: ja of nee”: het is een zekerheidsniveau, met de reden ernaast.
Waarom een exacte zoekopdracht ze niet vindt
Twee records van dezelfde persoon zijn bijna nooit hetzelfde geschreven. Wie ze heeft ingevoerd gebruikte een afkorting, alleen de voorletter, wisselde achternaam en voornaam om, of schreef het adres met de afkorting die op dat moment handig was. Een zoekopdracht die tekenreeksen vergelijkt herkent daar niets van: voor haar zijn “Kalverstr. 92” en “Kalverstraat 92” twee verschillende adressen, ook al zou een postbode ze als dezelfde plek lezen.
Daarom gebeurt de vergelijking in twee stappen, niet in één. Eerst wordt elk adres in zijn juiste vorm gebracht met dezelfde engine die RadarAddress voor de normalisatie gebruikt: straat voluit, postcode in de juiste vorm en bij het huisnummer, plaats goed geschreven. Pas als twee adressen in dezelfde vorm staan heeft het zin om te vragen of ze samenvallen: eerst vergelijken en daarna rechtzetten levert alleen gemiste dubbele records op, omdat de vergelijking twee schrijfwijzen blijft zien en niet één adres.
Hetzelfde geldt voor de naam: wie op “de Vries” zoekt in de verwachting het bestaande record te vinden, en het record is er maar staat op “Vries, J. de” in plaats van “Jan de Vries”, vindt het gewoon niet. Het meest voorkomende gevolg is geen zichtbare fout: het is een nieuw record dat te goeder trouw wordt aangemaakt, naast het record dat al bestond.
Wat de vergelijking herkent
- Een afgekorte voornaam. “J.” en “Jan”, op hetzelfde adres, zonder verschillende personen te verwarren.
- Achternaam en voornaam omgewisseld. “De Vries Jan” en “Jan de Vries” komen bijna altijd uit een import met verwisselde kolommen.
- Een typefout in de achternaam. Een kleine tikfout staat de herkenning niet in de weg als de rest van het record samenvalt.
- Het tussenvoegsel anders geschreven. “de Vries” en “De Vries” zijn dezelfde naam; hoofdletters wegen niet mee.
- Een titel vóór de naam. Een titel telt niet mee in het oordeel: de persoon erachter wel.
- De afkortingen in de straat, omdat we de adressen rechtzetten voordat we ze vergelijken.
- Een wijk of dorp ingevuld als plaats, wanneer twee records een plaats noemen die in het register onder dezelfde gemeente valt.
Het oordeel: zeker, waarschijnlijk, onduidelijk
Niet alle dubbele records zijn gelijk. Als twee records na het rechtzetten op alles samenvallen, is het oordeel zeker. Als er een afgekorte voornaam of een afkorting in het spel is, blijft het waarschijnlijk: bijna altijd juist, maar een blik waard. Als de koppeling zwak is, bijvoorbeeld alleen gelijkende namen, is de groep onduidelijk, en blijft de beslissing om de records samen te voegen bij jou. Elke groep draagt de reden met zich mee: je weet altijd waarom twee records naast elkaar zijn gezet.
Ook de breedte van de zoektocht is van jou, niet alleen het lezen van het resultaat: je kiest hoe ruim de vergelijking moet zijn, van strikt (alleen naam en adres die samenvallen) tot ruim (ook de zwakke koppelingen, die je daarna zelf bekijkt). De standaardinstelling, waarmee de meeste opdrachten draaien, herkent al de varianten van namen, de afkortingen en de kleine typefouten.
Het hoofdrecord: een dubbel record gooi je niet weg, je voegt het samen
Een van de twee records weggooien is de makkelijkste keuze en de duurste: stond het e-mailadres alleen op het ene en het telefoonnummer alleen op het andere, dan verlies je met één record het andere contactgegeven. RadarAddress bouwt een hoofdrecord door uit elk record het beste veld te nemen — het adres uit het meest complete record, de naam in zijn canonieke vorm, e-mailadres en telefoonnummer van waar ze staan — en bij elk veld blijft staan uit welk record het komt, zodat je kunt nagaan waar elke informatie vandaan komt.
Waar je het doet: op de site, uit een bestand, via de API
Op de site vergelijk je twee of drie records tegelijk en zie je meteen het oordeel: dat is de snelste manier om te begrijpen hoe het werkt of om een twijfelgeval te controleren voordat je het hele bestand uploadt. Voor een heel bestand upload je een bestand: opdrachten in bulk gaan tot 100.000 records, en aan het einde vind je de kolom met het record om te bewaren en de groep waartoe elke rij hoort. Werk je vanuit code, dan vergelijkt het endpoint /api/v1/dedupe tot 500 records per aanroep, met hetzelfde oordeel zeker/waarschijnlijk/onduidelijk en hetzelfde samengevoegde hoofdrecord. De prijslijst staat op de prijzenpagina: voordat je een opdracht in bulk start zie je altijd wat ze inhoudt, en de bewerkingen worden pas afgeschreven als je bevestigt.
Twee records, dezelfde persoon
Record B: De Vries J., Kalverstraat 92, 1012 PH AMSTERDAM
Hoofdrecord: Jan de Vries, Kalverstraat 92, 1012 PH AMSTERDAM
De afgekorte voornaam (J./Jan) en het adres in twee schrijfwijzen worden pas herkend nadat beide adressen in hun juiste vorm zijn gezet. De naam is verzonnen voor demonstratiedoeleinden; elke verwijzing naar echte personen berust op toeval.
De vragen die volgen
Moet ik het bestand voorbereiden voordat ik het upload?
Nee. Je uploadt het bestand zoals het is: het rechtzetten van de adressen is de eerste stap van de vergelijking, geen werk dat je vooraf met de hand doet.
Worden dubbele records automatisch verwijderd?
Nee. Elke groep dubbele records blijft tot je beschikking met het oordeel en de reden: jij beslist of en hoe je ze samenvoegt, RadarAddress verwijdert niets uit zichzelf.
Wat gebeurt er als twee verschillende mensen dezelfde naam hebben in dezelfde plaats?
De vergelijking meldt het als onduidelijk in plaats van het zeker te verklaren: een zwakke koppeling blijft onder jouw beslissing en wordt niet geforceerd.
Hoeveel records kan ik tegelijk vergelijken?
Op de site twee of drie, om een idee te krijgen. Uit een geüpload bestand tot 100.000 records in één opdracht. Via de API tot 500 per aanroep.
Verliest het record dat ik krijg gegevens ten opzichte van de twee oorspronkelijke?
Nee: het hoofdrecord neemt uit elk record het beste veld, e-mailadres en telefoonnummer inbegrepen, en er blijft staan waar elke informatie vandaan komt.
Werkt het ook als de achternaam een typefout heeft?
Ja, binnen een redelijke marge: een kleine tikfout staat de herkenning niet in de weg als de rest van het record samenvalt.
Moet ik me registreren om mijn eigen records te vergelijken?
Ja: de openbare demo op de site vergelijkt een door ons gekozen paar, zonder ingevoerde gegevens, zodat je kunt zien hoe het werkt. Om op je eigen records te werken heb je een gratis account nodig.
Probeer het ontdubbelen
Bekijk het voorbeeld van twee records die anders geschreven zijn, en hoe de engine ze als dezelfde persoon herkent.
Probeer het ontdubbelenLees ook: Waarom Excel de duplicaten niet vindt · De adressen in een Excel-bestand verifiëren · Prijzen van het ontdubbelen