Vragen · Ontdubbelen
Excel vindt de duplicaten niet: waarom, en wat doe je eraan?
“Duplicaten verwijderen” en vergelijkingen met formules kijken naar de tekst letter voor letter: twee identieke rijen worden gevonden, twee rijen die hetzelfde zeggen op een andere manier niet. De manier om ze echt te vinden is eerst het adres rechtzetten en de naamvarianten herkennen, en pas daarna vergelijken.
Wat “Duplicaten verwijderen” echt doet
De functie vergelijkt de inhoud van de cellen die je kiest, kolom voor kolom, teken voor teken. Ze vindt de identieke rij: dezelfde tekst, dezelfde hoofdletters, dezelfde spaties. Alles wat ook maar in één detail afwijkt wordt niet als gelijk beschouwd, en de rij blijft in het bestand alsof het een andere persoon is.
In de praktijk is er heel weinig nodig om de vergelijking te laten mislukken: een extra spatie na het huisnummer, “De Vries Jan” in plaats van “Jan de Vries”, “Kalverstr.” in plaats van “Kalverstraat”. Geen van die gevallen is zeldzaam: het is de normale manier waarop mensen een bestand vullen, geen uitzondering. Wie de tweede rij heeft ingevoerd heeft niets fout gedaan: hij heeft alleen dezelfde informatie in zijn eigen woorden geschreven, op een ander moment, misschien vanuit een ander formulier.
Dezelfde beperking geldt voor formules die met de hand twee kolommen vergelijken, of een VERT.ZOEKEN of VERGELIJKEN op naam en adres: het blijft een tekstvergelijking, en de tekst van twee echte dubbele records valt bijna nooit teken voor teken samen.
Waarom twee rijen die verschillend lijken vaak dezelfde persoon zijn
- Hoofdletters en spaties. “JAN DE VRIES” en “Jan de Vries ” (met een spatie aan het einde) zijn voor Excel twee verschillende teksten.
- Afkortingen in de straat. “Kalverstr. 92” en “Kalverstraat 92” hebben na de eerste letters geen enkel teken meer op dezelfde positie.
- Achternaam en voornaam omgewisseld. Een import met verwisselde kolommen zet “De Vries Jan” naast “Jan de Vries”, en geen van de standaardformules brengt ze bij elkaar.
- Voorletter in plaats van voornaam. “J. de Vries” en “Jan de Vries” delen niet eens de volledige voornaam.
- Postcode zonder spatie of ontbrekend op één rij. “1012PH” tegenover “1012 PH”, of een lege cel: genoeg om een exacte vergelijking over meerdere kolommen te breken.
Excel maakt geen fout: het doet precies wat je hebt gevraagd, een letterlijke vergelijking. Het probleem is dat een echt bestand nooit uniform geschreven is.
Wat je verliest als je een willekeurige rij weggooit
Ook als twee rijen als gelijk herkend worden (bijvoorbeeld omdat ze over elkaar gekopieerd zijn), is het riskant om er willekeurig één weg te gooien: stond het e-mailadres alleen op de ene rij en het telefoonnummer alleen op de andere, dan verlies je met één rij een contactgegeven. En als de keuze met de hand gebeurt, wordt het bij een bestand van een paar duizend rijen een lang werk, net zo foutgevoelig als wat je wilt oplossen: elk verdacht paar openen, op het oog vergelijken, beslissen welke je houdt en de ontbrekende gegevens van de andere met de hand overnemen.
Er is ook een minder zichtbaar risico: de verkeerde rij weggooien als de twee helemaal niet dezelfde persoon zijn, maar gewoon twee mensen met dezelfde naam in dezelfde plaats. Een zuiver tekstuele vergelijking kan die twee gevallen niet uit elkaar houden, terwijl juist daar de meeste voorzichtigheid nodig is.
Wat een echte vergelijking dan wel doet
Het ontdubbelen van RadarAddress werkt in twee stappen. Eerst zet het elk adres in zijn juiste vorm — straat voluit, postcode in de juiste vorm en bij het huisnummer, plaats goed geschreven — zodat twee schrijfwijzen van dezelfde straat dezelfde straat worden nog vóór ze vergeleken worden. Daarna vergelijkt het de namen, met herkenning van de afgekorte voornaam (J. en Jan), de omgewisselde volgorde van achternaam en voornaam, een typefout in de achternaam en de titel vóór de naam, die niet meetelt in het oordeel.
Het resultaat is geen verwijderde rij: het is een hoofdrecord dat uit elk dubbel record het beste veld neemt, e-mailadres en telefoonnummer inbegrepen, met erbij waar elke informatie vandaan komt. En elke groep draagt een zekerheidsniveau — zeker, waarschijnlijk, onduidelijk — zodat je weet welke je blind samenvoegt en welke je zelf bekijkt, in plaats van het rij voor rij te moeten beslissen zoals in een spreadsheet.
Op een bestand dat je uploadt draait de vergelijking over de hele lijst in één opdracht, tot 100.000 records: je hoeft niet te sorteren, te groeperen of werkbladen met de hand te kruisen.
Hetzelfde geval, twee verschillende uitkomsten
Rij 340: De Vries J., Kalverstraat 92, 1012 PH AMSTERDAM
RadarAddress: dezelfde persoon, niveau zeker
De twee rijen delen geen enkele identieke tekenreeks — voorletter tegenover voornaam, afkorting, postcode met en zonder spatie — maar het is hetzelfde adres en dezelfde persoon. De naam is verzonnen voor demonstratiedoeleinden; elke verwijzing naar echte personen berust op toeval.
De vragen die volgen
Waarom vindt een VERT.ZOEKEN-formule deze duplicaten niet?
Omdat ook die de tekst vergelijkt zoals hij geschreven is: zonder exacte overeenkomst tussen de cellen geeft ze niets terug, ook als de twee rijen over dezelfde persoon gaan.
Kan ik dan tenminste vooraf hoofdletters en spaties in Excel gelijktrekken?
Je kunt een paar gevallen wegwerken met formules die tekst opschonen, maar je lost de afkortingen in de straat, de voorletters en de omgewisselde volgorde van achternaam en voornaam niet op: daarvoor is een vergelijking nodig die het adres begrijpt, niet alleen de tekst.
Hoe weet ik welke rij ik moet houden van twee dubbele records?
Dat hoef je niet te beslissen: het ontdubbelen bouwt een hoofdrecord dat de beste velden van de betrokken rijen samenbrengt, in plaats van je te laten kiezen welke je weggooit.
Werkt het ook op een bestand met tienduizenden rijen?
Ja: een opdracht in bulk gaat tot 100.000 records, en het resultaat geeft voor elke rij aan of en met wie ze een groep vormt.
Moet ik iets in Excel installeren?
Nee. Je uploadt het bestand zoals het is (Excel of CSV) op de site en downloadt het resultaat: geen invoegtoepassing te installeren.
Wat kost het ontdubbelen van een bestand?
De prijslijst staat op de prijzenpagina; voordat je de opdracht start zie je altijd wat ze inhoudt, en de bewerkingen worden pas afgeschreven als je bevestigt.
Blijven de kolommen die niets met naam en adres te maken hebben intact?
Ja. Het resultaatbestand voegt de kolommen met het zekerheidsniveau en het hoofdrecord toe, maar alles wat je al in het bestand had komt terug in de oorspronkelijke volgorde.
Probeer het ontdubbelen
Bekijk het voorbeeld van twee rijen die Excel laat staan, en hoe de engine ze als één persoon herkent.
Probeer het ontdubbelenLees ook: Dubbele records vinden, ook als ze anders geschreven zijn · De adressen in een Excel-bestand verifiëren · Prijzen van het ontdubbelen