Frågor · Dubblettrensning
Excel hittar inte dubbletterna: varför, och vad gör man?
”Ta bort dubbletter” och jämförelser med formler tittar på texten tecken för tecken: två identiska rader hittas, två rader som säger samma sak på olika sätt hittas inte. Sättet att verkligen hitta dem är att först ordna adressen och känna igen likvärdiga namn, och först därefter jämföra.
Vad ”Ta bort dubbletter” verkligen gör
Funktionen jämför innehållet i de celler du väljer, kolumn för kolumn, tecken för tecken. Den hittar den identiska raden: samma text, samma versaler, samma mellanslag. Allt som avviker med minsta detalj räknas inte som lika, och raden blir kvar i registret som om den vore en annan person.
I praktiken behövs ytterst lite för att jämförelsen ska misslyckas: ett extra mellanslag efter husnumret, ”Andersson Anna” i stället för ”Anna Andersson”, ”Hantverkarg.” i stället för ”Hantverkargatan”. Inget av de fallen är ovanligt: det är det normala sättet folk skriver ett register på, inte ett undantag. Den som matade in den andra raden gjorde inget fel: hen skrev bara samma uppgifter med sina ord, vid ett annat tillfälle, kanske från ett annat formulär.
Samma begränsning gäller formlerna som jämför två kolumner för hand, eller en LETARAD eller PASSA på namn och adress: de är ändå en textjämförelse, och texten i två verkliga dubbletter stämmer nästan aldrig tecken för tecken.
Varför två rader som ser olika ut ofta är samma person
- Versaler och mellanslag. ”ANNA ANDERSSON” och ”Anna Andersson ” (med ett avslutande mellanslag) är för Excel två olika texter.
- Gatans förkortningar. ”Hantverkarg. 1” och ”Hantverkargatan 1” har inte samma tecken på samma plats.
- Efternamn och förnamn i omvänd ordning. En import med förväxlade kolumner ger ”Andersson Anna” bredvid ”Anna Andersson”, och ingen av standardformlerna lägger dem ihop.
- Likvärdiga namn och initialer. ”Lasse Nilsson” och ”Nilsson Lars”, ”A. Andersson” och ”Anna Andersson”, delar inte ens hela förnamnet.
- Postnummer i olika format, eller bara på en av raderna. ”11152” och ”111 52” är samma postnummer men olika text, och en tom cell räcker för att bryta en exakt jämförelse över flera kolumner.
Excel gör inte fel: det gör exakt det du bett om, en bokstavlig jämförelse. Problemet är att ett verkligt register aldrig är skrivet på ett enhetligt sätt.
Vad du förlorar på att kasta en rad på måfå
Även när två rader känns igen som lika (till exempel för att de kopierats över varandra) är det riskabelt att kasta en av dem på måfå: om e-postadressen bara fanns på den ena raden och telefonnumret bara på den andra förlorar du en kontaktuppgift när du behåller en enda. Och om valet görs för hand blir det på ett register med några tusen rader ett långt arbete, lika felbenäget som det man vill lösa: varje misstänkt par ska öppnas, jämföras med ögat, avgöras och de uppgifter som saknas ska skrivas av för hand från den andra raden.
Det finns också en mindre synlig risk: att kasta fel rad när de två inte alls är samma person, utan bara två personer med samma namn på samma ort. En rent textbaserad jämförelse kan inte skilja de två fallen åt, fastän det är just där den största försiktigheten behövs.
Vad en verklig jämförelse gör i stället
RadarAddress dubblettrensning arbetar i två steg. Först sätter den varje adress i sin korrekta form — gatan utskriven, postnumret i rätt format, orten rätt skriven — så att två skrivningar av samma gata blir samma gata redan innan de jämförs; svenska adresser jämförs i sin postform, och i länderna vars nationella register är i drift kontrolleras adressen dessutom mot registret. Sedan jämför den namnen och känner igen likvärdiga namn (Lasse och Lars), omvänd ordning på efternamn och förnamn, ett stavfel i efternamnet och titeln framför namnet, som inte räknas i bedömningen.
Resultatet är inte en raderad rad: det är en huvudpost som tar det bästa fältet från varje dubblett, e-post och telefon inräknade, med skrivet varifrån varje uppgift kommer. Och varje grupp har en säkerhetsnivå — säker, trolig, tveksam — så att du vet vilka du kan slå ihop med slutna ögon och vilka du bör titta på själv, i stället för att avgöra det rad för rad i ett kalkylblad.
På ett register uppladdat som fil körs jämförelsen på hela listan i ett enda jobb, upp till 100.000 poster: inget behöver sorteras, grupperas eller korsas mellan blad för hand.
Samma fall, två olika resultat
Rad 340: ANDERSSON A., Hantverkargatan 1, 111 52 STOCKHOLM
RadarAddress: samma person, nivå säker
De två raderna delar inte en enda identisk sträng — förnamnet förkortat, gatan förkortad, postnumret i två format — men det är samma adress och samma person; orsaken lyder ”liknande namn, samma adress”. Namnet är påhittat i demonstrationssyfte; varje likhet med verkliga personer är en tillfällighet.
Frågorna som följer
Varför hittar inte en LETARAD-formel de här dubbletterna?
För att även den jämför texten som den är skriven: finns det ingen exakt träff mellan cellerna ger den inget tillbaka, även när de två raderna handlar om samma person.
Kan jag åtminstone normalisera versaler och mellanslag i Excel först?
Du kan minska några fall med formler som städar text, men du löser inte gatans förkortningar, likvärdiga namn eller omvänd ordning på efternamn och förnamn: det behövs en jämförelse som förstår adressen, inte bara texten.
Hur vet jag vilken rad jag ska behålla av två dubbletter?
Du behöver inte avgöra det: dubblettrensningen bygger en huvudpost som förenar de bästa fälten från de berörda raderna, i stället för att låta dig välja vilken som ska kastas.
Fungerar det även på en fil med tiotusentals rader?
Ja: ett batchjobb arbetar med upp till 100.000 poster, och resultatet anger för varje rad om och med vilka den bildar en grupp.
Måste jag installera något i Excel?
Nej. Du laddar upp filen som den är (Excel eller CSV) på webbplatsen och laddar ner resultatet: inget tillägg att installera.
Vad kostar det att dubblettrensa ett register?
Prislistan finns på prissidan; innan du startar jobbet ser du alltid vad det förbrukar, och krediter dras först när du bekräftar.
Förblir kolumnerna som inte har med namn och adress att göra orörda?
Ja. Resultatfilen lägger till kolumnerna med säkerhetsnivån och huvudposten, men allt du redan hade i filen kommer tillbaka i ursprunglig ordning.
Se dubblettrensningen
Se hur motorn känner igen en dubblett på ett svenskt exempel, och registrera dig för att pröva den på dina egna poster.
Se dubblettrensningenLäs även: Hitta dubbletter även när de är skrivna olika · Kontrollera adresserna i en Excel-fil · Priser för dubblettrensningen