Spørgsmål · Deduplikering

Excel finder ikke dubletterne: hvorfor, og hvad gør man?

»Fjern dubletter« og sammenligninger med formler ser på teksten bogstav for bogstav: to identiske rækker findes, to rækker, der siger det samme på forskellig måde, gør ikke. Måden at finde dem på er at bringe adressen i orden og genkende tilsvarende fornavne først, og først derefter sammenligne.

Hvad »Fjern dubletter« faktisk gør

Funktionen sammenligner indholdet af de celler, du vælger, kolonne for kolonne, tegn for tegn. Den finder den identiske række: samme tekst, samme store bogstaver, samme mellemrum. Alt, hvad der afviger bare på en detalje, regnes ikke for ens, og rækken bliver stående i registret, som var det en anden person.

I praksis skal der meget lidt til, for at sammenligningen slår fejl: et mellemrum for meget efter husnummeret, »Jensen Mette« i stedet for »Mette Jensen«, »Blvd.« i stedet for »Boulevard«, »DK-1553« i stedet for »1553«. Ingen af de tilfælde er sjældne: det er den normale måde, folk skriver et register på, ikke en undtagelse. Den, der tastede den anden række ind, gjorde ikke noget forkert: vedkommende skrev bare de samme oplysninger med sine egne ord, på et andet tidspunkt, måske fra en anden formular.

Den samme begrænsning gælder formler, der sammenligner to kolonner i hånden, eller en opslagsformel på navn og adresse: det er stadig en sammenligning af tekst, og teksten i to virkelige dubletter er næsten aldrig ens tegn for tegn.

Hvorfor to rækker, der ser forskellige ud, ofte er samme person

  • Store bogstaver og mellemrum. »METTE JENSEN« og »Mette Jensen « (med et mellemrum til sidst) er for Excel to forskellige tekster.
  • Forkortelser i vejen. »H. C. Andersens Blvd. 27« og »H.C. Andersens Boulevard 27« har ikke ét eneste bogstav ens på den rigtige plads.
  • Efternavn og fornavn byttet om. En import med kolonnerne byttet om giver »Jensen Mette« ved siden af »Mette Jensen«, og ingen af standardformlerne sætter dem sammen.
  • Tilsvarende fornavne. »M. Jensen« og »Jensen Mette« deler ikke engang fornavnet.
  • Postnummer manglende eller med »DK-« på kun én række. En tom celle eller et landepræfiks er nok til at bryde en præcis sammenligning over flere kolonner.

Excel tager ikke fejl: det gør præcis det, du bad om, en bogstavelig sammenligning. Problemet er, at et virkeligt register aldrig er skrevet ensartet.

Hvad du mister ved at smide en tilfældig række væk

Selv når to rækker genkendes som ens (for eksempel fordi den ene er kopieret fra den anden), er det risikabelt at kassere en af dem på må og få: stod e-mailen kun på den ene række og telefonnummeret kun på den anden, mister du en kontaktoplysning ved kun at beholde én. Og er valget manuelt, bliver det på et register med nogle tusind rækker et langt arbejde, lige så fejlbehæftet som det, man ville løse: man skal åbne hvert mistænkeligt par, sammenligne med øjnene, beslutte, hvilken der skal beholdes, og skrive de data af i hånden, der mangler fra den anden.

Der er også en mindre synlig risiko: at kassere den forkerte række, når de to slet ikke er samme person, men bare to personer med samme navn i samme by. En rent tekstlig sammenligning har ingen mulighed for at skelne de to tilfælde, og det er netop dér, den største forsigtighed er nødvendig.

Hvad en rigtig sammenligning gør i stedet

RadarAddress' deduplikering arbejder i to omgange. Først bringer den hver adresse i sin korrekte form — vejen skrevet helt ud, postnummeret på fire cifre uden »DK-«, postbyen skrevet rigtigt — så to stavemåder af samme vej bliver til samme vej, allerede før de sammenlignes. Så sammenligner den navnene og genkender tilsvarende fornavne (M. og Mette, Trine og Katrine), ombyttet efternavn og fornavn, en tastefejl i efternavnet og titlen foran navnet, som ikke tæller i resultatet.

Resultatet er ikke en slettet række: det er en hovedpost, der tager det bedste felt fra hver dublet, e-mail og telefon inklusive, med oplysning om, hvor hver oplysning kommer fra. Og hver gruppe har et sikkerhedsniveau — sikker, sandsynlig, tvivlsom — så du ved, hvilke du kan flette med lukkede øjne, og hvilke du selv skal se på, i stedet for at skulle afgøre det række for række som i et regneark.

På et register uploadet som fil kører sammenligningen over hele listen i ét job, op til 100.000 poster: der er ikke brug for at sortere, gruppere eller krydse ark i hånden.

Samme tilfælde, to forskellige resultater

Før
Række 12: Mette Jensen, H.C. Andersens Boulevard 27, 1553 København
Række 340: JENSEN M., H. C. Andersens Blvd. 27, DK-1553 KØBENHAVN
Efter
Excel · Fjern dubletter: ingen række fjernet
RadarAddress: samme person, niveau sikker

De to rækker deler ikke én eneste identisk tekststreng — store bogstaver, forkortelse, forbogstav i stedet for fornavn, »DK-« på den ene — men det er samme adresse og samme person. Navnet er opdigtet til demonstration; enhver lighed med virkelige personer er tilfældig.

Spørgsmålene herunder

Hvorfor finder en opslagsformel ikke disse dubletter?

Fordi den også sammenligner teksten, som den er skrevet: er der ikke et præcist match mellem cellerne, giver den intet tilbage, selv når de to rækker handler om samme person.

Kan jeg i det mindste rette store bogstaver og mellemrum i Excel først?

Du kan fjerne nogle tilfælde med tekstformler, men du løser hverken forkortelserne i vejen, de tilsvarende fornavne eller ombytningen af efternavn og fornavn: der skal en sammenligning til, som forstår adressen, ikke bare teksten.

Hvordan ved jeg, hvilken række jeg skal beholde af to dubletter?

Det behøver du ikke afgøre: deduplikeringen bygger en hovedpost, som samler de bedste felter fra de berørte rækker, i stedet for at lade dig vælge, hvilken der skal kasseres.

Virker det også på en fil med titusindvis af rækker?

Ja: et job arbejder med op til 100.000 poster, og resultatet angiver for hver række, om og med hvem den danner en gruppe.

Skal jeg installere noget i Excel?

Nej. Du uploader filen, som den er (Excel eller CSV), på websitet og downloader resultatet: intet tilføjelsesprogram at installere.

Hvad koster det at deduplikere et register?

Prislisten står på siden Priser; før du starter jobbet, ser du altid, hvad det bruger, og behandlingerne trækkes først, når du bekræfter.

Forbliver de kolonner, der ikke har med navn og adresse at gøre, urørte?

Ja. Resultatfilen tilføjer kolonnerne med sikkerhedsniveauet og hovedposten, men alt, hvad du allerede havde i filen, kommer tilbage i den oprindelige rækkefølge.

Se deduplikeringen

Se, hvordan motoren genkender en dublet på et eksempel, og opret dig for at prøve den på dine egne poster.

Se deduplikeringen

Læs også: Find dubletter, også når de er skrevet forskelligt · Verificér adresserne i en Excel-fil · Priser for deduplikering