Spørsmål · Deduplisering

Excel finner ikke duplikatene: hvorfor, og hva gjør jeg?

«Fjern duplikater» og sammenligninger med formler ser på teksten bokstav for bokstav: to identiske rader blir funnet, to rader som sier det samme på forskjellig måte blir det ikke. Måten å finne dem på er å ordne adressen først og kjenne igjen forkortede navn, og først deretter sammenligne.

Hva «Fjern duplikater» faktisk gjør

Funksjonen sammenligner innholdet i cellene du velger, kolonne for kolonne, tegn for tegn. Den finner den identiske raden: samme tekst, samme store bokstaver, samme mellomrom. Alt som avviker med så mye som én detalj, regnes ikke som likt, og raden blir stående i registeret som om den var en annen person.

I praksis skal det svært lite til for at sammenligningen mislykkes: et mellomrom for mye etter husnummeret, «Hansen Kari» i stedet for «Kari Hansen», «Karl Johans gt.» i stedet for «Karl Johans gate», «N-0026» i stedet for «0026». Ingen av disse tilfellene er sjeldne: de er den normale måten folk skriver et register på, ikke unntaket. Den som la inn den andre raden, gjorde ingenting galt: vedkommende skrev bare de samme opplysningene med sine egne ord, på et annet tidspunkt, kanskje fra et annet skjema.

Den samme begrensningen gjelder formler som sammenligner to kolonner for hånd, eller FINN.RAD og SAMMENLIGNE på navn og adresse: de er fortsatt en tekstsammenligning, og teksten i to virkelige dubletter er nesten aldri lik tegn for tegn.

Hvorfor to rader som ser forskjellige ut, ofte er samme person

  • Store bokstaver og mellomrom. «KARI HANSEN» og «Kari Hansen » (med et mellomrom til slutt) er for Excel to forskjellige tekster.
  • Forkortelser i gaten. «Karl Johans gt. 22» og «Karl Johans gate 22» har ikke samme tegn på samme plass fra forkortelsen og utover.
  • Etternavn og fornavn i motsatt rekkefølge. En import med kolonnene byttet om gir «Hansen Kari» ved siden av «Kari Hansen», og ingen av standardformlene kobler dem.
  • Forkortede fornavn og initialer. «K. Hansen» og «Hansen Kari» deler ikke engang hele fornavnet.
  • Postnummer som mangler på bare én rad, eller skrevet med «N-» foran. Én tom eller avvikende celle er nok til å bryte en eksakt sammenligning på flere kolonner.

Excel gjør ingen feil: det gjør nøyaktig det du ba om, en bokstavelig sammenligning. Problemet er at et virkelig register aldri er skrevet ensartet.

Hva du mister ved å kaste en rad på slump

Selv når to rader blir gjenkjent som like (for eksempel fordi den ene er kopiert fra den andre), er det risikabelt å forkaste en av dem på slump: lå e-postadressen bare på den ene raden og telefonnummeret bare på den andre, mister du en kontaktopplysning ved å beholde bare én. Og er valget manuelt, blir det på et register med noen tusen rader et langt arbeid, like utsatt for feil som det du prøver å løse: du må åpne hvert mistenkelige par, sammenligne på øyemål, bestemme hvilken du beholder og skrive over for hånd det som mangler fra den andre.

Det finnes også en mindre synlig risiko: å forkaste feil rad når de to slett ikke er samme person, bare to personer med samme navn på samme sted. En ren tekstsammenligning har ingen måte å skille de to tilfellene på, og det er nettopp der forsiktigheten trengs mest.

Hva en ordentlig sammenligning gjør i stedet

Dedupliseringen hos RadarAddress arbeider i to omganger. Først settes hver adresse i korrekt form, gaten helt ut, riktig postnummer uten «N-» foran, poststedet skrevet riktig, slik at to skrivemåter av samme gate blir samme gate allerede før de sammenlignes. Så sammenlignes navnene, med gjenkjenning av forkortede fornavn og initialer (K. og Kari), etternavn og fornavn i motsatt rekkefølge, en skrivefeil i etternavnet og tittelen foran navnet, som ikke teller i vurderingen.

Resultatet er ikke en slettet rad: det er en hovedoppføring som henter det beste feltet fra hver dublett, e-post og telefon medregnet, med skrevet hvor hver opplysning kommer fra. Og hver gruppe har et sikkerhetsnivå, sikker, sannsynlig, tvetydig, så du vet hvilke du kan slå sammen med lukkede øyne og hvilke du bør se på selv, i stedet for å måtte avgjøre det rad for rad i et regneark.

På et register lastet opp som fil kjører sammenligningen over hele listen i én jobb, opptil hundre tusen oppføringer: du trenger ikke sortere, gruppere eller krysse ark for hånd.

Samme tilfelle, to forskjellige resultater

Før
Rad 12: Kari Hansen, Karl Johans gt. 22, 0026 Oslo
Rad 340: HANSEN K., Karl Johans gate 22, N-0026 OSLO
Etter
Excel · Fjern duplikater: ingen rader fjernet
RadarAddress: samme person, nivå sikker

De to radene deler ikke én eneste identisk tekststreng, motsatt rekkefølge, initial, forkortelse, «N-» foran postnummeret, men de er samme adresse og samme person. Navnene er oppdiktet for demonstrasjonsformål; enhver likhet med virkelige personer er tilfeldig.

Spørsmålene som følger

Hvorfor finner ikke en FINN.RAD-formel disse duplikatene?

Fordi også den sammenligner teksten slik den er skrevet: er det ikke et eksakt samsvar mellom cellene, gir den ingenting tilbake, selv når de to radene handler om samme person.

Kan jeg i det minste rydde opp i store bokstaver og mellomrom i Excel først?

Du kan redusere noen tilfeller med formler som rydder i tekst, men du løser ikke forkortelsene i gaten, initialene eller etternavn og fornavn i motsatt rekkefølge: det trengs en sammenligning som forstår adressen, ikke bare teksten.

Hvordan vet jeg hvilken rad jeg skal beholde av to dubletter?

Det trenger du ikke avgjøre: dedupliseringen bygger en hovedoppføring som samler de beste feltene fra radene som inngår, i stedet for å la deg velge hvilken du skal forkaste.

Virker det også på en fil med titusenvis av rader?

Ja: en jobb i bulk tar opptil hundre tusen oppføringer, og resultatet viser for hver rad om og med hvem den danner en gruppe.

Må jeg installere noe i Excel?

Nei. Du laster opp filen som den er (Excel eller CSV) på nettstedet og laster ned resultatet: ingen tilleggskomponent å installere.

Hva koster det å deduplisere et register?

Prislisten står på prissiden; før du starter jobben ser du alltid hva den innebærer, og kreditten trekkes først når du bekrefter.

Blir kolonnene som ikke har med navn og adresse å gjøre, stående urørt?

Ja. Resultatfilen legger til kolonnene med sikkerhetsnivået og hovedoppføringen, men alt du allerede hadde i filen, kommer tilbake i opprinnelig rekkefølge.

Se dedupliseringen

Se et eksempel på en dublett motoren kjenner igjen, og registrer deg for å arbeide på ditt eget register.

Se dedupliseringen

Les også: Finne dubletter også når de er skrevet forskjellig · Kontrollere adressene i en Excel-fil · Priser for deduplisering