Spørsmål · Deduplisering

Hvordan finner jeg dubletter i et register, også når de er skrevet forskjellig?

Først settes hver adresse i korrekt form, så sammenlignes navnene med hensyn til forkortede fornavn og initialer, skrivefeil og etternavn og fornavn i motsatt rekkefølge. Resultatet er ikke et ja eller nei: det er et sikkerhetsnivå, med årsaken skrevet ved siden av.

Hvorfor et eksakt søk ikke finner dem

To oppføringer for samme person er nesten aldri skrevet likt. Den som la dem inn, brukte en forkortelse eller bare initialen, byttet om etternavn og fornavn, eller skrev adressen med den forkortelsen som var praktisk der og da. Et søk som sammenligner tekststrenger, kjenner ikke igjen noe av dette: for det er «Karl Johans gt. 22» og «Karl Johans gate 22» to forskjellige adresser, selv om et postbud ville lest dem som samme sted.

Derfor må sammenligningen gjøres i to omganger, ikke én. Først settes hver adresse i korrekt form med den samme motoren RadarAddress bruker til normaliseringen: gaten helt ut, riktig postnummer uten «N-» foran, poststedet skrevet riktig. Først når to adresser står i samme form gir det mening å spørre om de er like. Å sammenligne først og ordne etterpå gir bare falske nei, fordi sammenligningen fortsetter å se to skrivemåter og ikke én adresse.

Det samme gjelder navnet: den som søker «Hansen» og venter å finne oppføringen som allerede ligger i registeret, og oppføringen finnes, men står som «Hansen Kari» i stedet for «Kari Hansen», finner den rett og slett ikke. Den vanligste følgen er ikke en synlig feil: det er en ny oppføring opprettet i god tro, ved siden av den som allerede fantes.

Hva sammenligningen kjenner igjen

  • Forkortede fornavn og initialer. «K.» og «Kari» regnes som samme person når resten av oppføringen stemmer, uten å blande sammen forskjellige personer.
  • Etternavn og fornavn i motsatt rekkefølge. «Hansen Kari» og «Kari Hansen» kommer nesten alltid fra en import med kolonnene byttet om.
  • En skrivefeil i etternavnet. En liten tastefeil hindrer ikke gjenkjenningen hvis resten av oppføringen stemmer.
  • Store og små bokstaver. «HANSEN» og «Hansen» er samme etternavn.
  • Tittelen foran navnet. «Dr. Kari Hansen» og «Kari Hansen» sammenlignes som samme person: tittelen teller ikke i vurderingen.
  • Forkortelsene i gaten, fordi vi ordner adressene før vi sammenligner dem.
  • Samme e-postadresse eller samme mobilnummer på to oppføringer med samme navn, også når adressen mangler på en av dem.

Vurderingen: sikker, sannsynlig, tvetydig

Ikke alle dubletter er like. Når to oppføringer stemmer på alt etter at adressene er ordnet, er vurderingen sikker. Når et forkortet fornavn eller en forkortelse spiller inn, blir den sannsynlig: nesten alltid riktig, men verdt et blikk. Når koblingen er svak, for eksempel lignende navn, er gruppen tvetydig, og avgjørelsen om å slå sammen oppføringene blir din. Hver gruppe har årsaken med seg: du vet alltid hvorfor to oppføringer er koblet sammen.

Også søkenivået er ditt, ikke bare lesingen av resultatet: du kan velge hvor bred sammenligningen skal være, fra den strenge (bare navn og adresse som stemmer) til den bredeste (også de svake koblingene, som du så ser på selv). Standardinnstillingen, den de fleste jobbene kjøres med, kjenner allerede igjen forkortede navn, forkortelser og små skrivefeil.

Hovedoppføringen: dubletten kastes ikke, den slås sammen

Å forkaste en av de to oppføringene er det enkleste valget og det som koster mest: lå e-postadressen bare på den ene og telefonnummeret bare på den andre, mister du den ene kontaktopplysningen ved å beholde bare én. RadarAddress bygger en hovedoppføring ved å hente det beste feltet fra hver av dem, adressen fra den mest komplette oppføringen, navnet i sin fulle form, e-post og telefon derfra de finnes, og for hvert felt står det skrevet hvilken oppføring det kommer fra, så du kan kontrollere hvor hver opplysning stammer fra.

Hvor du gjør det: fra nettstedet, fra en fil, fra API-et

Fra nettstedet, i kontoen din, sammenligner du to eller tre oppføringer om gangen og ser vurderingen med en gang: det er den raskeste måten å forstå hvordan det virker, eller å sjekke et tvilstilfelle før du laster opp hele registeret. For et helt register laster du opp en fil: jobber i bulk tar opptil hundre tusen oppføringer, og når jobben er ferdig finner du kolonnen med oppføringen som bør beholdes og gruppen hver rad hører til. Arbeider du fra kode, sammenligner endepunktet /api/v1/dedupe opptil fem hundre oppføringer per kall, med samme vurdering sikker/sannsynlig/tvetydig og samme sammenslåtte hovedoppføring. Prislisten står på prissiden: før du starter en jobb i bulk ser du alltid hva den innebærer, og kreditten trekkes først når du bekrefter.

To oppføringer, samme person

Før
Oppføring A: Kari Hansen, Karl Johans gt. 22, 0026 Oslo
Oppføring B: HANSEN K., Karl Johans gate 22, N-0026 OSLO
Etter
Samme person — nivå sikker
Hovedoppføring: Hansen Kari, Karl Johans gate 22, 0026 OSLO

Initialen (K. og Kari), etternavnet med store bokstaver og adressen skrevet på to måter kjennes igjen først etter at begge adressene er satt i korrekt form. Navnene er oppdiktet for demonstrasjonsformål; enhver likhet med virkelige personer er tilfeldig.

Spørsmålene som følger

Må jeg forberede registeret før jeg laster det opp?

Nei. Du laster opp filen som den er: å ordne adressene er det første steget i sammenligningen, ikke et arbeid du gjør for hånd først.

Blir dublettene slettet automatisk?

Nei. Hver gruppe av dubletter blir liggende til deg med vurderingen og årsaken: du bestemmer om og hvordan den slås sammen, RadarAddress sletter ingenting på egen hånd.

Hva skjer hvis to forskjellige personer har samme navn på samme sted?

Sammenligningen merker det som tvetydig i stedet for å erklære det sikkert: en svak kobling blir liggende under din avgjørelse, den tvinges ikke gjennom.

Hvor mange oppføringer kan jeg sammenligne samtidig?

Fra nettstedet to eller tre, for å få et inntrykk. Fra en opplastet fil opptil hundre tusen oppføringer i én jobb. Fra API-et opptil fem hundre per kall.

Mister oppføringen jeg får, data i forhold til de to opprinnelige?

Nei: hovedoppføringen henter det beste feltet fra hver av dem, e-post og telefon medregnet, og det står skrevet hvor hver opplysning kommer fra.

Virker det også hvis etternavnet har en skrivefeil?

Ja, innenfor en rimelig margin: en liten tastefeil hindrer ikke gjenkjenningen hvis resten av oppføringen stemmer.

Må jeg registrere meg for å sammenligne mine egne oppføringer?

Ja: den offentlige siden viser et eksempel valgt av oss, uten data inn, så du kan se hvordan det virker. For å arbeide på dine egne oppføringer trengs en gratis konto.

Se dedupliseringen

Se et eksempel på to oppføringer som kjennes igjen som samme person, og registrer deg for å sammenligne dine egne.

Se dedupliseringen

Les også: Hvorfor Excel ikke finner dublettene · Kontrollere adressene i en Excel-fil · Priser for deduplisering