To oppføringer,
én person.
Et eksempel med adresser i Norge: to oppføringer skrevet på ulik måte, og hvorfor de er samme person.
Med en gratis konto jobber du med dine egne adresser, fra alle land: fra nettstedet, fra en fil eller via API-et. Registrer deg eller logg inn.
To oppføringer, én person
En dublett er ikke en ekstra oppføring som skal slettes: det er én persons historikk delt i to. Å sette den sammen igjen gir fire konkrete effekter.
Svar én gang, og med full oversikt
Den som svarer, ser på én oppføring: står bestillingen registrert på den andre, får den personen ingenting — og legger merke til det. Med én oppføring går bekreftelsen alltid ut, og henvendelsen kommer én gang: ikke to ganger til samme adresse, kanskje med navnet stavet på to forskjellige måter.
Hver ekstra konvolutt er bortkastede penger
En dublett er et trykk, en konvolutt og et frimerke betalt for en person henvendelsen din allerede har nådd. I en stor kampanje er det den enkleste kostnaden å kutte: ikke én mottaker færre, bare de forsendelsene som trengs.
Se hvem som er verdt mest
Den som har kjøpt tre ganger under én oppføring og to ganger under den andre, står i rapportene som to lunkne kontakter i stedet for én lojal. Når oppføringene slås sammen, blir historikken hel igjen, og det endrer hvem det lønner seg å ringe, hvem som fortjener en annen behandling, hvem du bør tilby mer.
Tallene stemmer
Hvor mange kunder har jeg egentlig? Hva er en kontakt verdt i snitt? Med et register fullt av dubletter er hvert svar oppblåst, og avgjørelsene som følger, er feil fra starten av. Før du analyserer, må du telle riktig.
Det er ikke slurvefeil
Dubletter oppstår i tre helt vanlige situasjoner, som gjentar seg i hvert register som skal vokse.
Bestillingen kommer inn, og det haster
Den som registrerer, har en bunke skjemaer å komme gjennom (eller giroer, i en ideell organisasjon) og stopper ikke opp for å sjekke om personen allerede ligger i registeret. Å opprette en ny oppføring tar tretti sekunder; å lete ordentlig etter den, blant variantene av navnet og adressen, tar mye lengre tid.
Oppføringen finnes, men søket finner den ikke
Det er det vanligste tilfellet og det vanskeligste å unngå: oppføringen finnes, men er skrevet litt annerledes enn slik det søkes — «Via Giovanni Pascoli 4» mot «Pascoli», «V.le» mot «Viale». Søket gir ingen treff, og oppføringen opprettes på nytt i god tro.
En hel liste kommer inn
Påmeldinger fra nettstedet, en liste samlet inn på et arrangement, en fil fra en leverandør: de kommer inn samlet uten å bli sammenlignet med det eksisterende registeret. Det skjer sjeldnere enn de to andre tilfellene, men når det skjer, kommer dublettene inn i hundretall.
Alle tre løses på samme måte: en kontroll av registeret med jevne mellomrom, og én før hver viktig kampanje.
Først retter vi, så sammenligner vi
Å sammenligne to oppføringer ord for ord kommer man ikke langt med: Daniela og Dany er samme person, V. Roma 12 og Via Roma, 12 er samme adresse, og ingen bokstavelig sammenligning merker det. Derfor jobber vi i to trinn: først retter vi de to adressene — gatenavn fullt ut, riktig postnummer, riktig sted — og først da sammenligner vi dem, sammen med navn, e-post og telefon. To skrivemåter for samme gate blir samme gate før sammenligningen begynner.
Resultatet er ikke et ja eller nei. Når dommen ikke er klar, sier vi det — sikker, sannsynlig eller tvetydig, med begrunnelsen ved siden av: to forskjellige personer kan ha samme navn i samme kommune, og å slå sammen to oppføringer forblir din avgjørelse, tatt med viten om hva den bygger på.
Normalisering, dublettgjenkjenning, deduplisering, berikelse
Fire forskjellige operasjoner, som vanligvis alle havner under ordet «vask». Det er nyttig å skille dem, fordi den ene er forutsetningen for den neste.
Normalisering
Å redusere hver adresse til én riktig skrivemåte og fylle ut det som mangler: postnummeret, fylket, gatenavnet fullt ut.
«Via S. Caterina 20» og «Strada Santa Caterina 20» blir samme linje.
Dublettgjenkjenning
Å gjenkjenne at to oppføringer er samme subjekt selv når de er skrevet forskjellig: «V. Roma 12» og «Via Roma 12», Dany og Daniela, etternavn og fornavn byttet om.
Den kommer etter normaliseringen, og ikke tilfeldig: uten den sammenligner du tekststrenger i stedet for adresser.
Deduplisering
Å bestemme hva som skal gjøres med dublettene som er funnet: hvilken oppføring som beholdes, hvilke felt som tas fra den ene og hvilke fra den andre.
Dubletten kastes ikke: den flettes inn, og det står skrevet hvor hver opplysning kommer fra.
Berikelse
Å legge til det som mangler eller kan utledes av det som finnes: hilsningsformen fra navnet, tittelen, bokstaven i husnummeret, skattekoden.
Data ingen har gitt deg, men som registeret ditt allerede inneholder implisitt.
Hvorfor det betyr noe, utover ryddingen: den som får samme brev to ganger, merker det, og den som ikke får takkebrevet fordi gaven var registrert på én oppføring mens du så på den andre, merker det enda mer.
Du velger hvor streng sammenligningen skal være, vi sier hvor sikre vi er
Vi ber deg ikke bestemme hvilke oppføringer som skal slås sammen: det gjør vi, og for hver gruppe sier vi hvor sikre vi er. Den eneste innstillingen er sammenligningens strenghet, altså hvor forskjellige to oppføringer kan være og fortsatt være samme subjekt. Tre verdier: nettstedet og filjobbene bruker standardverdien, i API-et velger du med livello_minimo. Ikke å forveksle med presisjonen i adressenormaliseringen, som er noe annet og har fem nivåer.
Streng
Navn og adresse stemmer overens etter normaliseringen. Ingen gruppe du ikke ville laget for hånd.
Standardverdien
Varianter av samme navn (Dany og Daniela), forkortelser og små skrivefeil kommer med. Det er innstillingen de fleste jobber kjøres med.
Løs
Også de svake koblingene: samme adresse og lignende navn. Den finner mer, og du må se over mer.
Dommen som returneres for hver gruppe — sikker, sannsynlig, tvetydig — er vår klassifisering, ikke ditt valg: den sier hvor solid gruppen er, og hjelper deg å avgjøre hva du kan godta i blinde og hva som er verdt å se over.
Dubletten kastes ikke: den flettes sammen
Det er forskjellen som teller. Den som dedupliserer, beholder som regel én oppføring og forkaster den andre — og med den forkastes e-postadressen som bare fantes der. Vi bygger en ny oppføring ved å ta det beste feltet fra hver.
| Felt | Oppføring A | Oppføring B | Oppføring som blir igjen |
|---|---|---|---|
| Fornavn | Dany Rossi | Rossi Daniela | Daniela Rossi kanonisk form, feltene satt tilbake på plass |
| Adresse | v. leopardi 4, milano | Via G. Leopardi 4, Milano | Via Giacomo Leopardi 4 fra den mest komplette oppføringen |
| Postnummer og poststed | — | Milano | 20123 MILANO MI fylt ut under normaliseringen |
| E-post | dany.rossi@gmail.com | — | dany.rossi@gmail.com fantes bare i A |
| Telefon | — | 347 032 8959 | 3470328959 fantes bare i B |
Hadde du beholdt A, ville du mistet telefonen; hadde du beholdt B, e-posten. Den sammenslåtte oppføringen har begge, og for hvert felt står det hvilken oppføring det kommer fra: skulle du en dag ikke være overbevist om sammenslåingen, vet du nøyaktig hva du skal endre.
De samme dublettene som slipper unna et eksakt søk
- Dany Rossi=Daniela Rossi likeverdig navn
- Rossi Mario=Mario Rossi etternavn og fornavn byttet om
- V. Roma 12=Via Roma 12 forkortelse skrevet fullt ut
- Rossi Daniela, via leopardi 4, milano=Daniela Rossi, Via Giacomo Leopardi 4, 20123 MILANO MI adressen rettet før sammenligningen
Vi gjenkjenner også en skrivefeil i etternavnet; tittelen foran navnet, som ikke teller i sammenligningen (Dott.ssa Maria Bianchi er samme person som Maria Bianchi); og stedet ført tilbake til sin kommune, fordi Sampierdarena er en bydel i Genova.
Relaterte spørsmål
- Hvordan kontrollerer og retter jeg et kunderegister?
- Hvordan finner jeg dubletter i et register, også når de er skrevet forskjellig?
- Excel finner ikke duplikatene: hvorfor, og hva gjør jeg?
Alle spørsmålene, med svaret, under Spørsmål og svar.