To poster,
én person.

Et eksempel med adresser i Danmark: to poster skrevet forskelligt, og hvorfor de er samme person.

Med en gratis konto arbejder du på dine egne adresser, fra ethvert land: fra websitet, fra en fil eller via API'et. Opret dig, eller log ind.

Post A

Post B

Eksemplerne bruger adresser på offentlige bygninger og gader i centrum; navnene, hvor de forekommer, er opdigtede til demonstration: enhver henvisning til virkelige personer er tilfældig.

To poster, én person

En dublet er ikke en ekstra post, der skal slettes: det er én persons historik delt i to. At samle den igen har fire konkrete virkninger.

Svar én gang, og med fuldt overblik

Den, der svarer, ser på én post: er ordren registreret på den anden, får den person ingenting — og lægger mærke til det. Med én post går bekræftelsen altid ud, og kommunikationen kommer én gang: ikke to gange til samme adresse, måske med navnet stavet på to forskellige måder.

Hver ekstra kuvert er penge ud ad vinduet

En dublet er et print, en kuvert og et frimærke betalt for en person, som din kommunikation allerede har nået. I en stor kampagne er det den letteste omkostning at skære væk: ikke én modtager færre, kun de forsendelser, der er brug for.

Genkend dem, der er mere værd

En, der har købt tre gange under den ene post og to gange under den anden, optræder i rapporterne som to lunkne kontakter i stedet for én loyal. Når posterne samles, bliver historikken hel igen, og det ændrer, hvem det kan betale sig at ringe til, hvem der fortjener en anden behandling, og hvem man skal tilbyde mere.

Tallene passer

Hvor mange kunder har jeg egentlig? Hvad er en kontakt i gennemsnit værd? Med en database fuld af dubletter er hvert svar pustet op, og de beslutninger, der følger, er fejlbehæftede fra starten. Før man analyserer, skal man tælle rigtigt.

Det er ikke sjuskefejl

Dubletter opstår i tre helt almindelige situationer, som gentager sig i enhver database, der skal vokse.

1

Ordren kommer ind, og der er travlt

Den, der taster, har en bunke formularer at komme igennem (eller indbetalingskort i en forening) og stopper ikke op for at tjekke, om personen allerede er i systemet. At oprette en ny post tager tredive sekunder; at lede rigtigt efter den, blandt varianterne af navn og adresse, tager meget længere.

2

Posten findes, men søgningen finder den ikke

Det er det hyppigste tilfælde og det sværeste at undgå: posten findes, men er skrevet lidt anderledes, end der søges — »Via Giovanni Pascoli 4« mod »Pascoli«, »V.le« mod »Viale«. Søgningen giver ingenting, og posten oprettes igen i god tro.

3

En hel liste kommer ind

Tilmeldinger fra websitet, en liste indsamlet ved et arrangement, en fil fra en leverandør: de kommer ind samlet uden at blive sammenholdt med den eksisterende database. Det sker sjældnere end de to andre tilfælde, men når det sker, kommer dubletterne ind i hundredvis.

Alle tre løses på samme måde: en kontrol af databasen med jævne mellemrum, og én før hver vigtig kampagne.

Først retter vi, så sammenligner vi

At sammenligne to poster ord for ord fører ikke langt: Daniela og Dany er samme person, V. Roma 12 og Via Roma, 12 er samme adresse, og ingen bogstavelig sammenligning opdager det. Derfor arbejder vi i to trin: først retter vi de to adresser — vejnavn skrevet helt ud, korrekt postnummer, den rigtige by — og først derefter sammenligner vi dem, sammen med navnet, e-mailen og telefonnummeret. To stavemåder af samme vej bliver til samme vej, før sammenligningen begynder.

Resultatet er ikke et ja eller et nej. Når dommen ikke er entydig, siger vi det — sikker, sandsynlig eller tvivlsom, med årsagen ved siden af: to forskellige mennesker kan have samme navn i samme by, og at samle to poster forbliver din beslutning, som skal træffes med viden om, hvad den hviler på.

Normalisering, dubletsøgning, deduplikering, berigelse

Fire forskellige operationer, som normalt alle ender under ordet »oprydning«. Det er vigtigt at skelne, fordi den ene er forudsætningen for den næste.

Normalisering

At reducere hver adresse til én korrekt stavemåde og udfylde det, der mangler: postnummeret, provinsen, vejnavnet skrevet helt ud.

»Via S. Caterina 20« og »Strada Santa Caterina 20« bliver til samme linje.

Dubletsøgning

At genkende, at to poster er samme person, selv når de er skrevet forskelligt: »V. Roma 12« og »Via Roma 12«, Dany og Daniela, efternavn og fornavn byttet om.

Den kommer efter normaliseringen, og ikke tilfældigt: uden den sammenligner du tekststrenge i stedet for adresser.

Deduplikering

At beslutte, hvad der skal ske med de fundne dubletter: hvilken post der beholdes, hvilke felter der tages fra den ene, og hvilke fra den anden.

Dubletten smides ikke væk: den flettes ind, og det bliver stående, hvor hver oplysning kommer fra.

Berigelse

At tilføje det, der mangler eller kan udledes af det, der er der: tiltalen ud fra navnet, titlen, husnummerets tilføjelse, skattenummeret.

Data, som ingen har givet dig, men som din database allerede indeholder implicit.

Hvorfor det betyder noget, ud over oprydning: den, der modtager samme brev to gange, lægger mærke til det, og den, der ikke modtager takkebrevet, fordi donationen var registreret på den ene post, mens du så på den anden, lægger endnu mere mærke til det.

Du vælger, hvor stram sammenligningen er, vi fortæller dig, hvor sikre vi er

Vi beder dig ikke beslutte, hvilke poster der skal samles: det gør vi, og for hver gruppe siger vi, hvor sikre vi er. Den eneste knap er sammenligningens stramhed, altså hvor forskellige to poster kan være og stadig være samme person. Tre værdier: websitet og filjobbene bruger standarden, API'et lader dig vælge med livello_minimo. Må ikke forveksles med præcisionen i adressenormaliseringen, som er noget andet og har fem niveauer.

1 · uguale

Stram

Navn og adresse stemmer overens efter normaliseringen. Ingen gruppe, du ikke selv ville have lavet i hånden.

2 · poco diverso

Standarden

Varianter af samme navn (Dany og Daniela), forkortelser og små tastefejl kommer med. Det er den indstilling, de fleste job kører med.

3 · diverso

Løs

Også de svage forbindelser: samme adresse og lignende navne. Den finder mere, og du skal se på mere.

Dommen, der kommer tilbage for hver gruppe — sikker, sandsynlig, tvivlsom — er vores klassificering, ikke dit valg: den siger, hvor solid gruppen er, og hjælper dig med at afgøre, hvad du kan acceptere i blinde, og hvad der er værd at gennemgå.

Dubletten smides ikke væk: den flettes

Det er forskellen, der tæller. Den, der deduplikerer, beholder som regel én post og kasserer den anden — og med den kasseres den e-mail, der kun stod dér. Vi bygger en ny post ved at tage det bedste felt fra hver.

Eksempel på fletning af to poster: hvilket felt der bliver, og hvor det kommer fra
FeltPost APost BPost, der bliver
FornavnDany RossiRossi DanielaDaniela Rossi kanonisk form, felter sat tilbage på plads
Adressev. leopardi 4, milanoVia G. Leopardi 4, MilanoVia Giacomo Leopardi 4 fra den mest komplette post
Postnummer og by—Milano20123 MILANO MI udfyldt under normaliseringen
E-maildany.rossi@gmail.com—dany.rossi@gmail.com stod kun på A
Telefon—347 032 89593470328959 stod kun på B

Beholdt du A, havde du mistet telefonnummeret, beholdt du B, e-mailen. Den flettede post har begge, og for hvert felt står der, hvilken post det kommer fra: hvis fletningen en dag ikke overbeviser dig, ved du præcis, hvad du skal røre ved.

De samme dubletter, som en præcis søgning ikke finder

  • Dany Rossi=Daniela Rossi tilsvarende navn
  • Rossi Mario=Mario Rossi efternavn og fornavn byttet om
  • V. Roma 12=Via Roma 12 forkortelse skrevet ud
  • Rossi Daniela, via leopardi 4, milano=Daniela Rossi, Via Giacomo Leopardi 4, 20123 MILANO MI adresse rettet før sammenligningen

Vi genkender også en tastefejl i efternavnet; titlen foran navnet, som ikke tæller i sammenligningen (Dott.ssa Maria Bianchi er samme person som Maria Bianchi); og bydelen ført tilbage til sin kommune, fordi Sampierdarena er en bydel i Genova.