Två poster,
en enda person.

Ett exempel med adresser i Sverige: två poster skrivna på olika sätt, och varför de är samma person.

Med ett gratiskonto arbetar du med dina egna adresser, från alla länder: från webbplatsen, från en fil eller via API:et. Registrera dig eller logga in.

Post A

Post B

Exemplen använder adresser till offentliga byggnader och gator i centrum; namnen, där de förekommer, är påhittade i demonstrationssyfte: varje likhet med verkliga personer är en ren tillfällighet.

Två poster, en enda person

En dubblett är inte en extra post att radera: det är en persons historik delad i två. Att sätta ihop den igen ger fyra konkreta effekter.

Svara en gång, och med full kännedom

Den som svarar tittar på en post: om ordern är registrerad på den andra får personen ingenting – och märker det. Med en enda post går bekräftelsen alltid ut, och utskicket kommer en gång: inte två till samma adress, kanske med namnet stavat på två olika sätt.

Varje extra kuvert är bortkastade pengar

En dubblett är ett tryck, ett kuvert och ett frimärke betalda för en person som ditt utskick redan har nått. I en stor kampanj är det den enklaste kostnaden att skära bort: inte en mottagare färre, bara de försändelser som behövs.

Känn igen dem som är värda mer

Den som köpt tre gånger på en post och två på den andra syns i rapporterna som två ljumma kontakter i stället för en trogen. När posterna slås ihop blir historiken hel igen, och det ändrar vem det lönar sig att ringa, vem som förtjänar en annan behandling, vem man ska erbjuda mer.

Siffrorna stämmer

Hur många kunder har jag egentligen? Vad är en kontakt värd i genomsnitt? Med ett register fullt av dubbletter är varje svar uppblåst, och de beslut som följer är felaktiga från början. Innan man analyserar måste man räkna rätt.

Det är inte slarvfel

Dubbletter uppstår i tre vardagliga situationer som återkommer i varje register som är tänkt att växa.

1

Ordern kommer in och det är bråttom

Den som registrerar har en hög med blanketter att beta av (eller inbetalningar, om du arbetar i en ideell organisation) och stannar inte upp för att kolla om personen redan finns i registret. Att öppna en ny post tar trettio sekunder; att verkligen söka efter den, bland varianterna av namn och adress, tar mycket längre tid.

2

Posten finns, men sökningen hittar den inte

Det är det vanligaste fallet och det svåraste att undvika: posten finns, men är skriven lite annorlunda än så som man söker – ”Via Giovanni Pascoli 4” mot ”Pascoli”, ”V.le” mot ”Viale”. Sökningen ger ingenting, och posten skapas på nytt i god tro.

3

En hel lista kommer in

Anmälningar från webbplatsen, en lista insamlad på ett evenemang, en fil från en leverantör: de kommer in i klump utan att jämföras med det befintliga registret. Det händer mer sällan än de två andra fallen, men när det händer kommer dubbletterna in i hundratal.

Alla tre löses på samma sätt: en kontroll av registret med jämna mellanrum, och en före varje viktig kampanj.

Först rättar vi, sedan jämför vi

Att jämföra två poster ord för ord kommer man inte långt med: Daniela och Dany är samma person, V. Roma 12 och Via Roma, 12 är samma adress, och ingen bokstavlig jämförelse märker det. Därför arbetar vi i två steg: först rättar vi de två adresserna – gatunamnet utskrivet, rätt postnummer, rätt kommun – och först därefter jämför vi dem, tillsammans med namn, e-post och telefon. Två skrivsätt för samma gata blir samma gata innan jämförelsen börjar.

Resultatet är inte ett ja eller nej. När bedömningen inte är entydig säger vi det – säker, trolig eller tvetydig, med orsaken bredvid: två olika personer kan ha samma namn i samma kommun, och att slå ihop två poster förblir ditt beslut, som du fattar med vetskap om vad det bygger på.

Normalisering, dubblettidentifiering, dubblettrensning, berikning

Fyra olika operationer som oftast hamnar under ordet ”rensning”. Det är värt att skilja dem åt, eftersom den ena är förutsättningen för den andra.

Normalisering

Att reducera varje adress till ett enda, korrekt skrivsätt och komplettera det som saknas: postnumret, provinsen, gatunamnet utskrivet.

”Via S. Caterina 20” och ”Strada Santa Caterina 20” blir samma rad.

Dubblettidentifiering

Att känna igen att två poster är samma subjekt även om de är skrivna olika: ”V. Roma 12” och ”Via Roma 12”, Dany och Daniela, efternamn och förnamn i omvänd ordning.

Den kommer efter normaliseringen, och inte av en slump: utan den jämför du strängar i stället för adresser.

Dubblettrensning

Att bestämma vad som ska göras med de dubbletter som hittats: vilken post som ska behållas, vilka fält som ska tas från den ena och vilka från den andra.

Dubbletten slängs inte: den fogas in, och det står kvar var varje uppgift kommer ifrån.

Berikning

Att lägga till det som saknas eller kan härledas ur det som finns: hälsningsfrasen från namnet, titeln, gatunumrets tilläggsbokstav, det italienska skattenumret.

Uppgifter som ingen gav dig, men som ditt register redan innehåller underförstått.

Varför det spelar roll, bortom rensningen: den som får samma brev två gånger märker det, och den som inte får något tack därför att gåvan registrerades på en post medan du tittade på den andra märker det ännu mer.

Du väljer hur strikt jämförelsen ska vara, vi säger hur säkra vi är

Vi ber dig inte bestämma vilka poster som ska slås ihop: det gör vi, och för varje grupp säger vi hur säkra vi är. Det enda vredet är jämförelsens stränghet, alltså hur olika två poster får vara och ändå vara samma subjekt. Tre värden: från webbplatsen och i filjobb används standardvärdet, i API:et väljer du med livello_minimo. Inte att förväxla med precisionen i adressnormaliseringen, som är något annat och har fem nivåer.

1 · uguale

Strikt

Namn och adress sammanfaller efter normaliseringen. Ingen grupp du inte skulle ha gjort för hand.

2 · poco diverso

Standardvärdet

Varianter av samma namn (Dany och Daniela), förkortningar och små stavfel kommer med. Det är inställningen de flesta jobb körs med.

3 · diverso

Vid

Även de svaga kopplingarna: samma adress och liknande namn. Den hittar mer, och du får titta på mer.

Bedömningen som kommer tillbaka för varje grupp – säker, trolig, tvetydig – är vår klassificering, inte ditt val: den säger hur stabil gruppen är, och hjälper dig avgöra vad du kan godta utan att titta och vad som är värt att granska.

Dubbletten slängs inte: den slås ihop

Det är skillnaden som räknas. Den som rensar dubbletter behåller oftast en post och kastar den andra – och med den e-postadressen som bara fanns där. Vi bygger en ny post och tar det bästa fältet från var och en.

Exempel på sammanslagning av två poster: vilket fält blir kvar och var det kommer ifrån
FältPost APost BPosten som blir kvar
FörnamnDany RossiRossi DanielaDaniela Rossi kanonisk form, fälten tillbaka på sin plats
Adressv. leopardi 4, milanoVia G. Leopardi 4, MilanoVia Giacomo Leopardi 4 från den mer fullständiga posten
Postnummer och ort—Milano20123 MILANO MI kompletterat vid normaliseringen
E-postdany.rossi@gmail.com—dany.rossi@gmail.com fanns bara på A
Telefon—347 032 89593470328959 fanns bara på B

Hade du behållit A hade du förlorat telefonen, med B e-posten. Den sammanslagna posten har båda, och för varje fält står det kvar vilken post det kommer från: om sammanslagningen en dag inte övertygar dig vet du exakt vad du ska ändra.

Samma dubbletter som en exakt sökning missar

  • Dany Rossi=Daniela Rossi likvärdigt namn
  • Rossi Mario=Mario Rossi efternamn och förnamn i omvänd ordning
  • V. Roma 12=Via Roma 12 förkortning utskriven
  • Rossi Daniela, via leopardi 4, milano=Daniela Rossi, Via Giacomo Leopardi 4, 20123 MILANO MI adressen rättad före jämförelsen

Vi känner också igen ett stavfel i efternamnet; titeln före namnet, som inte räknas i jämförelsen (Dott.ssa Maria Bianchi är samma person som Maria Bianchi); och stadsdelen förd tillbaka till sin kommun, eftersom Sampierdarena är en stadsdel i Genua.