Frågor · Dubblettrensning
Hur hittar jag dubbletter i ett register, även när de är skrivna olika?
Först sätts varje adress i sin korrekta form, sedan jämförs namnen med hänsyn till likvärdiga namn, stavfel och omvänd ordning på efternamn och förnamn. Resultatet är inte ett ja eller nej: det är en säkerhetsnivå, med orsaken skriven bredvid.
Varför en exakt sökning inte hittar dem
Två poster för samma person är nästan aldrig skrivna lika. Den som matade in dem använde en förkortning, ett smeknamn, vände på efternamn och förnamn eller skrev adressen med den bekväma förkortningen för stunden. En sökning som jämför strängar känner inte igen något av det: för den är ”Hantverkarg. 1” och ”Hantverkargatan 1” två olika adresser, fastän en brevbärare skulle läsa dem som samma ställe.
Därför måste jämförelsen göras i två steg, inte i ett. Först sätts varje adress i sin korrekta form med samma motor som RadarAddress använder för normaliseringen: gatan utskriven, postnumret i rätt format, orten rätt skriven; i länderna vars nationella register är i drift kontrolleras adressen dessutom mot registret, svenska adresser jämförs i sin postform. Först när två adresser har samma form är det meningsfullt att fråga om de sammanfaller: att jämföra först och ordna sedan ger bara falska negativ, för jämförelsen fortsätter att se två skrivningar och inte en enda adress.
Samma sak gäller namnet: den som söker på ”Andersson” och väntar sig att hitta posten som redan finns i registret, och posten finns men står som ”Andersson Anna” i stället för ”Anna Andersson”, hittar den helt enkelt inte. Den vanligaste följden är inte ett synligt fel: det är en ny post, öppnad i god tro, bredvid den som redan fanns.
Vad jämförelsen känner igen
- Likvärdiga namn. Lasse och Lars, Kalle och Karl, Bosse och Bo, utan att blanda ihop olika personer.
- Efternamn och förnamn i omvänd ordning. ”Andersson Anna” och ”Anna Andersson” kommer nästan alltid från en import med förväxlade kolumner.
- Ett stavfel i efternamnet. Ett litet skrivfel hindrar inte igenkänningen, om resten av posten stämmer.
- Förnamnet förkortat till en initial. ”A. Andersson” på samma adress som ”Anna Andersson” läggs bredvid som en möjlig dubblett, med nivån redovisad.
- Titeln framför namnet. ”Dr Maria Lindqvist” och ”Maria Lindqvist” jämförs som samma person: titeln räknas inte i bedömningen.
- Gatans förkortningar, eftersom vi ordnar adresserna innan vi jämför dem.
- Samma e-postadress eller telefonnummer på två poster med liknande namn: en stark ledtråd, som räknas med den försiktighet den förtjänar.
Bedömningen: säker, trolig, tveksam
Alla dubbletter är inte lika. När två poster sammanfaller på allt efter ordnandet är bedömningen säker. När ett likvärdigt namn eller en förkortning spelar in blir den trolig: nästan alltid rätt, men värd en titt. När kopplingen är svag — till exempel liknande namn — är gruppen tveksam, och beslutet att slå ihop posterna är ditt. Varje grupp bär med sig orsaken: du vet alltid varför två poster lagts bredvid varandra.
Även sökningens vidd är din, inte bara läsningen av resultatet: du kan välja hur bred jämförelsen ska vara, från den snäva (bara namn och adress som sammanfaller) till den vidaste (också de svaga kopplingarna, som du sedan tittar på). Standardinställningen, den som de flesta jobb körs med, känner redan igen namnvarianter, förkortningar och små stavfel.
Huvudposten: dubbletten kastas inte, den slås ihop
Att kasta en av de två posterna är det bekvämaste valet och det som kostar mest: om e-postadressen bara fanns på den ena och telefonnumret bara på den andra förlorar du den andra kontaktuppgiften när du behåller en enda. RadarAddress bygger en huvudpost genom att ta det bästa fältet från var och en — adressen från den mest fullständiga posten, namnet i sin kanoniska form, e-post och telefon där de finns — och för varje fält står det kvar vilken post det kommer från, så att du kan kontrollera varifrån varje uppgift kommer.
Var du gör det: från webbplatsen, från en fil, från API:et
På webbplatsen ser du ett svenskt exempel med bedömningen och orsaken: det snabbaste sättet att förstå hur det fungerar. För ett helt register laddar du upp en fil: batchjobben arbetar med upp till 100.000 poster, och när jobbet är klart hittar du kolumnen med posten att behålla och gruppen varje rad hör till. Arbetar du från kod jämför endpointen /api/v1/dedupe upp till 500 poster per anrop, med samma bedömning säker/trolig/tveksam och samma sammanslagna huvudpost. Prislistan finns på prissidan: innan du startar ett batchjobb ser du alltid vad det förbrukar, och krediter dras först när du bekräftar.
Två poster, samma person
Post B: ANDERSSON A., Hantverkargatan 1, 111 52 STOCKHOLM
Huvudpost: Anna Andersson, Hantverkargatan 1, 111 52 STOCKHOLM
Det förkortade förnamnet (A. ≈ Anna) och adressen skriven på två sätt känns igen först när båda adresserna satts i sin svenska postform; orsaken lyder ”liknande namn, samma adress”. Namnet är påhittat i demonstrationssyfte; varje likhet med verkliga personer är en tillfällighet.
Frågorna som följer
Måste jag förbereda registret innan jag laddar upp det?
Nej. Du laddar upp filen som den är: ordnandet av adresserna är jämförelsens första steg, inte ett arbete att göra för hand i förväg.
Raderas dubbletterna automatiskt?
Nej. Varje grupp av dubbletter finns kvar till ditt förfogande med bedömningen och orsaken: du bestämmer om och hur den slås ihop, RadarAddress raderar inget på egen hand.
Vad händer om två olika personer har samma namn på samma ort?
Jämförelsen flaggar det som tveksamt i stället för att förklara det säkert: en svag koppling förblir under ditt beslut, den tvingas inte igenom.
Hur många poster kan jag jämföra på en gång?
Från en uppladdad fil upp till 100.000 poster i ett enda jobb. Från API:et upp till 500 per anrop.
Förlorar huvudposten uppgifter jämfört med de två ursprungliga?
Nej: huvudposten tar det bästa fältet från var och en, e-post och telefon inräknade, och det står kvar varifrån varje uppgift kommer.
Fungerar det även om efternamnet har ett stavfel?
Ja, inom rimliga gränser: ett litet skrivfel hindrar inte igenkänningen om resten av posten stämmer.
Kontrolleras svenska adresser mot ett register före jämförelsen?
Inte ännu: det svenska registret är inte i drift, så svenska adresser sätts i sin postform och jämförs på den. Det räcker för att känna igen samma adress skriven olika. Sverige följer så snart tillgången till registret är på plats; i länderna med register i drift kontrolleras adresserna dessutom mot registret.
Måste jag registrera mig för att jämföra mina poster?
Ja: den offentliga sidan visar ett exempel valt av oss, utan uppgifter utifrån, så att du kan se hur det fungerar. För att arbeta på dina egna poster behövs ett gratis konto.
Se dubblettrensningen
Se hur motorn lägger två poster bredvid varandra på ett exempel, och registrera dig för att pröva den på dina egna poster.
Se dubblettrensningenLäs även: Varför Excel inte hittar dubbletterna · Kontrollera adresserna i en Excel-fil · Priser för dubblettrensningen