Zwei Datensätze,
eine einzige Person.
Ein Beispiel mit Adressen aus Deutschland: zwei unterschiedlich geschriebene Datensätze, und warum es dieselbe Person ist.
Mit einem kostenlosen Konto arbeiten Sie mit Ihren eigenen Adressen aus jedem Land: über die Website, aus einer Datei oder über die API. Registrieren oder anmelden.
Zwei Datensätze, eine einzige Person
Eine Dublette ist nicht ein überzähliger Datensatz zum Löschen: Sie ist die Geschichte einer Person, in zwei Teile zerrissen. Sie wieder zusammenzusetzen hat vier konkrete Wirkungen.
Nur einmal antworten, und mit vollem Wissen
Wer antwortet, sieht einen Datensatz: Ist die Bestellung auf dem anderen erfasst, bekommt diese Person nichts – und merkt es. Mit einem einzigen Datensatz geht die Bestätigung immer raus, und die Mitteilung kommt einmal an: nicht zweimal an dieselbe Adresse, womöglich mit dem Namen in zwei verschiedenen Schreibweisen.
Jeder Umschlag zu viel ist verschwendetes Geld
Eine Dublette ist ein Druck, ein Umschlag und eine Briefmarke, bezahlt für eine Person, die Ihre Mitteilung schon erreicht hat. In einer großen Kampagne ist es die Ausgabe, die sich am leichtesten einsparen lässt: kein Empfänger weniger, nur die Sendungen, die gebraucht werden.
Erkennen, wer mehr wert ist
Wer dreimal unter dem einen Datensatz gekauft hat und zweimal unter dem anderen, erscheint in den Berichten als zwei lauwarme Kontakte statt als ein treuer. Werden die Datensätze zusammengeführt, ist die Geschichte wieder vollständig – und es ändert sich, wen anzurufen sich lohnt, wem eine besondere Behandlung zusteht, wem man mehr anbieten sollte.
Die Zahlen stimmen
Wie viele Kunden habe ich wirklich? Was ist ein Kontakt im Durchschnitt wert? Mit einem Bestand voller Dubletten ist jede Antwort aufgebläht, und die Entscheidungen, die daraus folgen, sind von Anfang an verzerrt. Vor dem Analysieren muss man richtig zählen.
Es sind keine Flüchtigkeitsfehler
Dubletten entstehen aus drei ganz gewöhnlichen Situationen, die sich in jedem wachsenden Bestand wiederholen.
Die Bestellung kommt herein, und es ist keine Zeit
Wer die Daten erfasst, hat einen Stapel Formulare abzuarbeiten (oder Überweisungsbelege, in einem Verein) und hält nicht inne, um zu prüfen, ob diese Person schon im Bestand ist. Einen neuen Datensatz anzulegen dauert dreißig Sekunden; ihn wirklich zu suchen, zwischen den Varianten von Name und Adresse, dauert viel länger.
Der Datensatz ist da, aber die Suche findet ihn nicht
Es ist der häufigste Fall und der am schwersten zu vermeidende: Der Datensatz existiert, ist aber ein klein wenig anders geschrieben, als man ihn sucht – „Via Giovanni Pascoli 4“ gegen „Pascoli“, „V.le“ gegen „Viale“. Die Suche liefert nichts, und der Datensatz wird in gutem Glauben neu angelegt.
Eine ganze Liste kommt herein
Anmeldungen über die Website, eine bei einer Veranstaltung gesammelte Liste, eine Datei von einem Lieferanten: Sie kommen als Block herein, ohne mit dem vorhandenen Bestand abgeglichen zu werden. Das passiert seltener als in den beiden anderen Fällen, aber wenn es passiert, kommen die Dubletten zu Hunderten.
Alle drei lösen sich auf dieselbe Weise: eine Prüfung des Bestands in regelmäßigen Abständen und eine vor jeder wichtigen Kampagne.
Erst in Ordnung bringen, dann vergleichen
Zwei Datensätze Wort für Wort zu vergleichen führt nicht weit: Daniela und Dany sind dieselbe Person, V. Roma 12 und Via Roma, 12 sind dieselbe Adresse, und kein wörtlicher Vergleich merkt das. Deshalb arbeiten wir in zwei Schritten: Erst bringen wir die beiden Adressen in Ordnung – Straßenname ausgeschrieben, Postleitzahl korrigiert, der richtige Ort – und erst dann vergleichen wir sie, zusammen mit Name, E-Mail und Telefon. Zwei Schreibweisen derselben Straße werden zur selben Straße, bevor der Vergleich beginnt.
Das Ergebnis ist kein Ja oder Nein. Wenn das Urteil nicht eindeutig ist, sagen wir es – sicher, wahrscheinlich oder unklar, mit dem Grund daneben: Zwei verschiedene Personen können in derselben Gemeinde denselben Namen haben, und zwei Datensätze zusammenzuführen bleibt Ihre Entscheidung – eine, die Sie in Kenntnis der Grundlage treffen.
Normalisierung, Dublettenerkennung, Dublettenbereinigung, Anreicherung
Vier verschiedene Vorgänge, die meist alle unter dem Wort „Bereinigung“ landen. Sie zu unterscheiden lohnt sich, denn einer ist die Voraussetzung des nächsten.
Normalisierung
Jede Adresse auf eine einzige, korrekte Schreibweise bringen und ergänzen, was fehlt: die Postleitzahl, die Provinz, den ausgeschriebenen Straßennamen.
„Via S. Caterina 20“ und „Strada Santa Caterina 20“ werden zur selben Zeile.
Dublettenerkennung
Erkennen, dass zwei Datensätze dasselbe Subjekt sind, auch wenn sie unterschiedlich geschrieben sind: „V. Roma 12“ und „Via Roma 12“, Dany und Daniela, Nachname und Vorname vertauscht.
Sie kommt nach der Normalisierung, und das nicht zufällig: Ohne sie vergleicht man Zeichenketten statt Adressen.
Dublettenbereinigung
Entscheiden, was mit den gefundenen Dubletten geschieht: welcher Datensatz bleibt, welche Felder aus dem einen und welche aus dem anderen übernommen werden.
Die Dublette wird nicht weggeworfen: Sie wird eingearbeitet, und es bleibt festgehalten, woher jede Information stammt.
Anreicherung
Ergänzen, was fehlt oder sich aus dem Vorhandenen ableiten lässt: die Anrede aus dem Vornamen, den Titel, den Hausnummernzusatz, die Steuernummer.
Daten, die Ihnen niemand gegeben hat, die Ihr Bestand aber schon implizit enthält.
Warum es zählt, über die Bereinigung hinaus: Wer denselben Brief zweimal bekommt, merkt es – und wer das Dankschreiben nicht bekommt, weil die Spende auf dem einen Datensatz erfasst war, während Sie auf den anderen geschaut haben, merkt es noch mehr.
Sie wählen die Genauigkeit des Vergleichs, wir sagen Ihnen, wie sicher wir sind
Wir bitten Sie nicht zu entscheiden, welche Datensätze zusammengeführt werden: Das machen wir, und für jede Gruppe sagen wir, mit welcher Sicherheit. Der einzige Regler ist die Genauigkeit des Vergleichs, also wie verschieden zwei Datensätze sein dürfen und trotzdem dasselbe Subjekt bleiben. Drei Werte: Website und Dateiaufträge verwenden den Standardwert, in der API wählen Sie mit livello_minimo. Nicht zu verwechseln mit der Genauigkeit der Adressnormalisierung, die etwas anderes ist und fünf Stufen hat.
Streng
Name und Adresse stimmen nach der Normalisierung überein. Keine Gruppe, die Sie nicht auch von Hand gebildet hätten.
Der Standardwert
Varianten desselben Namens (Dany und Daniela), Abkürzungen und kleine Tippfehler kommen dazu. Es ist die Einstellung, mit der die meisten Aufträge laufen.
Weit
Auch die schwachen Verbindungen: dieselbe Adresse und ähnliche Namen. Findet mehr, und Sie müssen mehr ansehen.
Das Urteil, das zu jeder Gruppe zurückkommt – sicher, wahrscheinlich, unklar –, ist unsere Einstufung, nicht Ihre Wahl: Es sagt, wie solide die Gruppe ist, und hilft zu entscheiden, was Sie blind übernehmen können und was einen zweiten Blick verdient.
Die Dublette wird nicht weggeworfen: Sie wird verschmolzen
Das ist der Unterschied, der zählt. Wer Dubletten bereinigt, behält meist einen Datensatz und verwirft den anderen – und mit ihm die E-Mail, die nur dort stand. Wir bauen einen neuen Datensatz und nehmen aus jedem das beste Feld.
| Feld | Datensatz A | Datensatz B | Datensatz, der bleibt |
|---|---|---|---|
| Vorname | Dany Rossi | Rossi Daniela | Daniela Rossi kanonische Form, Felder an ihren Platz zurückgesetzt |
| Adresse | v. leopardi 4, milano | Via G. Leopardi 4, Milano | Via Giacomo Leopardi 4 aus dem vollständigeren Datensatz |
| Postleitzahl und Ort | — | Milano | 20123 MILANO MI bei der Normalisierung ergänzt |
| dany.rossi@gmail.com | — | dany.rossi@gmail.com stand nur in A | |
| Telefon | — | 347 032 8959 | 3470328959 stand nur in B |
Hätten Sie A behalten, wäre die Telefonnummer verloren gewesen, bei B die E-Mail. Der zusammengeführte Datensatz hat beides, und für jedes Feld bleibt festgehalten, aus welchem Datensatz es stammt: Sollte Sie die Zusammenführung eines Tages nicht überzeugen, wissen Sie genau, wo Sie ansetzen müssen.
Dieselben Dubletten, die einer exakten Suche entgehen
- Dany Rossi=Daniela Rossi gleichwertiger Name
- Rossi Mario=Mario Rossi Nachname und Vorname vertauscht
- V. Roma 12=Via Roma 12 Abkürzung aufgelöst
- Rossi Daniela, via leopardi 4, milano=Daniela Rossi, Via Giacomo Leopardi 4, 20123 MILANO MI Adresse vor dem Vergleich in Ordnung gebracht
Wir erkennen auch einen Tippfehler im Nachnamen; den Titel vor dem Namen, der im Vergleich nicht zählt (Dott.ssa Maria Bianchi ist dieselbe Person wie Maria Bianchi); und den Ortsteil, der seiner Gemeinde zugeordnet wird, weil Sampierdarena ein Stadtteil von Genua ist.
Verwandte Fragen
- Wie prüft und korrigiert man einen Kundenbestand?
- Wie finde ich Dubletten in einem Bestand, auch wenn sie unterschiedlich geschrieben sind?
- Excel findet die Duplikate nicht: Warum, und was tun?
Alle Fragen, mit der Antwort, unter Fragen und Antworten.