Fragen · Dublettenbereinigung

Wie finde ich Dubletten in einem Bestand, auch wenn sie unterschiedlich geschrieben sind?

Zuerst wird jede Adresse in ihre korrekte Form gebracht, dann werden die Namen verglichen, mit Blick auf abgekürzte Vornamen, Umlaute in beiden Schreibweisen, Tippfehler und die vertauschte Reihenfolge von Nachname und Vorname. Das Ergebnis ist kein Dublette-ja-oder-nein: Es ist eine Sicherheitsstufe, mit dem Grund daneben.

Warum eine exakte Suche sie nicht findet

Zwei Datensätze derselben Person sind fast nie gleich geschrieben. Wer sie eingegeben hat, hat abgekürzt, „ue“ statt „ü“ getippt, Nachname und Vorname vertauscht oder die Adresse mit der gerade bequemen Abkürzung geschrieben. Eine Suche, die Zeichenketten vergleicht, erkennt nichts davon: Für sie sind „Mönckebergstr. 7“ und „Mönckebergstraße 7“ zwei verschiedene Adressen, obwohl ein Zusteller sie als denselben Ort lesen würde.

Deshalb muss der Vergleich in zwei Schritten geschehen, nicht in einem. Zuerst wird jede Adresse mit demselben System, das RadarAddress für die Normalisierung nutzt, in ihre korrekte Form gebracht: Straße ausgeschrieben, richtige Postleitzahl, Ort korrekt geschrieben. Erst wenn zwei Adressen in derselben Form sind, hat die Frage Sinn, ob sie übereinstimmen: Erst zu vergleichen und dann zu bereinigen erzeugt nur falsche Negative, weil der Vergleich weiter zwei Schreibweisen sieht und nicht eine Adresse.

Dasselbe gilt für den Namen: Wer „Müller“ sucht und erwartet, den Datensatz zu finden, der schon im Bestand ist, und der Datensatz existiert, lautet aber „Mueller Thomas“ statt „Thomas Müller“, findet ihn schlicht nicht. Die häufigste Folge ist kein sichtbarer Fehler: Es ist ein neuer, in gutem Glauben angelegter Datensatz, der sich neben den schon vorhandenen stellt.

Was der Vergleich erkennt

  • Abgekürzte Vornamen. „T.“ und „Thomas“, wenn der Rest des Datensatzes übereinstimmt.
  • Umlaute und ß in beiden Schreibweisen. „Müller“ und „Mueller“, „Straße“ und „Strasse“: dieselbe Person, derselbe Ort.
  • Nachname und Vorname vertauscht. „Müller Thomas“ und „Thomas Müller“ kommen fast immer aus einem Import mit vertauschten Spalten.
  • Ein Tippfehler im Nachnamen. Ein kleiner Schreibfehler verhindert die Erkennung nicht, wenn der Rest des Datensatzes übereinstimmt.
  • Der Titel vor dem Namen. „Dr. Anna Schmidt“ und „Anna Schmidt“ werden als dieselbe Person verglichen: Der Titel zählt im Urteil nicht.
  • Die Abkürzungen der Straße, weil wir die Adressen vor dem Vergleich in Ordnung bringen.
  • Der Ortsteil, der zu seiner Stadt gehört, wenn zwei Datensätze einen Stadtteil oder einen eingemeindeten Ort nennen, der nach dem Register zu derselben Gemeinde gehört.

Das Urteil: sicher, wahrscheinlich, unklar

Nicht alle Dubletten sind gleich. Wenn zwei Datensätze nach der Bereinigung in allem übereinstimmen, lautet das Urteil sicher. Wenn ein abgekürzter Vorname oder eine andere Schreibweise ins Spiel kommt, bleibt es wahrscheinlich: fast immer richtig, aber einen Blick wert. Wenn die Verbindung schwach ist, zum Beispiel nur ähnliche Namen, ist die Gruppe unklar, und die Entscheidung, die Datensätze zusammenzuführen, bleibt bei Ihnen. Jede Gruppe trägt ihren Grund: Sie wissen immer, warum zwei Datensätze einander zugeordnet wurden.

Auch die Suchtiefe ist Ihre Sache, nicht nur das Lesen des Ergebnisses: Sie können wählen, wie weit der Vergleich gehen soll, von eng (nur übereinstimmender Name und Adresse) bis weit (auch die schwachen Verbindungen, die Sie sich dann ansehen). Die Voreinstellung, mit der die meisten Aufträge laufen, erkennt schon die Schreibvarianten der Namen, die Abkürzungen und die kleinen Tippfehler.

Der Hauptdatensatz: Die Dublette wird nicht weggeworfen, sondern zusammengeführt

Einen der beiden Datensätze zu verwerfen ist die bequemste Wahl und die teuerste: Stand die E-Mail-Adresse nur auf dem einen und die Telefonnummer nur auf dem anderen, verlieren Sie mit einem einzigen die andere Kontaktangabe. RadarAddress baut einen Hauptdatensatz, der aus jedem Datensatz das beste Feld nimmt, die Adresse aus dem vollständigsten, den Namen in seiner kanonischen Form, E-Mail und Telefon von dort, wo sie stehen, und bei jedem Feld bleibt vermerkt, aus welchem Datensatz es kommt, sodass Sie kontrollieren können, woher jede Information stammt.

Wo Sie es machen: auf der Website, aus einer Datei, über die API

Auf der Website sehen Sie an einem Paar von Datensätzen, wie das Urteil aussieht: der schnellste Weg, zu verstehen, wie es funktioniert. Für einen ganzen Bestand laden Sie eine Datei hoch: Die Aufträge reichen bis 100.000 Datensätze, und am Ende finden Sie die Spalte mit dem zu behaltenden Datensatz und der Gruppe, zu der jede Zeile gehört. Wer aus dem Code heraus arbeitet, hat den Endpunkt /api/v1/dedupe, der bis zu 500 Datensätze pro Aufruf vergleicht, mit demselben Urteil sicher/wahrscheinlich/unklar und demselben zusammengeführten Hauptdatensatz. Die Preise stehen auf der Preisseite: Bevor Sie einen Auftrag starten, sehen Sie immer, was er verbraucht, und Guthaben wird erst bei der Bestätigung abgebucht.

Zwei Datensätze, dieselbe Person

Vorher
Datensatz A: Müller Thomas, Mönckebergstr. 7, 20095 Hamburg
Datensatz B: Mueller T., Mönckebergstraße 7, D-20095 HAMBURG
Nachher
Dieselbe Person — Stufe sicher
Hauptdatensatz: Müller Thomas, Mönckebergstraße 7, 20095 HAMBURG

Der abgekürzte Vorname, „Müller“ neben „Mueller“ und die auf zwei Arten geschriebene Adresse werden erst erkannt, nachdem beide Adressen im nationalen Register geprüft und in ihre korrekte Form gebracht wurden. Der Name ist zu Demonstrationszwecken erfunden; jede Ähnlichkeit mit realen Personen ist rein zufällig.

Die Fragen, die folgen

Muss ich den Bestand vor dem Hochladen vorbereiten?

Nein. Sie laden die Datei so hoch, wie sie ist: Die Bereinigung der Adressen ist der erste Schritt des Vergleichs, keine Arbeit, die vorher von Hand zu erledigen wäre.

Werden die Dubletten automatisch gelöscht?

Nein. Jede Gruppe von Dubletten bleibt Ihnen mit dem Urteil und dem Grund zur Verfügung: Sie entscheiden, ob und wie Sie sie zusammenführen. RadarAddress löscht nichts von allein.

Was passiert, wenn zwei verschiedene Personen im selben Ort denselben Namen haben?

Der Vergleich meldet es als unklar, statt es für sicher zu erklären: Eine schwache Verbindung bleibt Ihrer Entscheidung überlassen und wird nicht erzwungen.

Wie viele Datensätze kann ich zusammen vergleichen?

Aus einer hochgeladenen Datei bis zu 100.000 Datensätze in einem einzigen Auftrag. Über die API bis zu 500 pro Aufruf.

Verliert der Datensatz, den ich bekomme, Daten gegenüber den beiden Ausgangsdatensätzen?

Nein: Der Hauptdatensatz nimmt aus jedem das beste Feld, E-Mail und Telefon eingeschlossen, und bei jeder Information bleibt vermerkt, woher sie kommt.

Funktioniert es auch, wenn der Nachname einen Tippfehler hat?

Ja, in einem vernünftigen Rahmen: Ein kleiner Schreibfehler verhindert die Erkennung nicht, wenn der Rest des Datensatzes übereinstimmt.

Muss ich mich registrieren, um meine Datensätze zu vergleichen?

Ja: Die öffentliche Demo auf der Website zeigt ein von uns gewähltes Paar, ohne Eingabe von Daten, damit Sie sehen, wie es funktioniert. Um an Ihren eigenen Datensätzen zu arbeiten, braucht es ein kostenloses Konto.

Die Dublettenbereinigung ansehen

Ein Paar von Datensätzen aus Deutschland, wie das System es erkennt, mit Urteil und Grund. Mit einem kostenlosen Konto arbeiten Sie an Ihrem eigenen Bestand.

Die Dublettenbereinigung ansehen

Lesen Sie auch: Warum Excel die Duplikate nicht findet · Die Adressen einer Excel-Datei prüfen · Preise der Dublettenbereinigung