Fragen · Dublettenbereinigung
Excel findet die Duplikate nicht: Warum, und was tun?
„Duplikate entfernen“ und die Vergleiche mit Formeln sehen den Text Buchstabe für Buchstabe: Zwei identische Zeilen werden gefunden, zwei Zeilen, die dasselbe auf verschiedene Art sagen, nicht. Der Weg, sie wirklich zu finden, ist, zuerst die Adresse in Ordnung zu bringen und die Schreibvarianten der Namen zu erkennen, und erst danach zu vergleichen.
Was „Duplikate entfernen“ wirklich tut
Die Funktion vergleicht den Inhalt der Zellen, die Sie auswählen, Spalte für Spalte, Zeichen für Zeichen. Sie findet die identische Zeile: derselbe Text, dieselben Groß- und Kleinbuchstaben, dieselben Leerzeichen. Alles, was auch nur in einem Detail abweicht, gilt nicht als gleich, und die Zeile bleibt im Bestand, als wäre sie eine andere Person.
In der Praxis reicht sehr wenig, damit der Vergleich scheitert: ein Leerzeichen zu viel nach der Hausnummer, „Müller Thomas“ statt „Thomas Müller“, „Mueller“ statt „Müller“, „Mönckebergstr.“ statt „Mönckebergstraße“. Keiner dieser Fälle ist selten: Es ist die normale Art, wie Menschen einen Bestand schreiben, keine Ausnahme. Wer die zweite Zeile eingegeben hat, hat nichts falsch gemacht: Er hat nur dieselben Informationen mit seinen Worten geschrieben, zu einem anderen Zeitpunkt, vielleicht aus einem anderen Formular.
Dieselbe Grenze gilt für die Formeln, die zwei Spalten von Hand vergleichen, oder für ein IDENTISCH/VERGLEICH auf Name und Adresse: Es bleibt ein Textvergleich, und der Text zweier echter Dubletten stimmt fast nie Zeichen für Zeichen überein.
Warum zwei Zeilen, die verschieden aussehen, oft dieselbe Person sind
- Groß- und Kleinschreibung und Leerzeichen. „THOMAS MÜLLER“ und „Thomas Müller “ (mit einem Leerzeichen am Ende) sind für Excel zwei verschiedene Texte.
- Umlaute und ß. „Müller“ und „Mueller“, „Straße“ und „Strasse“ haben an der entscheidenden Stelle keinen gemeinsamen Buchstaben.
- Abkürzungen der Straße. „Mönckebergstr. 7“ und „Mönckebergstraße 7“ stimmen für einen Textvergleich nicht überein.
- Nachname und Vorname vertauscht. Ein Import mit vertauschten Spalten erzeugt „Müller Thomas“ neben „Thomas Müller“, und keine der Standardformeln bringt sie zusammen.
- Abgekürzte Vornamen. „Mueller T.“ und „Müller Thomas“ teilen nicht einmal den Vornamen ganz.
- Postleitzahl mit oder ohne „D-“, oder nur auf einer Zeile. Eine leere Zelle oder ein Länderkürzel reicht, um einen exakten Vergleich über mehrere Spalten zu brechen.
Excel macht keinen Fehler: Es tut genau, was Sie verlangt haben, einen wörtlichen Vergleich. Das Problem ist, dass ein echter Bestand nie einheitlich geschrieben ist.
Was Sie verlieren, wenn Sie eine Zeile aufs Geratewohl löschen
Auch wenn zwei Zeilen als gleich erkannt werden (zum Beispiel, weil sie voneinander kopiert wurden), ist es riskant, eine davon aufs Geratewohl zu verwerfen: Stand die E-Mail-Adresse nur auf der einen und die Telefonnummer nur auf der anderen, verlieren Sie mit einer einzigen eine Kontaktangabe. Und wenn die Wahl von Hand geschieht, wird sie bei einem Bestand von einigen tausend Zeilen zu einer langen und ebenso fehleranfälligen Arbeit wie die, die man lösen will: Man muss jedes verdächtige Paar öffnen, nach Augenmaß vergleichen, entscheiden, welche Zeile bleibt, und die fehlenden Angaben der anderen von Hand übertragen.
Es gibt auch ein weniger sichtbares Risiko: die falsche Zeile zu verwerfen, wenn die beiden gar nicht dieselbe Person sind, sondern nur zwei Personen mit demselben Namen im selben Ort. Ein reiner Textvergleich hat keine Möglichkeit, die beiden Fälle zu unterscheiden, obwohl gerade dort die größte Vorsicht nötig wäre.
Was ein echter Vergleich stattdessen tut
Die Dublettenbereinigung von RadarAddress arbeitet in zwei Schritten. Zuerst bringt sie jede Adresse in ihre korrekte Form, Straße ausgeschrieben, richtige Postleitzahl, Ort korrekt geschrieben, sodass zwei Schreibweisen derselben Straße dieselbe Straße werden, noch bevor sie verglichen werden. Dann vergleicht sie die Namen und erkennt dabei abgekürzte Vornamen (T. und Thomas), Umlaute in beiden Schreibweisen (Müller und Mueller), die vertauschte Reihenfolge von Nachname und Vorname, einen Tippfehler im Nachnamen und den Titel vor dem Namen, der im Urteil nicht zählt.
Das Ergebnis ist keine gelöschte Zeile: Es ist ein Hauptdatensatz, der aus jeder Dublette das beste Feld nimmt, E-Mail und Telefon eingeschlossen, mit dem Vermerk, woher jede Information kommt. Und jede Gruppe trägt eine Sicherheitsstufe, sicher, wahrscheinlich, unklar, sodass Sie wissen, welche Sie blind zusammenführen können und welche Sie sich ansehen, statt es Zeile für Zeile wie in einer Tabellenkalkulation entscheiden zu müssen.
Bei einem als Datei hochgeladenen Bestand läuft der Vergleich über die ganze Liste in einem einzigen Auftrag, bis zu 100.000 Datensätze: kein Sortieren, Gruppieren oder Abgleichen von Tabellenblättern von Hand.
Derselbe Fall, zwei verschiedene Ergebnisse
Zeile 340: Mueller T., Mönckebergstraße 7, D-20095 HAMBURG
RadarAddress: dieselbe Person, Stufe sicher
Die beiden Zeilen haben keine einzige identische Zeichenkette gemeinsam, abgekürzter Vorname, „ue“ statt „ü“, Straße abgekürzt, Länderkürzel nur auf einer, und sind doch dieselbe Adresse und dieselbe Person. Der Name ist zu Demonstrationszwecken erfunden; jede Ähnlichkeit mit realen Personen ist rein zufällig.
Die Fragen, die folgen
Warum findet eine SVERWEIS-Formel diese Duplikate nicht?
Weil auch sie den Text so vergleicht, wie er geschrieben ist: Gibt es keine exakte Übereinstimmung zwischen den Zellen, liefert sie nichts, auch wenn die beiden Zeilen von derselben Person sprechen.
Kann ich wenigstens Groß- und Kleinschreibung und Leerzeichen vorher in Excel vereinheitlichen?
Sie können einige Fälle mit Formeln zur Textbereinigung reduzieren, lösen damit aber weder die Abkürzungen der Straße noch die Umlaute in zwei Schreibweisen noch die vertauschte Reihenfolge von Nachname und Vorname: Es braucht einen Vergleich, der die Adresse versteht, nicht nur den Text.
Woher weiß ich, welche Zeile ich von zwei Dubletten behalten soll?
Das müssen Sie nicht entscheiden: Die Dublettenbereinigung baut einen Hauptdatensatz, der die besten Felder der beteiligten Zeilen vereint, statt Sie wählen zu lassen, welche Sie verwerfen.
Funktioniert es auch bei einer Datei mit Zehntausenden von Zeilen?
Ja: Ein Auftrag reicht bis 100.000 Datensätze, und das Ergebnis zeigt für jede Zeile, ob und mit wem sie eine Gruppe bildet.
Muss ich etwas in Excel installieren?
Nein. Sie laden die Datei so hoch, wie sie ist (Excel oder CSV), auf der Website und laden das Ergebnis herunter: keine Zusatzkomponente zu installieren.
Was kostet die Dublettenbereinigung eines Bestands?
Die Preise stehen auf der Preisseite; bevor Sie den Auftrag starten, sehen Sie immer, was er verbraucht, und Guthaben wird erst bei der Bestätigung abgebucht.
Bleiben die Spalten, die nichts mit Name und Adresse zu tun haben, unverändert?
Ja. Die Ergebnisdatei fügt die Spalten mit der Sicherheitsstufe und dem Hauptdatensatz hinzu, aber alles, was Sie schon in der Datei hatten, kommt in der ursprünglichen Reihenfolge zurück.
Die Dublettenbereinigung ansehen
Ein Paar von Datensätzen aus Deutschland, das Excel nicht zusammenbringt und das System als Dublette erkennt. Mit einem kostenlosen Konto arbeiten Sie an Ihrem eigenen Bestand.
Die Dublettenbereinigung ansehenLesen Sie auch: Dubletten finden, auch wenn sie unterschiedlich geschrieben sind · Die Adressen einer Excel-Datei prüfen · Preise der Dublettenbereinigung