Duplikat-Zeilen entfernen
Entfernen Sie doppelte Zeilen aus einer Liste, mit Optionen zum Sortieren, Trimmen von Leerzeichen, Ignorieren der Groß-/Kleinschreibung, und Entfernen leerer Zeilen. Nützlich zum Bereinigen von E-Mail-Listen, Protokolldateien, Schlüsselwortlisten und CSV-Spalten.
- Dateien verlassen niemals Ihr Gerät
- Kostenlos, keine Anmeldung
- Keine Wasserzeichen
- Funktioniert nach dem Laden auch offline
So verwenden Sie Duplikat-Zeilen entfernen
- 1
Liste einfügen
Ein Eintrag pro Zeile — E-Mails, URLs, Schlüsselwörter, was auch immer.
- 2
Optionen wählen
Sortieren, trimmen, Groß-/Kleinschreibung ignorieren, oder nur Zeilen behalten, die mehr als einmal vorkommen.
- 3
Ergebnis kopieren
Die Anzahl entfernter Zeilen wird angezeigt, damit Sie wissen, was sich geändert hat.
Warum „erstes Vorkommen behalten" die vernünftige Standardeinstellung ist
Enthält eine Liste mehrere Kopien derselben Zeile, muss es eine Regel geben, welche Kopie überlebt, und die erste zu behalten ist die Wahl, die am meisten Information über die ursprüngliche Liste bewahrt: Die überlebende Reihenfolge spiegelt noch wider, wie die Liste ursprünglich zusammengestellt wurde, statt durch den Deduplizierungsschritt selbst durcheinandergebracht zu werden. Das ist konkret wichtig für eine Liste, die ursprünglich in einer sinnvollen Reihenfolge war — chronologisch hinzugefügte Einträge, oder bereits durch einen externen Prozess sortiert — wo das Deduplizieren ohne diese Reihenfolge zu stören das Ergebnis genauso nutzbar hält wie das Original, nur ohne die Wiederholungen.
Das Sortieren danach zu aktivieren ist ein separater, bewusster Schritt gerade weil es diese ursprüngliche Reihenfolge zugunsten alphabetischer Ordnung aufgibt, was die richtige Wahl ist, wenn die ursprüngliche Reihenfolge keine Bedeutung trug, die es wert war zu bewahren — ein durcheinandergebrachter Export aus mehreren Quellen zum Beispiel — und die falsche Wahl, wenn sie es tat.
Was „Groß-/Kleinschreibung ignorieren" ändert und was nicht
„Groß-/Kleinschreibung ignorieren" ändert nur, wie zwei Zeilen verglichen werden, um zu entscheiden, ob sie Duplikate sind — Apple, APPLE und apple werden unter dieser Einstellung als derselbe Eintrag behandelt, und der zuerst in der Liste erschienene ist der, der überlebt, mit seiner eigenen ursprünglichen Groß-/Kleinschreibung unverändert. Das ist eine reine Vergleichseinstellung, keine Normalisierung: Das Tool schreibt nie die Groß-/Kleinschreibung einer überlebenden Zeile um, um einer Standardform zu entsprechen; es entscheidet nur, welche Zeilen für die Zwecke des Findens von Wiederholungen als gleichwertig zählen.
Das ist wichtig für Listen, die aus mehreren Quellen mit inkonsistenter Groß-/Kleinschreibung zusammengetragen wurden — E-Mail-Adressen, die über verschiedene Formulare eingereicht wurden, Produktnamen, die von verschiedenen Personen eingegeben wurden — wo ohne diese Einstellung „John@Example.com" und „john@example.com" als zwei unterschiedliche Einträge behandelt würden und beide überleben würden, was den Zweck der Deduplizierung überhaupt vereitelt.
Duplikate finden statt sie zu entfernen
Die Operation umzukehren, um nur Zeilen anzuzeigen, die mehr als einmal vorkamen, verwandelt dies von einem Bereinigungs-Tool in ein Prüf-Tool — nützlich, wenn das Ziel nicht eine saubere Liste ist, sondern eine Antwort auf „enthält diese Liste wirklich Duplikate, und welche?". Das ist der nützlichste Modus beim Untersuchen eines Datenqualitätsproblems: eine Kundenliste im Verdacht, wiederholte Einträge zu enthalten, eine Schlüsselwortliste, die möglicherweise aus überlappenden Quellen zusammengestellt wurde, eine Protokolldatei, in der wiederholte Zeilen einen echten, mehrfach protokollierten Fehler statt eines einmaligen andeuten könnten.
Leerzeichen vor dem Zeilenvergleich trimmen
Zwei visuell identisch wirkende Zeilen können trotzdem nicht als Duplikate übereinstimmen, wenn eine ein nachgestelltes Leerzeichen oder ein mit bloßem Auge unsichtbares Tabulatorzeichen trägt — ein häufiges Ergebnis beim Kopieren von Daten aus einer Tabellenkalkulation oder Tabelle, wo Zellenfüllung manchmal als literales Leerzeichen übertragen wird. Jede Zeile vor dem Vergleich zu trimmen entfernt genau diese Art falscher Nicht-Duplikate und erfasst Einträge, die ein menschlicher Prüfer sofort als gleich bezeichnen würde, ein strikter Zeichen-für-Zeichen-Vergleich aber nicht.
Häufig gestellte Fragen
Welches Duplikat wird behalten?
Das erste Vorkommen, daher bleibt die ursprüngliche Reihenfolge für alles Verbleibende erhalten. Aktivieren Sie zusätzlich das Sortieren, werden die überlebenden Zeilen danach alphabetisch geordnet.
Was genau macht „Groß-/Kleinschreibung ignorieren"?
Behandelt Apple, APPLE und apple als dieselbe Zeile und behält die zuerst erschienene — mit ihrer ursprünglichen Groß-/Kleinschreibung unverändert. Es ändert, was als Duplikat zählt, nicht wie das Ergebnis geschrieben wird.
Kann ich Duplikate finden statt sie zu entfernen?
Ja. „Nur Duplikate anzeigen" kehrt die Operation um und listet nur Zeilen, die mehr als einmal vorkamen — nützlich, um eine Liste zu prüfen statt sie zu bereinigen.
Gibt es ein Größenlimit?
In der Praxis ein paar Hunderttausend Zeilen. Alles läuft in Ihrem Browser, daher ist das Limit der Speicher Ihres Geräts statt einer Upload-Obergrenze — und Ihre Daten verlassen den Tab nie, was für Kundenlisten wichtig ist.
Häufige Aufgaben für Duplikat-Zeilen entfernen
Das könnte Sie auch interessieren
Groß-/Kleinschreibung-Konverter
Text zwischen allen Schreibweisen konvertieren
Wortzähler
Wörter, Sätze und Lesezeit beim Schreiben zählen
CSV zu JSON
Tabellenkalkulations-Exporte zu JSON konvertieren
Zeichenzähler
Zeichen gegen Plattform-Limits zählen
Diff-Checker
Zwei Texte vergleichen und jeden Unterschied hervorheben
Lorem-Ipsum-Generator
Platzhaltertext in Absätzen, Sätzen oder Wörtern