Fuzzy-Listenabgleich
Die Abstimmung eines CRM-Exports mit einer Tabelle von Rechnungskunden oder das Abgleichen von Lieferantennamen aus zwei verschiedenen ERPs bricht fast immer bei kleinen Unterschieden, “Acme Corp.” vs “ACME Corporation” vs “acme corp”. Füge beide Listen ein, setze einen Ähnlichkeitsschwellenwert und das Tool schlägt den besten Kandidaten in Liste B für jeden Eintrag in Liste A vor und kennzeichnet die unter dem Schwellenwert für eine manuelle Überprüfung.
Wie man zwei unordentliche Listen abgleicht
-
1
Liste A einfügen
Ein Eintrag pro Zeile, Kundennamen, Produktcodes, Straßenadressen.
-
2
Liste B einfügen
Der Kandidatenpool. Unterschiede in Groß- und Kleinschreibung, Abständen und Tippfehlern sind in Ordnung.
-
3
Einen Schwellenwert festlegen
Ähnlichkeitsprozentsatz, ab dem eine Übereinstimmung akzeptiert wird (70% ist ein sinnvoller Standard).
-
4
Den Bericht lesen
Jeder A-Eintrag wird mit dem besten B-Kandidaten und einem Vertrauensscore gepaart. Einträge unter dem Schwellenwert sind zur Überprüfung markiert.
Wie Ähnlichkeit gemessen wird
Das Tool verwendet PHP’s similar_text (einen längsten gemeinsamen Teilfolgen-Score) und gibt das Ergebnis als Prozentsatz aus. Höher ist besser; eine exakte Übereinstimmung ist 100%.
| Schwellenwert | Verhalten |
|---|---|
| ≥ 95% | Nahezu identisch, nur Unterschiede in Groß- oder Kleinschreibung oder Leerzeichen |
| 80–94% | Tippfehler, fehlende Interpunktion, abgeschnittene Suffixe |
| 60–79% | Änderungen der Wortreihenfolge, Abkürzungen vs. vollständige Formen |
| < 60% | Wahrscheinlich keine echte Übereinstimmung, manuell überprüfen |
Tipps
- Zuerst normalisieren, wenn du den häufigen Lärm kennst: Kleinbuchstaben, Interpunktion entfernen, Leerzeichen zusammenfassen. Du erhältst genauere Werte.
- Unternehmenssuffixe entfernen (“Inc”, “Ltd”, “GmbH”), wenn sie in einer Liste inkonsistent erscheinen, aber nicht in der anderen.
- Lange Adressen aufteilen, das Abgleichen von “Straße + Stadt” separat ist besser als das Abgleichen einer zusammengefassten Zeile.
- Achte auf Eins-zu-viele. Das Tool wählt die beste B-Übereinstimmung pro A-Eintrag; es verhindert nicht, dass dasselbe B mehrere A-Zeilen abgleicht.
Wann man einen strengeren Algorithmus verwenden sollte
Für große Duplikationsarbeiten übertreffen Levenshtein-Distanz oder Jaro–Winkler similar_text, insbesondere bei Namen, bei denen die Zeichenposition wichtig ist. Wenn unscharfes Abgleichen die Abrechnung oder Zusammenführungen steuert, überprüfe 20 zufällige Paare, bevor du dem Output im großen Maßstab vertraust.
Häufig gestellte Fragen
70% erfasst die meisten legitimen Übereinstimmungen, während echte Ausreißer markiert werden. Ziehe auf 85% an, wenn Liste B sauber ist und du dir keine falschen Positiven leisten kannst; lockere auf 55%, wenn beide Listen unordentlich sind und du alles manuell überprüfen möchtest.
Ja, aber zuerst normalisieren, Leerzeichen, Bindestriche und Ländervorwahlen entfernen, E-Mails in Kleinbuchstaben umwandeln. Unscharfes Abgleichen von Rohwerten wird niedrige Werte für strukturell identische Einträge melden.
Intern wandelt das Tool beide Seiten in Kleinbuchstaben um, bevor es vergleicht, sodass “Apple” und “apple” 100% erzielen.
Ja, der Abgleich läuft serverseitig, deine beiden Listen werden also zum Vergleich an das Tool gesendet. Sie werden für diese eine Anfrage im Arbeitsspeicher verarbeitet und danach weder gespeichert noch protokolliert.
Verwandte Tools
ASCII-Tabelle Referenz
Vollständige ASCII-Tabelle von 0 bis 127 mit Dezimal-, Hex-, Oktal-, Binär- und numerischer HTML-Zeichenreferenz für jedes Zeichen, einschließlich Steuerzeichen wie NUL, LF und DEL.
HTML-Zeichenreferenz
Durchsuchbare Liste von HTML-Entitäten, ihren benannten und numerischen Codes sowie eine Ein-Klick-Kopie für Sonderzeichen und Symbole.
Farbrad-Explorer
Erforschen Sie das Farbrad interaktiv. Rotieren Sie Harmonien, vergleichen Sie HSL mit RYB, erkennen Sie komplementäre und triadische Paare in Echtzeit.
Referenz für Tastenkombinationen
Durchsuchen Sie dokumentierte Standardkürzel für VS Code, Chrome und Bash mit GNU Readline unter macOS, Windows und Linux.
Zufallsbuchstaben-Generator
Erzeugen Sie zufällige A-Z-Buchstaben. Wählen Sie Anzahl, Großschreibung, Kleinschreibung oder gemischte Schreibweise für Spiele, Aufgaben und Unterricht.
Telefonnummern prüfen
Prüfen Sie die Struktur von Telefonnummern nach Land und zeigen Sie Region, Typ sowie E.164-, internationale, nationale und RFC-3966-Formate an.
Tool in anderen Sprachen verfügbar
- Correspondência de Lista Difusa [PT]
- Bộ so khớp danh sách mờ [VI]
- ファジーリストマッチャー [JA]
- مطابق القوائم الضبابية [AR]
- Comparador de Listas Difusas [ES]
- 퍼지 목록 매처 [KO]
- Correspondance de listes floues [FR]
- Luddig listmatchare [SV]
- เครื่องจับคู่รายการแบบฟัซซี่ (Fuzzy List Matcher) [TH]
- Pembanding Daftar Fuzzy [ID]
- Fuzzy lijstmatcher [NL]
- Rozmyte dopasowywanie list [PL]
- Fuzzy List Matcher [EN]
- Corrispondente di Liste Fuzzy [IT]
- Метод сопоставления нечётких списков [RU]
- Bulanık Liste Eşleştirici [TR]
- 模糊列表匹配器 [ZH]