Fuzzy-Listenabgleich

Die Abstimmung eines CRM-Exports mit einer Tabelle von Rechnungskunden oder das Abgleichen von Lieferantennamen aus zwei verschiedenen ERPs bricht fast immer bei kleinen Unterschieden, “Acme Corp.” vs “ACME Corporation” vs “acme corp”. Füge beide Listen ein, setze einen Ähnlichkeitsschwellenwert und das Tool schlägt den besten Kandidaten in Liste B für jeden Eintrag in Liste A vor und kennzeichnet die unter dem Schwellenwert für eine manuelle Überprüfung.

Wie man zwei unordentliche Listen abgleicht

  1. 1

    Liste A einfügen

    Ein Eintrag pro Zeile, Kundennamen, Produktcodes, Straßenadressen.

  2. 2

    Liste B einfügen

    Der Kandidatenpool. Unterschiede in Groß- und Kleinschreibung, Abständen und Tippfehlern sind in Ordnung.

  3. 3

    Einen Schwellenwert festlegen

    Ähnlichkeitsprozentsatz, ab dem eine Übereinstimmung akzeptiert wird (70% ist ein sinnvoller Standard).

  4. 4

    Den Bericht lesen

    Jeder A-Eintrag wird mit dem besten B-Kandidaten und einem Vertrauensscore gepaart. Einträge unter dem Schwellenwert sind zur Überprüfung markiert.

Wie Ähnlichkeit gemessen wird

Das Tool verwendet PHP’s similar_text (einen längsten gemeinsamen Teilfolgen-Score) und gibt das Ergebnis als Prozentsatz aus. Höher ist besser; eine exakte Übereinstimmung ist 100%.

Schwellenwert Verhalten
≥ 95% Nahezu identisch, nur Unterschiede in Groß- oder Kleinschreibung oder Leerzeichen
80–94% Tippfehler, fehlende Interpunktion, abgeschnittene Suffixe
60–79% Änderungen der Wortreihenfolge, Abkürzungen vs. vollständige Formen
< 60% Wahrscheinlich keine echte Übereinstimmung, manuell überprüfen

Tipps

  • Zuerst normalisieren, wenn du den häufigen Lärm kennst: Kleinbuchstaben, Interpunktion entfernen, Leerzeichen zusammenfassen. Du erhältst genauere Werte.
  • Unternehmenssuffixe entfernen (“Inc”, “Ltd”, “GmbH”), wenn sie in einer Liste inkonsistent erscheinen, aber nicht in der anderen.
  • Lange Adressen aufteilen, das Abgleichen von “Straße + Stadt” separat ist besser als das Abgleichen einer zusammengefassten Zeile.
  • Achte auf Eins-zu-viele. Das Tool wählt die beste B-Übereinstimmung pro A-Eintrag; es verhindert nicht, dass dasselbe B mehrere A-Zeilen abgleicht.

Wann man einen strengeren Algorithmus verwenden sollte

Für große Duplikationsarbeiten übertreffen Levenshtein-Distanz oder Jaro–Winkler similar_text, insbesondere bei Namen, bei denen die Zeichenposition wichtig ist. Wenn unscharfes Abgleichen die Abrechnung oder Zusammenführungen steuert, überprüfe 20 zufällige Paare, bevor du dem Output im großen Maßstab vertraust.

Häufig gestellte Fragen

70% erfasst die meisten legitimen Übereinstimmungen, während echte Ausreißer markiert werden. Ziehe auf 85% an, wenn Liste B sauber ist und du dir keine falschen Positiven leisten kannst; lockere auf 55%, wenn beide Listen unordentlich sind und du alles manuell überprüfen möchtest.

Ja, aber zuerst normalisieren, Leerzeichen, Bindestriche und Ländervorwahlen entfernen, E-Mails in Kleinbuchstaben umwandeln. Unscharfes Abgleichen von Rohwerten wird niedrige Werte für strukturell identische Einträge melden.

Intern wandelt das Tool beide Seiten in Kleinbuchstaben um, bevor es vergleicht, sodass “Apple” und “apple” 100% erzielen.

Ja, der Abgleich läuft serverseitig, deine beiden Listen werden also zum Vergleich an das Tool gesendet. Sie werden für diese eine Anfrage im Arbeitsspeicher verarbeitet und danach weder gespeichert noch protokolliert.

Verwandte Tools

Tool in anderen Sprachen verfügbar