Telefonnummern aus Text extrahieren

Fügen Sie jeden Text ein, der Prosa, Signaturen oder gescraptes HTML mischt, und ziehen Sie jede Telefonnummer heraus, die er enthält. Der Extraktor erkennt nordamerikanische (xxx) xxx-xxxx, europäische, durch Leerzeichen getrennte Formen, kompakte internationale +CC... und die lockeren Stile, die Menschen in E-Mails eingeben (555.123.4567, +44 20 7946 0958). Die Ausgabe wird in der Form zurückgegeben, in der sie gefunden wurde, sodass Sie später gegen eine Bibliothek wie libphonenumber normalisieren können.

So extrahieren Sie Telefonnummern

  1. 1

    Fügen Sie die Quelle ein

    Fügen Sie den Text ein: Kontaktseiten, E-Mail-Signaturen, CSV-Exporte, Chatprotokolle.

  2. 2

    Führen Sie den Scan aus

    Der Regex durchläuft den Text auf der Suche nach Ziffernfolgen mit mindestens 7 Ziffern plus erkennbaren Trennzeichen oder Ländervorwahlen.

  3. 3

    Überprüfen Sie die Übereinstimmungen

    Die Ergebnisse zeigen einen Kandidaten pro Zeile, Duplikate werden automatisch entfernt. Prüfen Sie die Liste auf falsche Treffer (Bestellnummern, Daten) und korrigieren Sie den Quelltext, wenn etwas hineingerutscht ist.

  4. 4

    Kopieren oder exportieren

    Holen Sie sich die saubere Liste als einfachen Text, eine Nummer pro Zeile, bereit für Ihr CRM oder Wählgerät.

Erkannte Telefonnummernformen

Telefonnummern sind unordentlich, da jedes Land seine eigene Konvention hat und die Menschen die Regeln sowieso ignorieren. Der Extraktor zielt auf die praktischen Formen ab, die Sie in echtem Text sehen.

Akzeptierte Formate (Beispiel)

Format Beispiel Hinweise
E.164 +14155552671 Goldstandard; verwenden Sie dies für die Speicherung.
International mit Leerzeichen +44 20 7946 0958 UK-Festnetz mit durch Leerzeichen getrennten Gruppen.
Nordamerikanisches NANP (415) 555-2671 Klammern um die Vorwahl.
Nordamerikanisch mit Punkten 415.555.2671 Häufig in E-Mail-Signaturen.
Europäisch lokal 020 7946 0958 Inlandsvorwahl mit führender Null.
Mexikanisch 10-stellig 55 1234 5678 Keine Ländervorwahl.

Falsche Positivmeldungen, auf die Sie achten sollten

  • Bestell- und Trackingnummern. Eine 13-stellige FedEx-Trackingnummer kann wie eine Telefonnummer aussehen, wenn sie mit Leerzeichen geschrieben wird. Überprüfen Sie den umgebenden Kontext.
  • Daten. 2024 09 15 kann je nach Regex-Modus mit einem 7+ Ziffern-Muster übereinstimmen. Filtern Sie zuerst Daten, wenn Ihre Quelle datenschwer ist.
  • Kreditkartennummern. 16-stellige Gruppen im Format 4xxx xxxx xxxx xxxx können übereinstimmen. Schwärzen Sie PCI-Daten vor der Extraktion.

Tipp: Normalisieren Sie, bevor Sie speichern

Unterschiedliche Eingaben für dieselbe echte Nummer sind die Wurzel des CRM-Duplikationsproblems. Ein schneller Durchlauf mit einer Bibliothek, die die Ländervorschriften versteht (libphonenumber, phonenumbers in Python, laravel-phone in PHP), konvertiert alles in E.164, das einzige Format, das Sie in einer Datenbank behalten sollten.

Häufig gestellte Fragen

Der Extraktor gibt die rohe Übereinstimmung zurück; die Länderzuordnung erfordert ein Datenpaket mit Wählcodes und Längenregeln. Wenn Sie nur an dem +CC-Präfix interessiert sind, wird dieser Teil unverändert in der Ausgabe beibehalten.

Der Extraktor gibt nur die Hauptnummer zurück; eine Durchwahl wie 555-2671 ext. 123 ist nicht Teil der Übereinstimmung. Für strikte E.164-Speicherung trennen Sie alles nach ext, x oder # in ein separates Feld.

Ja, US-gebührenfreie Nummern (800, 888, 877, 866, 855, 844, 833) entsprechen dem normalen NANP-Muster. UK 0800 und ähnliche lokale gebührenfreie Formen kommen ebenfalls durch, da sie wie reguläre Festnetznummern aussehen.

Es wird keine Kopie Ihrer Eingabe aufbewahrt, sobald die Antwort zur Extraktion zurückgesendet wird; die Verarbeitung erfolgt im Speicher innerhalb der Anfrage.

Verwandte Tools

Tool in anderen Sprachen verfügbar