E-Mails aus Text extrahieren

Fügen Sie einen Dump von Nachrichten, eine CSV-Spalte, einen Forumsthread oder einen Abschnitt von HTML ein, und der Extraktor zieht jede E-Mail-Adresse heraus, die er erkennen kann. Die Ausgabe ist dedupliziert und bereit, in Ihren CRM-Import oder ein Bounce-Check-Tool eingefügt zu werden. Die Übereinstimmung deckt die reale Teilmenge von RFC 5322 ab (Plus-Adressierung, Punkte im lokalen Teil, Bindestriche in der Domain) ohne die Fehlalarme, die einfache a@b Regexe erzeugen.

So extrahieren Sie E-Mails aus Text

  1. 1

    Fügen Sie Ihre Quelle ein

    Fügen Sie freien Text, Protokolle, eine HTML-Seite oder eine exportierte Kontaktliste ein, alles, was `local@domain.tld`-Muster enthält.

  2. 2

    Führen Sie den Extraktor aus

    Der Regex scannt nach vollständigen Adressen und ignoriert die Satzzeichen um sie herum.

  3. 3

    Überprüfen Sie die Anzahl

    Sie erhalten die Anzahl der gefundenen einzigartigen Adressen sowie die vollständige Liste.

  4. 4

    Liste kopieren

    In die Zwischenablage als durch Zeilenumbrüche getrennte Liste kopieren oder direkt in eine Spaltenzelle eines Tabellenkalkulationsprogramms einfügen.

Was als gültige E-Mail zählt

Der Extraktor folgt der praktischen E-Mail-Form anstelle der vollständigen RFC 5322-Grammatik, da die vollständige Grammatik Adressen zulässt, die kein moderner MTA akzeptieren wird (zitiert lokale Teile mit Leerzeichen, Kommentare in Klammern). Hier ist, was der Matcher abdeckt:

Muster-Element Akzeptiert Abgelehnt
Lokaler Teil a-z 0-9 . _ % + - Leerzeichen, zitierte Strings, spitze Klammern
Domain a-z 0-9 . - abschließender Punkt, Unterstrich im Label
TLD 2+ ASCII-Buchstaben nur numerische TLD

Häufige schmutzige Eingaben, die er verarbeitet

  • Adressen, die in Sätzen von . oder , gefolgt werden, die Interpunktion wird nicht erfasst.
  • E-Mails innerhalb von mailto: hrefs, das Schema wird automatisch entfernt.
  • HTML-Entitäten wie @ werden nicht dekodiert, daher wird eine Adresse wie info@example.com nicht erkannt.
  • Adressen, die in <spitzen Klammern> aus E-Mail-Headern gewickelt sind.

Was mit der Ausgabe zu tun ist

  • Lieferbarkeitsprüfung. Führen Sie die Liste durch einen Bounce-Check-Dienst, bevor Sie importieren, geerntete Listen haben oft ~10% tote Adressen.
  • Zustimmung. Nur weil eine Adresse in einem Dokument erscheint, bedeutet das nicht, dass die Person zugestimmt hat, kontaktiert zu werden. Überprüfen Sie die DSGVO oder lokale Gesetze vor der Kontaktaufnahme.
  • Auch im lokalen Teil deduplizieren. john@gmail.com und j.ohn@gmail.com erreichen dasselbe Postfach bei Gmail; normalisieren Sie Punkte, wenn Sie wirklich einzigartige Identitäten benötigen.

Häufig gestellte Fragen

Nein. Der Extraktor zielt auf echte, parsebare Adressen ab. Entwirren Sie obfuskierte Formen zuerst oder verarbeiten Sie den Text vor, um [at] durch @ und [dot] durch . zu ersetzen.

Nein. Die Erkennung liest nur grundlegende lateinische Buchstaben, daher wird müller@straße.de nicht erkannt. Konvertieren Sie die Adresse vorher in die ASCII-Punycode-Form, zum Beispiel user@xn--strae-oqa.de.

Nein, es gibt keine Option zum Behalten von Duplikaten. Die Ausgabe ist dedupliziert und behält die Reihenfolge des ersten Vorkommens. Wenn Sie Erwähnungen zählen möchten, zählen Sie sie im Quelltext.

Nein. Der Text wird für Ihre Anfrage verarbeitet und weder in einer Datenbank gespeichert, noch protokolliert oder zum Seitenlink hinzugefügt.

Verwandte Tools

Tool in anderen Sprachen verfügbar