URLs aus Text extrahieren

Fügen Sie ein Chatprotokoll, ein Markdown-Dokument, einen E-Mail-Thread oder einen Roh-HTML-Dump ein und erhalten Sie eine saubere Liste mit allen enthaltenen http://- und https://-Links. Der Matcher entfernt nachgestellte Satzzeichen, erkennt Markdown- und HTML-Linksyntax und bereinigt exakte Duplikate, sodass Sie die Liste direkt an einen Crawler oder ein Archivierungstool weiterreichen können.

So extrahieren Sie URLs

  1. 1

    Fügen Sie die Quelle ein

    Fügen Sie den Text oder das HTML ein. Anführungszeichen, Winkelklammern, Markdown-Linksyntax und nachgestellte Satzzeichen werden automatisch behandelt.

  2. 2

    Führen Sie den Scan aus

    Jeder `http://`- und `https://`-Link wird erkannt, nachgestellte Satzzeichen werden entfernt und exakte Duplikate bereinigt.

  3. 3

    Überprüfen Sie die Anzahl

    Sie sehen, wie viele eindeutige URLs gefunden wurden und die vollständige Liste.

  4. 4

    Kopieren oder exportieren

    Eine URL pro Zeile, bereit für `curl -I`, einen Archivierer, einen Screenshot-Dienst oder Screaming-Frog-Seedlisten.

Was zählt als URL

Die URL-Erkennung ist schwieriger, als sie aussieht, und dieser Extraktor folgt bewusst einer sicheren Regel: Er erfasst ausschließlich vollständige http://- und https://-Links. Alles andere bleibt im Text stehen.

Erkannte Formen

Form Beispiel
Absolutes HTTPS https://example.com/path?q=1
Absolutes HTTP http://example.com
Markdown-Linkziel [text](https://example.com)
Absolutes href in HTML href="https://example.com"

Kürzungsregeln

Nachgestellte Satzzeichen werden entfernt, sodass (https://example.com). zu https://example.com wird. Leerzeichen, Anführungszeichen, Winkelklammern, Klammern, Kommas und Semikolons beenden einen Treffer. Eine URL mit Klammern wird an der ersten öffnenden Klammer abgeschnitten, ein Wikipedia-ähnlicher Titel wird also nur bis zur öffnenden Klammer erfasst.

Was übersprungen wird

  • mailto:, tel:, ftp: und jedes andere Schema, das nicht http oder https ist.
  • Protokollrelative Links wie //cdn.example.com/asset.js.
  • Nackte Domains und www.-Präfixe ohne Schema, etwa example.com/docs/intro oder www.example.com/page.
  • Nur-Anker-Fragmente wie #section und JavaScript-Pseudo-URLs.

Wie Duplikate behandelt werden

Exakte Duplikate werden entfernt, https://example.com zählt also nur einmal, egal wie oft es vorkommt, während Example.com und example.com getrennte Einträge bleiben. Die Liste behält die Reihenfolge, in der jede URL zum ersten Mal auftaucht.

Tipps zur Nachbearbeitung

  • Für kanonische Deduplizierung in Kleinschreibung umwandeln. Sollen Example.com und example.com als ein Host gelten, wandeln Sie die Ausgabe in Kleinschreibung um und entfernen Sie erneut Duplikate.
  • Tracking-Parameter entfernen mit einem UTM-Reiniger vor der Archivierung, sonst landen Sie bei Dutzenden von Fast-Duplikaten.
  • Status prüfen. Lassen Sie die Liste durch einen Link-Checker laufen, um 404s zu entfernen, bevor Sie die Liste übernehmen.

Häufig gestellte Fragen

Nur wenn der Kurzlink mit vollständigem Schema geschrieben ist. bit.ly/xyz allein wird nicht erfasst, https://bit.ly/xyz dagegen als gewöhnliche URL. Der Extraktor folgt keiner Weiterleitung; lösen Sie sie separat auf, wenn Sie das endgültige Ziel benötigen.

Ja, wenn das href eine vollständige http://- oder https://-URL ist. Der Wert wird sauber ohne das umgebende Tag extrahiert; relative hrefs werden nicht erfasst.

Sie werden unverändert übernommen. Wenn Sie utm_* und ähnliche Tracking-Parameter entfernen möchten, nutzen Sie nach der Extraktion ein URL-Reinigungstool.

Nein. Der Text wird während der Anfrage verarbeitet und der Inhalt wird weder gespeichert noch protokolliert.

Verwandte Tools

Tool in anderen Sprachen verfügbar