URLs aus Text extrahieren
Fügen Sie ein Chatprotokoll, ein Markdown-Dokument, einen E-Mail-Thread oder einen Roh-HTML-Dump ein und erhalten Sie eine saubere Liste mit allen enthaltenen http://- und https://-Links. Der Matcher entfernt nachgestellte Satzzeichen, erkennt Markdown- und HTML-Linksyntax und bereinigt exakte Duplikate, sodass Sie die Liste direkt an einen Crawler oder ein Archivierungstool weiterreichen können.
So extrahieren Sie URLs
-
1
Fügen Sie die Quelle ein
Fügen Sie den Text oder das HTML ein. Anführungszeichen, Winkelklammern, Markdown-Linksyntax und nachgestellte Satzzeichen werden automatisch behandelt.
-
2
Führen Sie den Scan aus
Jeder `http://`- und `https://`-Link wird erkannt, nachgestellte Satzzeichen werden entfernt und exakte Duplikate bereinigt.
-
3
Überprüfen Sie die Anzahl
Sie sehen, wie viele eindeutige URLs gefunden wurden und die vollständige Liste.
-
4
Kopieren oder exportieren
Eine URL pro Zeile, bereit für `curl -I`, einen Archivierer, einen Screenshot-Dienst oder Screaming-Frog-Seedlisten.
Was zählt als URL
Die URL-Erkennung ist schwieriger, als sie aussieht, und dieser Extraktor folgt bewusst einer sicheren Regel: Er erfasst ausschließlich vollständige http://- und https://-Links. Alles andere bleibt im Text stehen.
Erkannte Formen
| Form | Beispiel |
|---|---|
| Absolutes HTTPS | https://example.com/path?q=1 |
| Absolutes HTTP | http://example.com |
| Markdown-Linkziel | [text](https://example.com) |
| Absolutes href in HTML | href="https://example.com" |
Kürzungsregeln
Nachgestellte Satzzeichen werden entfernt, sodass (https://example.com). zu https://example.com wird. Leerzeichen, Anführungszeichen, Winkelklammern, Klammern, Kommas und Semikolons beenden einen Treffer. Eine URL mit Klammern wird an der ersten öffnenden Klammer abgeschnitten, ein Wikipedia-ähnlicher Titel wird also nur bis zur öffnenden Klammer erfasst.
Was übersprungen wird
mailto:,tel:,ftp:und jedes andere Schema, das nichthttpoderhttpsist.- Protokollrelative Links wie
//cdn.example.com/asset.js. - Nackte Domains und
www.-Präfixe ohne Schema, etwaexample.com/docs/introoderwww.example.com/page. - Nur-Anker-Fragmente wie
#sectionund JavaScript-Pseudo-URLs.
Wie Duplikate behandelt werden
Exakte Duplikate werden entfernt, https://example.com zählt also nur einmal, egal wie oft es vorkommt, während Example.com und example.com getrennte Einträge bleiben. Die Liste behält die Reihenfolge, in der jede URL zum ersten Mal auftaucht.
Tipps zur Nachbearbeitung
- Für kanonische Deduplizierung in Kleinschreibung umwandeln. Sollen
Example.comundexample.comals ein Host gelten, wandeln Sie die Ausgabe in Kleinschreibung um und entfernen Sie erneut Duplikate. - Tracking-Parameter entfernen mit einem UTM-Reiniger vor der Archivierung, sonst landen Sie bei Dutzenden von Fast-Duplikaten.
- Status prüfen. Lassen Sie die Liste durch einen Link-Checker laufen, um 404s zu entfernen, bevor Sie die Liste übernehmen.
Häufig gestellte Fragen
Nur wenn der Kurzlink mit vollständigem Schema geschrieben ist. bit.ly/xyz allein wird nicht erfasst, https://bit.ly/xyz dagegen als gewöhnliche URL. Der Extraktor folgt keiner Weiterleitung; lösen Sie sie separat auf, wenn Sie das endgültige Ziel benötigen.
Ja, wenn das href eine vollständige http://- oder https://-URL ist. Der Wert wird sauber ohne das umgebende Tag extrahiert; relative hrefs werden nicht erfasst.
Sie werden unverändert übernommen. Wenn Sie utm_* und ähnliche Tracking-Parameter entfernen möchten, nutzen Sie nach der Extraktion ein URL-Reinigungstool.
Nein. Der Text wird während der Anfrage verarbeitet und der Inhalt wird weder gespeichert noch protokolliert.
Verwandte Tools
Wortzähler
Zählen Sie Wörter, Zeichen, Sätze und Absätze mit Lesezeit, Sprechzeit, Keyword-Dichte und einem Flesch-Lesbarkeitswert für Essays, Beiträge, Bildunterschriften und Meta-Beschreibungen.
Benutzernamen-Generator
Erstelle Benutzernamen-Ideen aus einem Startwort, optional mit Zahlen und Trennzeichen. Praktisch für neue Konten, Gamer-Tags und Zweitprofile.
Pfeilsymbole zum Kopieren
Kopiere gängige Unicode-Pfeile mit einem Klick: gerade, doppelte, diagonale, hakenförmige, kreisförmige und dreieckige Pfeile für Dokumente, Chats und Designs.
Emoji Kitchen
Teste verifizierte Google-Emoji-Kitchen-Paare, lade PNG-Sticker herunter und nutze Vorschläge oder den externen Browser für weitere Kombinationen.
Kleiner-gleich-Zeichen
Kopiere das Zeichen ≤ und verwandte mathematische Vergleichszeichen. Enthält Unicode, HTML-Entitäten und LaTeX-Auszeichnung für Tabellenkalkulationen, wissenschaftliche Arbeiten und Webseiten.
Firmennamen-Generator
Erzeuge Firmennamen aus Branchen-Keywords und Stilrichtungen und prüfe anschließend Domains, Register und Markenrechte.
Tool in anderen Sprachen verfügbar
- Trích xuất URL từ văn bản [VI]
- Ekstrak URL dari Teks [ID]
- ดึง URL จากข้อความ [TH]
- Extrahera URL:er från text [SV]
- Extraer URLs del Texto [ES]
- URL's extraheren uit tekst [NL]
- 텍스트에서 URL을 추출합니다 [KO]
- Wydobywanie URL-ów z tekstu [PL]
- Metinden URL'leri Çıkarma [TR]
- استخراج عناوين URL من النص [AR]
- Extraire des URL du texte [FR]
- テキストからURL抽出 [JA]
- Extrair URLs do Texto [PT]
- 从文本中提取 URL [ZH]
- Extract URLs from Text [EN]
- Estrai URL dal testo [IT]
- Извлечение URL из текста [RU]