Extraktor für externe Links

Füge rohes HTML ein und erhalte eine bereinigte Liste aller externen Links, die es enthält. Optional kannst du eine Basis-URL angeben, damit der Extraktor weiß, welcher Host als intern zählt; Links zu jedem anderen Host werden gemeldet. Nützlich bei der Überprüfung einer Website auf Linklecks, veraltete Partnerplatzierungen oder um sicherzustellen, dass ausgehende Links zu den Zielen führen, die deine Richtlinie vorsieht.

So extrahierst du externe Links

  1. 1

    Quelle bereitstellen

    Füge das rohe HTML der Seite ein. Gib optional eine Basis-URL an, damit der Extraktor weiß, welcher Host als intern zählt; lasse das Feld leer, um jeden Host als extern zu behandeln.

  2. 2

    Extraktion ausführen

    Jeder `<a href>` wird gelesen und nur absolute http/https-Links, deren Host vom Basis-Host abweicht, werden übernommen. Duplikate werden entfernt.

  3. 3

    Liste überprüfen

    Du erhältst eine externe URL pro Zeile, bereit zum Einfügen in eine Tabelle oder zur stichprobenartigen Prüfung einzelner Links.

  4. 4

    Ergebnis verwenden

    Kopiere die Liste in die Zwischenablage oder lasse die Seite offen, während du jedes Ziel in einem neuen Tab prüfst.

Was der Extraktor als extern betrachtet

Ein Link ist extern, wenn sein Host von der Basis-URL abweicht, die du angegeben hast (der Vergleich ist ohne Beachtung der Groß-/Kleinschreibung). Subdomains gelten als separate Hosts, blog.example.com zählt also als extern gegenüber www.example.com. Für Audits über alle Subdomains hinweg entferne die Subdomain aus deiner Basis-URL. Lasse die Basis-URL leer, um jeden http/https-Link als extern aufzulisten.

Der Extraktor meldet nur Ziel-URLs. Er liest weder Ankertext noch rel-Attribute; prüfe nofollow, ugc und sponsored daher direkt im Quell-HTML.

Was er ignoriert

  • mailto:-, tel:-, javascript:- und reine Fragment-#-hrefs.
  • Relative URLs und protokollrelative URLs wie //cdn.example.com (mache sie im eingefügten HTML zu absoluten URLs, wenn du sie mitzählen möchtest).
  • Ankertags ohne href (sie sind keine navigierbaren Links).

Tipps

  • Füge das gerenderte HTML ein, wenn die Seite JavaScript verwendet. Links, die ein Framework clientseitig erzeugt, erscheinen erst, wenn du das gerenderte DOM einfügst (zum Beispiel outerHTML aus den DevTools kopieren).
  • Achte auf Tracking-Wrapper. Affiliate-Weiterleitungen über /go/ oder /out/ können das echte Ziel verbergen; der Extraktor liefert die Wrapper-URL wie geschrieben, prüfe also das rohe href, wenn ein Ziel verdächtig aussieht.
  • Normalisiere vor dem Vergleich. Eine URL mit anderem Fragment oder Tracking-Parameter zählt als eigener Link; normalisiere URLs, bevor du zwei Läufe des Extraktors vergleichst.
  • Vergleiche über die Zeit. Führe den Extraktor monatlich aus und vergleiche die Listen; neue externe Links, die du nicht hinzugefügt hast, sind das erste Zeichen für ein kompromittiertes Theme oder Plugin.

Häufig gestellte Fragen

Es extrahiert das href genau so, wie es im HTML geschrieben ist. Jeder Weiterleitung zu folgen würde den Bericht dramatisch verlangsamen und kann Bot-Schutzmaßnahmen am Ziel auslösen; löse sie separat auf, wenn du die endgültige Ziel-URL benötigst.

Nein. Der Extraktor analysiert das HTML, wie es geliefert wird. Links, die ein Framework clientseitig rendert, erscheinen nur, wenn du das gerenderte DOM einfügst (zum Beispiel, indem du outerHTML aus den DevTools kopierst).

Es werden nur absolute http/https-URLs gemeldet. Protokollrelative URLs wie //cdn.example.com, relative Pfade sowie mailto:- oder tel:-Links werden übersprungen; mache sie im eingefügten HTML zu absoluten URLs, wenn du sie mitzählen möchtest.

Das eingefügte HTML wird nur an unseren Server gesendet, um die Extraktion im aktuellen Request auszuführen. Es wird weder in einer Datenbank noch in einem Log gespeichert, und nichts bleibt nach der Antwort an deinen Browser erhalten.

Verwandte Tools

Tool in anderen Sprachen verfügbar