Robots.txt-Generator

Legen Sie den Crawler fest, den Sie ansprechen, listen Sie die zu blockierenden und die zu erlaubenden Pfade auf, fügen Sie ein optionales Crawl-delay hinzu und verweisen Sie auf Ihre Sitemap, und der Generator setzt eine korrekt formatierte robots.txt zusammen, die Sie kopieren und bereitstellen können. Er kümmert sich um das genaue Zeilenformat und die Zeichensetzung, damit Sie sich weder die Syntax noch die Schreibweise der User-Agents merken müssen.

So generieren Sie die Datei

  1. 1

    Legen Sie den User-Agent fest

    Geben Sie den Crawler ein, für den die Regeln gelten, oder lassen Sie * stehen, um alle Bots anzusprechen.

  2. 2

    Listen Sie die zu blockierenden Pfade auf

    Fügen Sie die zu blockierenden Verzeichnisse oder Pfade hinzu, einen pro Zeile, zum Beispiel /admin/ oder /checkout/.

  3. 3

    Listen Sie die zu erlaubenden Pfade auf

    Fügen Sie Pfade hinzu, die crawlbar bleiben sollen, einen pro Zeile, um Ausnahmen aus einem umfassenderen Disallow herauszunehmen.

  4. 4

    Fügen Sie Sitemap und Crawl-delay hinzu

    Deklarieren Sie Ihre Sitemap-URL und bei Bedarf ein Crawl-delay in Sekunden.

  5. 5

    Kopieren und bereitstellen

    Kopieren Sie die generierte Datei und legen Sie sie unter https://ihredomain.com/robots.txt ab, im Root-Verzeichnis, nicht in einem Unterverzeichnis.

Typische Starter-Vorlagen

Alles erlauben (die meisten Seiten):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

Staging / Admin blockieren:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

KI-Trainingscrawler blockieren, Suchmaschinen erlauben:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

Benutzeragenten, die man kennen sollte

Benutzeragent Eigentümer Zweck
Googlebot Google Search Web-Indexierung
Googlebot-Image Google Bildersuche
Google-Extended Google Bard/Gemini-Training (Opt-out)
Bingbot Microsoft Bing-Suche
DuckDuckBot DuckDuckGo DDG-Suche
GPTBot OpenAI ChatGPT / Training (Opt-out)
ClaudeBot Anthropic Claude-Training (Opt-out)
CCBot Common Crawl Korpus, der von vielen LLMs verwendet wird
AhrefsBot Ahrefs SEO-Backlink-Index
SemrushBot Semrush SEO-Forschung
MJ12bot Majestic SEO-Forschung

KI-Trainingsbots sind konventionell opt-out, keine gesetzliche Anforderung; gutgläubige Betreiber respektieren die Richtlinien, weniger skrupellose ignorieren sie.

Regeln zur Pfadübereinstimmung

  • Pfade sind relativ zum Domain-Root und beginnen mit /.
  • * entspricht beliebigen Zeichen. Disallow: /*.pdf$ blockiert alle PDFs.
  • $ verankert am Ende der URL. Disallow: /*/trash$ blockiert /foo/trash, aber nicht /foo/trashes/....
  • Längste Übereinstimmung gewinnt. Allow: /admin/public/ überschreibt Disallow: /admin/ für diesen Unterpfad.
  • Pfade sind groß-/kleinschreibungssensitiv.

Dinge, die robots.txt nicht tun kann

  • Eine Seite von Google entfernen. Verwenden Sie ein noindex-Meta-Tag auf der Seite selbst.
  • Eine URL vor Menschen schützen. robots.txt ist öffentlich und nur Vorschläge für konforme Bots.
  • Googlebot drosseln. Crawl-delay wird von Google ignoriert; verwenden Sie die Search Console.
  • Bots blockieren, die robots.txt ignorieren. Spam-Scraper lesen die Datei nicht.

Bereitstellungs-Checkliste

  1. Platzieren Sie es unter https://yourdomain.com/robots.txt, nur im Root-Verzeichnis.
  2. Bereitstellen mit Content-Type: text/plain (die meisten Server tun dies automatisch).
  3. Größe: unter 500 KB. Google kürzt größere Dateien.
  4. Überprüfen Sie nach der Bereitstellung die abgerufene Datei im robots.txt-Tester der Google Search Console.
  5. Beachten Sie beim Entfernen eines Disallow, dass das Unindexieren Wochen dauern kann.

Häufig gestellte Fragen

Nicht unbedingt. Ohne eine wird davon ausgegangen, dass Crawler “alles erlauben”. Wenn Sie etwas blockieren möchten, Staging, Admin, Checkout, interne Suche, benötigen Sie eine.

Sie können sie über Benutzeragenten-Blockierungen wie GPTBot, ClaudeBot, CCBot und Google-Extended bitten, aufzuhören. Große Betreiber respektieren diese; weniger skrupellose Scraper ignorieren sie vollständig.

Crawler sind nachsichtig, unbekannte Anweisungen werden ignoriert. Schwerwiegende Fehler (HTTP 404 oder 500) werden als “alles erlauben” behandelt. Validieren Sie die Datei vor dem Versand.

An die Wurzel jedes Hosts, den Sie abdecken möchten, https://www.example.com/robots.txt und https://example.com/robots.txt sind separate Dateien für separate Hosts.

Nein. Die eingegebenen Pfade werden nur zum Zusammensetzen der Datei verwendet und weder gespeichert noch protokolliert.

Verwandte Tools

Tool in anderen Sprachen verfügbar