robots.txt einfach erklärt: Aufbau, Regeln und Beispiele

Lexikon · robots.txt
Technisches SEO

robots.txt: Aufbau, Regeln und Beispiele der Steuerdatei

⏱ 6 Min. Lesezeit📅 Stand: 11. August 2026✓ Geprüft von Engin Buldak
Definition in 40 Wörtern

Die robots.txt ist eine Textdatei im Hauptverzeichnis einer Website, die Crawlern mitteilt, welche Bereiche sie abrufen dürfen. Sie steuert das Crawling, nicht die Indexierung, und wirkt als Empfehlung: Seriöse Bots halten sich daran, verpflichtet sind sie nicht.

Was ist die robots.txt?

Die robots.txt ist die erste Datei, die ein Crawler beim Besuch einer Website abruft. Sie liegt immer im Hauptverzeichnis, also unter deine-domain.de/robots.txt, und legt fest, welche Bereiche der Website gecrawlt werden dürfen und welche nicht.

Technisch basiert sie auf dem Robots Exclusion Protocol, das seit 2022 als offizieller Internet-Standard (RFC 9309) festgeschrieben ist. Jede Domain und jede Subdomain braucht ihre eigene robots.txt.

Die wichtigste Eigenschaft zum Verständnis: Die robots.txt ist eine Hausordnung, kein Türschloss. Google, Bing und die großen KI-Anbieter halten sich daran, aggressive Scraper ignorieren sie. Und sie regelt nur das Crawling: Ob eine Seite im Google-Index landet, ist eine separate Entscheidung.

Wie ist eine robots.txt aufgebaut?

Eine robots.txt besteht aus Regelgruppen: Jede Gruppe beginnt mit User-agent (für wen die Regeln gelten), gefolgt von Disallow (verboten) und Allow (erlaubt). Dazu kommt die Sitemap-Zeile als Wegweiser zur XML-Sitemap. Mehr braucht eine saubere Datei nicht.

So sieht der bewährte Standard für eine WordPress-Website aus:

# robots.txt Beispiel WordPress User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Sitemap: https://deine-domain.de/sitemap_index.xml

Der Stern bei User-agent bedeutet: Diese Regeln gelten für alle Crawler. Bei widersprüchlichen Regeln gewinnt die spezifischere (längere) Regel, bei Gleichstand die Erlaubnis. Die Direktive Crawl-delay ignoriert Google übrigens komplett, sie stammt aus einer anderen Zeit.

Welche Regeln brauchst du für KI-Crawler?

2026 entscheidet die robots.txt auch über deine Sichtbarkeit in KI-Antworten. Die Kernregel: Such-Crawler wie OAI-SearchBot und PerplexityBot immer erlauben, denn sie holen Inhalte für konkrete Kundenfragen. Nur reine Trainings-Crawler lassen sich separat steuern, ohne Sichtbarkeit zu verlieren.

KI-Anbieter trennen ihre Crawler sauber nach Zweck. Wer möchte, kann das Modelltraining einschränken und trotzdem in den KI-Suchergebnissen auftauchen:

# KI-Suche erlauben (empfohlen) User-agent: OAI-SearchBot Allow: / User-agent: PerplexityBot Allow: / # Nur Modelltraining einschraenken (optional) User-agent: GPTBot Disallow: /

Wichtig zur Einordnung: Google-Extended steuert ausschließlich das Gemini-Training, nicht die Google-Suche und nicht die AI Overviews. Und wer alle KI-Crawler pauschal sperrt, existiert für ChatGPT, Perplexity und Co. schlicht nicht. Unsere Empfehlung für Unternehmen ist deshalb klar: Such-Crawler offen lassen, das ist die Eintrittskarte in die Generative Engine Optimization (GEO).

Kostenfrei von DTILE
Sperrt deine robots.txt heimlich Sichtbarkeit aus?

Die DTILE Potenzialanalyse prüft mit echten Daten, ob Google und KI-Systeme deine Website vollständig lesen können und welches Potenzial dahinter wartet.

Kostenfreie Potenzialanalyse

Welche Fehler machen die robots.txt gefährlich?

Die robots.txt ist die kleinste Datei mit der größten Zerstörungskraft im SEO: Eine einzige falsche Zeile kann die komplette Website aus Suche und KI-Antworten nehmen. Fünf Fehler tauchen in der Praxis immer wieder auf.

🚫
Die Vollsperre: Disallow: /
Meist ein Überbleibsel aus der Entwicklungsphase. Die Zeile sperrt die gesamte Website für alle Crawler und überlebt Relaunches erschreckend oft unbemerkt.
🎨
CSS und JavaScript blockieren
Google rendert Seiten wie ein Browser. Sind Design- und Skript-Dateien gesperrt, sieht der Googlebot eine kaputte Seite und bewertet sie entsprechend.
🔀
robots.txt als noindex missbrauchen
Eine gesperrte URL kann über externe Links trotzdem im Index landen, dann ohne Inhalt. Schlimmer noch: Ein noindex auf der Seite wird nie gelesen, wenn das Crawling gesperrt ist.
🛡️
CDN oder Server liefert eine andere Datei aus
Firewalls, CDNs und physische Dateien auf dem Server können die Version deines SEO-Plugins überschreiben. Was im WordPress-Backend steht, ist dann nicht das, was Crawler sehen.
🔤
Pfad-Fehler
Die robots.txt unterscheidet Groß- und Kleinschreibung. /Blog/ und /blog/ sind zwei verschiedene Pfade, ein Tippfehler sperrt schnell das Falsche oder gar nichts.

Wie teuer die Kombination aus Fehler 1 und 4 ist, wissen wir aus eigener Erfahrung: Auf unserer eigenen Website steckte eine Staging-Vollsperre in einer physischen Datei, während das CDN zusätzlich eine eigene Version mit KI-Crawler-Blockaden auslieferte. Google rankte nur dank einer Konfliktregel weiter, alle anderen Crawler lasen monatelang die Vollsperre. Erst der direkte Abruf der Live-Datei deckte das auf.

Wie prüfst und testest du deine robots.txt?

Rufe die Datei direkt im Browser unter deine-domain.de/robots.txt auf, denn nur diese Live-Version zählt. Den Rest übernimmt die Google Search Console: Der robots.txt-Bericht in den Einstellungen zeigt die zuletzt gelesene Version, die URL-Prüfung testet einzelne Seiten.

1
Live-Abruf: deine-domain.de/robots.txt im Browser öffnen, am besten im Inkognito-Modus. Steht dort etwas anderes als in deinem SEO-Plugin, liefert Server oder CDN eine eigene Version aus.
2
Search Console: Unter Einstellungen zeigt der robots.txt-Bericht, welche Version Google zuletzt gelesen hat und ob Fehler auftraten.
3
Einzelne URLs testen: Die URL-Prüfung der Search Console verrät pro Seite, ob das Crawling erlaubt ist.
4
Nach Änderungen Geduld: Crawler cachen die robots.txt bis zu 24 Stunden. In WordPress gilt zudem: Physische Dateien auf dem Server haben Vorrang vor der virtuellen Version von Rank Math oder Yoast.

Welche Begriffe gehören zur robots.txt dazu?

Häufige Fragen zur robots.txt

Wo liegt die robots.txt?
Immer im Hauptverzeichnis der Domain, erreichbar unter deine-domain.de/robots.txt. Jede Subdomain braucht eine eigene Datei, ein anderer Speicherort wird von Crawlern nicht gefunden.
Ist eine robots.txt Pflicht?
Nein. Fehlt die Datei, dürfen Crawler die gesamte Website besuchen. Empfehlenswert ist sie trotzdem: für den Sitemap-Verweis, das Aussperren technischer Bereiche und die gezielte Steuerung von KI-Crawlern.
Kann ich mit der robots.txt eine Seite aus Google entfernen?
Nein, das ist das falsche Werkzeug. Zum Entfernen dienen ein noindex auf der Seite oder das Entfernen-Tool der Search Console. Eine robots.txt-Sperre kann das Problem sogar verschärfen, weil Google das noindex einer gesperrten Seite nie zu lesen bekommt.
Wie bearbeite ich die robots.txt in WordPress?
Am einfachsten über das SEO-Plugin: Rank Math und Yoast erzeugen eine virtuelle robots.txt, die sich im Backend bearbeiten lässt. Achtung: Eine physische Datei auf dem Server oder Regeln im CDN überschreiben diese Version. Der Live-Abruf im Browser zeigt, was wirklich ausgeliefert wird.
Halten sich alle Crawler an die robots.txt?
Die seriösen ja: Google, Bing und die großen KI-Anbieter respektieren die Regeln. Aggressive Scraper und Spam-Bots ignorieren sie, gegen diese helfen nur serverseitige Sperren über Firewall oder CDN.
Engin Buldak · Local-SEO- und GEO-Spezialist aus Hamburg-Uhlenhorst
Engin Buldak
Geschäftsführer DTILE GmbH · Local SEO und GEO

Engin Buldak betreut mit der DTILE GmbH aus Hamburg über 220 Unternehmen im DACH-Raum bei Local SEO, SEO und der Sichtbarkeit in KI-Antwortsystemen.

Kleine Datei, große Wirkung

DTILE stellt sicher, dass deine technische Basis Sichtbarkeit ermöglicht statt sie zu blockieren: in Google, im Local Pack und in KI-Antworten.

Unverbindliche Beratung