robots.txt: Aufbau, Regeln und Beispiele der Steuerdatei
Die robots.txt ist eine Textdatei im Hauptverzeichnis einer Website, die Crawlern mitteilt, welche Bereiche sie abrufen dürfen. Sie steuert das Crawling, nicht die Indexierung, und wirkt als Empfehlung: Seriöse Bots halten sich daran, verpflichtet sind sie nicht.
Was ist die robots.txt?
Die robots.txt ist die erste Datei, die ein Crawler beim Besuch einer Website abruft. Sie liegt immer im Hauptverzeichnis, also unter deine-domain.de/robots.txt, und legt fest, welche Bereiche der Website gecrawlt werden dürfen und welche nicht.
Technisch basiert sie auf dem Robots Exclusion Protocol, das seit 2022 als offizieller Internet-Standard (RFC 9309) festgeschrieben ist. Jede Domain und jede Subdomain braucht ihre eigene robots.txt.
Die wichtigste Eigenschaft zum Verständnis: Die robots.txt ist eine Hausordnung, kein Türschloss. Google, Bing und die großen KI-Anbieter halten sich daran, aggressive Scraper ignorieren sie. Und sie regelt nur das Crawling: Ob eine Seite im Google-Index landet, ist eine separate Entscheidung.
Wie ist eine robots.txt aufgebaut?
Eine robots.txt besteht aus Regelgruppen: Jede Gruppe beginnt mit User-agent (für wen die Regeln gelten), gefolgt von Disallow (verboten) und Allow (erlaubt). Dazu kommt die Sitemap-Zeile als Wegweiser zur XML-Sitemap. Mehr braucht eine saubere Datei nicht.
So sieht der bewährte Standard für eine WordPress-Website aus:
Der Stern bei User-agent bedeutet: Diese Regeln gelten für alle Crawler. Bei widersprüchlichen Regeln gewinnt die spezifischere (längere) Regel, bei Gleichstand die Erlaubnis. Die Direktive Crawl-delay ignoriert Google übrigens komplett, sie stammt aus einer anderen Zeit.
Welche Regeln brauchst du für KI-Crawler?
2026 entscheidet die robots.txt auch über deine Sichtbarkeit in KI-Antworten. Die Kernregel: Such-Crawler wie OAI-SearchBot und PerplexityBot immer erlauben, denn sie holen Inhalte für konkrete Kundenfragen. Nur reine Trainings-Crawler lassen sich separat steuern, ohne Sichtbarkeit zu verlieren.
KI-Anbieter trennen ihre Crawler sauber nach Zweck. Wer möchte, kann das Modelltraining einschränken und trotzdem in den KI-Suchergebnissen auftauchen:
Wichtig zur Einordnung: Google-Extended steuert ausschließlich das Gemini-Training, nicht die Google-Suche und nicht die AI Overviews. Und wer alle KI-Crawler pauschal sperrt, existiert für ChatGPT, Perplexity und Co. schlicht nicht. Unsere Empfehlung für Unternehmen ist deshalb klar: Such-Crawler offen lassen, das ist die Eintrittskarte in die Generative Engine Optimization (GEO).
Die DTILE Potenzialanalyse prüft mit echten Daten, ob Google und KI-Systeme deine Website vollständig lesen können und welches Potenzial dahinter wartet.
Kostenfreie PotenzialanalyseWelche Fehler machen die robots.txt gefährlich?
Die robots.txt ist die kleinste Datei mit der größten Zerstörungskraft im SEO: Eine einzige falsche Zeile kann die komplette Website aus Suche und KI-Antworten nehmen. Fünf Fehler tauchen in der Praxis immer wieder auf.
Wie teuer die Kombination aus Fehler 1 und 4 ist, wissen wir aus eigener Erfahrung: Auf unserer eigenen Website steckte eine Staging-Vollsperre in einer physischen Datei, während das CDN zusätzlich eine eigene Version mit KI-Crawler-Blockaden auslieferte. Google rankte nur dank einer Konfliktregel weiter, alle anderen Crawler lasen monatelang die Vollsperre. Erst der direkte Abruf der Live-Datei deckte das auf.
Wie prüfst und testest du deine robots.txt?
Rufe die Datei direkt im Browser unter deine-domain.de/robots.txt auf, denn nur diese Live-Version zählt. Den Rest übernimmt die Google Search Console: Der robots.txt-Bericht in den Einstellungen zeigt die zuletzt gelesene Version, die URL-Prüfung testet einzelne Seiten.
Welche Begriffe gehören zur robots.txt dazu?
Häufige Fragen zur robots.txt
Wo liegt die robots.txt?
Ist eine robots.txt Pflicht?
Kann ich mit der robots.txt eine Seite aus Google entfernen?
Wie bearbeite ich die robots.txt in WordPress?
Halten sich alle Crawler an die robots.txt?
DTILE stellt sicher, dass deine technische Basis Sichtbarkeit ermöglicht statt sie zu blockieren: in Google, im Local Pack und in KI-Antworten.
Unverbindliche Beratung