KI-Anbieter setzen getrennte Crawler für Training und für Antwortsysteme ein. GPTBot und ClaudeBot sammeln Trainingsmaterial, OAI-SearchBot und Claude-SearchBot versorgen die Suchfunktionen. Wer nur das Training verhindern will, sperrt die Trainings-Crawler und lässt die Antwort-Crawler zu – sonst verschwindet man aus KI-Antworten.
robots.txt für KI-Crawler: Wen du reinlässt und wen nicht
Das Wichtigste in Kürze
- GPTBot sperren kostet keine ChatGPT-Sichtbarkeit – dafür ist OAI-SearchBot zuständig.
- Google-Extended betrifft ausschließlich das Gemini-Training, nicht Suche und Rankings.
- AI Overviews werden über den normalen Googlebot bedient, nicht über Google-Extended.
- robots.txt ist eine freiwillige Vereinbarung, kein technischer Schutz.
Eine Datei, zwei völlig verschiedene Entscheidungen
Die Diskussion um KI-Crawler wird meist als eine Frage geführt: reinlassen oder nicht? Tatsächlich sind es zwei, und sie haben unterschiedliche Antworten.
Frage eins: Darf dein Inhalt zum Training von KI-Modellen verwendet werden?
Frage zwei: Darf dein Inhalt als Quelle in KI-Antworten erscheinen?
Die Anbieter verwenden dafür getrennte Crawler mit getrennten Kennungen. Wer das nicht weiß, sperrt beim Versuch, das Training zu verhindern, häufig die Sichtbarkeit gleich mit – oder umgekehrt.
Wer da tatsächlich vorbeikommt
Die folgende Übersicht stammt aus den Entwicklerdokumentationen der Anbieter selbst, nicht aus Sekundärquellen:
| Kennung (robots.txt) | Anbieter | Zweck | Sperren kostet Sichtbarkeit? |
|---|---|---|---|
GPTBot | OpenAI | Training der Modelle | Nein |
OAI-SearchBot | OpenAI | Suchergebnisse in ChatGPT | Ja |
ChatGPT-User | OpenAI | Abruf auf Nutzeranfrage | Ja |
OAI-AdsBot | OpenAI | Prüfung von Anzeigen-Zielseiten | Nur für Werbung |
ClaudeBot | Anthropic | Training der Modelle | Nein |
Claude-SearchBot | Anthropic | Suchergebnisse in Claude | Ja |
Claude-User | Anthropic | Abruf auf Nutzeranfrage | Ja |
Google-Extended | Training der Gemini-Modelle | Nein | |
Googlebot | Suche, Snippets und AI Overviews | Ja, massiv | |
PerplexityBot | Perplexity | Index für Perplexity | Ja |
Drei Dinge fallen auf.
Google-Extended ist harmloser als sein Ruf
Google stellt in der eigenen Dokumentation klar, dass Google-Extended ausschließlich steuert, ob Inhalte zum Training künftiger Gemini-Modelle und zur Fundierung in Gemini-Anwendungen verwendet werden dürfen. Auf die Aufnahme in die Google-Suche und auf Rankings hat es keinen Einfluss.
Anders gesagt: Google-Extended zu sperren kostet keine Suchsichtbarkeit – und auch keine AI Overviews, denn die werden über den normalen Googlebot bedient. Wer sein Material nicht ins Gemini-Training geben will, kann das ohne Nebenwirkungen tun.
Bei OpenAI entscheidet ein Buchstabe
GPTBot sammelt Trainingsmaterial. OAI-SearchBot versorgt die Suchfunktion in ChatGPT. Wer glaubt, mit dem Sperren von GPTBot aus ChatGPT zu verschwinden, irrt – und wer glaubt, GPTBot offenzuhalten sei für die Sichtbarkeit nötig, ebenfalls.
Die Nutzer-Crawler sind keine Crawler
ChatGPT-User und Claude-User laufen nur, wenn eine konkrete Person gerade eine Seite abrufen lässt. Das ist kein systematisches Absuchen des Netzes, sondern der Vorgang, der einem Klick am nächsten kommt. Sie zu sperren, heißt, einem interessierten Menschen die Tür zuzuhalten.
Die Entscheidung, die tatsächlich ansteht
Aus den Spalten oben ergeben sich drei sinnvolle Haltungen:
| Haltung | Training | Antwort-Crawler | Passt zu |
|---|---|---|---|
| Offen | erlaubt | erlaubt | Dienstleister, Beratung, B2B – Sichtbarkeit ist das Geschäft |
| Zweigeteilt | gesperrt | erlaubt | Verlage, Kursanbieter, alle mit verkaufbaren Inhalten |
| Geschlossen | gesperrt | gesperrt | Rechtlich heikle oder streng vertrauliche Bereiche |
Für die meisten mittelständischen Unternehmen ist „offen“ die richtige Wahl und „zweigeteilt“ die zweitbeste. Wie du prüfst, ob du dort tatsächlich vorkommst, steht unter KI-Sichtbarkeit messen. Semrush hat ausgewertet, dass ChatGPT rund die Hälfte seiner Quellen aus Unternehmens- und Dienstleisterseiten zieht (2025) – wer dort nicht auftaucht, überlässt den Platz dem Wettbewerb.
Eine robots.txt für die zweigeteilte Haltung
Training gesperrt, Antwortsysteme offen:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://deine-domain.de/sitemap_index.xml
Zwei Hinweise dazu. Erstens: Ein Allow ohne vorheriges Disallow ändert nichts – es dokumentiert nur eine bewusste Entscheidung für die nächste Person, die in die Datei schaut. Zweitens: robots.txt wirkt freiwillig. Seriöse Anbieter halten sich daran, aber es ist kein technischer Schutz. Wer verbindlich aussperren muss, braucht eine Sperre auf Serverebene.
Der Fehler, der am häufigsten passiert
Nicht die falsche Entscheidung – sondern gar keine. In vielen WordPress-Installationen steht eine robots.txt, die irgendwann von einem Plugin erzeugt wurde und seither niemand angesehen hat. Zwei Varianten kommen regelmäßig vor:
- Eine Sicherheits-Erweiterung hat pauschal alles gesperrt, was nicht Googlebot heißt. Damit ist KI-Sichtbarkeit beendet, ohne dass jemand das entschieden hätte.
- Eine ältere Datenschutz-Empfehlung hat
GPTBotgesperrt, als esOAI-SearchBotnoch nicht gab. Das Training ist blockiert, die Sichtbarkeit war nie das Thema – funktioniert also zufällig richtig.
Die Prüfung kostet eine Minute: deine-domain.de/robots.txt im Browser aufrufen und lesen, was da steht.
Was robots.txt nicht kann
Ein verbreiteter Irrtum, der auch für Google gilt: Eine per robots.txt gesperrte Seite kann trotzdem in einem Index landen – nur eben ohne dass ihr Inhalt gelesen wurde. Wer eine Seite zuverlässig heraushalten will, braucht noindex, und dafür muss der Crawler die Seite lesen dürfen. Sperren und noindex zugleich hebt sich gegenseitig auf. Mehr dazu unter Indexierung.
Fazit
Die robots.txt ist der kürzeste Weg, eine strategische Entscheidung zu treffen – und die häufigste Stelle, an der sie versehentlich getroffen wird.
Die Unterscheidung, auf die es ankommt: Trainings-Crawler sperren kostet nichts an Sichtbarkeit. Antwort-Crawler sperren kostet genau die Sichtbarkeit, um die es beim Thema KI-Suche geht. Wer beides in einen Topf wirft, entscheidet über sein Geschäft, ohne es zu merken.
Häufige Fragen
Nein. Google stellt in der eigenen Dokumentation klar, dass Google-Extended nur steuert, ob Inhalte zum Training künftiger Gemini-Modelle verwendet werden dürfen. Auf die Aufnahme in die Google-Suche und auf Rankings hat die Sperre keinen Einfluss.
GPTBot sammelt Inhalte, die für das Training der Modelle verwendet werden können. OAI-SearchBot versorgt die Suchfunktionen in ChatGPT. Wer in ChatGPT als Quelle auftauchen möchte, muss OAI-SearchBot zulassen – unabhängig davon, wie er zum Training steht.
Die großen Anbieter geben an, die Angaben zu respektieren, und veröffentlichen IP-Listen zur Überprüfung. Verbindlich ist das nicht: robots.txt ist eine freiwillige Vereinbarung. Wer zuverlässig aussperren muss, braucht eine Sperre auf Serverebene.
Unter deine-domain.de/robots.txt im Browser. In WordPress wird sie meist vom SEO-Plugin erzeugt und lässt sich dort bearbeiten. Lohnt eine Prüfung: Häufig stehen dort Regeln, die vor Jahren ein Plugin gesetzt hat.
Quellen
- OpenAI: Overview of OpenAI Crawlers (abgerufen am 23.09.2026)
- Anthropic: Does Anthropic crawl data from the web? (abgerufen am 23.09.2026)
- Google Search Central: Google common crawlers (Google-Extended) (abgerufen am 23.09.2026)
- Semrush: AI SEO Statistics (abgerufen am 23.09.2026)
Lass uns dreißig Minuten über deine Sichtbarkeit sprechen
Kostenlos, unverbindlich, und mit einer ehrlichen Einschätzung - auch wenn die lautet, dass du mich gerade nicht brauchst.
Erstgespräch vereinbaren