GEO & KI-Suche

robots.txt für KI-Crawler: Wen du reinlässt und wen nicht

KI-Anbieter setzen getrennte Crawler für Training und für Antwortsysteme ein. GPTBot und ClaudeBot sammeln Trainingsmaterial, OAI-SearchBot und Claude-SearchBot versorgen die Suchfunktionen. Wer nur das Training verhindern will, sperrt die Trainings-Crawler und lässt die Antwort-Crawler zu – sonst verschwindet man aus KI-Antworten.

Das Wichtigste in Kürze

  • GPTBot sperren kostet keine ChatGPT-Sichtbarkeit – dafür ist OAI-SearchBot zuständig.
  • Google-Extended betrifft ausschließlich das Gemini-Training, nicht Suche und Rankings.
  • AI Overviews werden über den normalen Googlebot bedient, nicht über Google-Extended.
  • robots.txt ist eine freiwillige Vereinbarung, kein technischer Schutz.

Eine Datei, zwei völlig verschiedene Entscheidungen

Die Diskussion um KI-Crawler wird meist als eine Frage geführt: reinlassen oder nicht? Tatsächlich sind es zwei, und sie haben unterschiedliche Antworten.

Frage eins: Darf dein Inhalt zum Training von KI-Modellen verwendet werden?
Frage zwei: Darf dein Inhalt als Quelle in KI-Antworten erscheinen?

Die Anbieter verwenden dafür getrennte Crawler mit getrennten Kennungen. Wer das nicht weiß, sperrt beim Versuch, das Training zu verhindern, häufig die Sichtbarkeit gleich mit – oder umgekehrt.

Wer da tatsächlich vorbeikommt

Die folgende Übersicht stammt aus den Entwicklerdokumentationen der Anbieter selbst, nicht aus Sekundärquellen:

Kennung (robots.txt)AnbieterZweckSperren kostet Sichtbarkeit?
GPTBotOpenAITraining der ModelleNein
OAI-SearchBotOpenAISuchergebnisse in ChatGPTJa
ChatGPT-UserOpenAIAbruf auf NutzeranfrageJa
OAI-AdsBotOpenAIPrüfung von Anzeigen-ZielseitenNur für Werbung
ClaudeBotAnthropicTraining der ModelleNein
Claude-SearchBotAnthropicSuchergebnisse in ClaudeJa
Claude-UserAnthropicAbruf auf NutzeranfrageJa
Google-ExtendedGoogleTraining der Gemini-ModelleNein
GooglebotGoogleSuche, Snippets und AI OverviewsJa, massiv
PerplexityBotPerplexityIndex für PerplexityJa

Drei Dinge fallen auf.

Google-Extended ist harmloser als sein Ruf

Google stellt in der eigenen Dokumentation klar, dass Google-Extended ausschließlich steuert, ob Inhalte zum Training künftiger Gemini-Modelle und zur Fundierung in Gemini-Anwendungen verwendet werden dürfen. Auf die Aufnahme in die Google-Suche und auf Rankings hat es keinen Einfluss.

Anders gesagt: Google-Extended zu sperren kostet keine Suchsichtbarkeit – und auch keine AI Overviews, denn die werden über den normalen Googlebot bedient. Wer sein Material nicht ins Gemini-Training geben will, kann das ohne Nebenwirkungen tun.

Bei OpenAI entscheidet ein Buchstabe

GPTBot sammelt Trainingsmaterial. OAI-SearchBot versorgt die Suchfunktion in ChatGPT. Wer glaubt, mit dem Sperren von GPTBot aus ChatGPT zu verschwinden, irrt – und wer glaubt, GPTBot offenzuhalten sei für die Sichtbarkeit nötig, ebenfalls.

Die Nutzer-Crawler sind keine Crawler

ChatGPT-User und Claude-User laufen nur, wenn eine konkrete Person gerade eine Seite abrufen lässt. Das ist kein systematisches Absuchen des Netzes, sondern der Vorgang, der einem Klick am nächsten kommt. Sie zu sperren, heißt, einem interessierten Menschen die Tür zuzuhalten.

Die Entscheidung, die tatsächlich ansteht

Aus den Spalten oben ergeben sich drei sinnvolle Haltungen:

HaltungTrainingAntwort-CrawlerPasst zu
OffenerlaubterlaubtDienstleister, Beratung, B2B – Sichtbarkeit ist das Geschäft
ZweigeteiltgesperrterlaubtVerlage, Kursanbieter, alle mit verkaufbaren Inhalten
GeschlossengesperrtgesperrtRechtlich heikle oder streng vertrauliche Bereiche

Für die meisten mittelständischen Unternehmen ist „offen“ die richtige Wahl und „zweigeteilt“ die zweitbeste. Wie du prüfst, ob du dort tatsächlich vorkommst, steht unter KI-Sichtbarkeit messen. Semrush hat ausgewertet, dass ChatGPT rund die Hälfte seiner Quellen aus Unternehmens- und Dienstleisterseiten zieht (2025) – wer dort nicht auftaucht, überlässt den Platz dem Wettbewerb.

Eine robots.txt für die zweigeteilte Haltung

Training gesperrt, Antwortsysteme offen:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://deine-domain.de/sitemap_index.xml

Zwei Hinweise dazu. Erstens: Ein Allow ohne vorheriges Disallow ändert nichts – es dokumentiert nur eine bewusste Entscheidung für die nächste Person, die in die Datei schaut. Zweitens: robots.txt wirkt freiwillig. Seriöse Anbieter halten sich daran, aber es ist kein technischer Schutz. Wer verbindlich aussperren muss, braucht eine Sperre auf Serverebene.

Der Fehler, der am häufigsten passiert

Nicht die falsche Entscheidung – sondern gar keine. In vielen WordPress-Installationen steht eine robots.txt, die irgendwann von einem Plugin erzeugt wurde und seither niemand angesehen hat. Zwei Varianten kommen regelmäßig vor:

  • Eine Sicherheits-Erweiterung hat pauschal alles gesperrt, was nicht Googlebot heißt. Damit ist KI-Sichtbarkeit beendet, ohne dass jemand das entschieden hätte.
  • Eine ältere Datenschutz-Empfehlung hat GPTBot gesperrt, als es OAI-SearchBot noch nicht gab. Das Training ist blockiert, die Sichtbarkeit war nie das Thema – funktioniert also zufällig richtig.

Die Prüfung kostet eine Minute: deine-domain.de/robots.txt im Browser aufrufen und lesen, was da steht.

Was robots.txt nicht kann

Ein verbreiteter Irrtum, der auch für Google gilt: Eine per robots.txt gesperrte Seite kann trotzdem in einem Index landen – nur eben ohne dass ihr Inhalt gelesen wurde. Wer eine Seite zuverlässig heraushalten will, braucht noindex, und dafür muss der Crawler die Seite lesen dürfen. Sperren und noindex zugleich hebt sich gegenseitig auf. Mehr dazu unter Indexierung.

Fazit

Die robots.txt ist der kürzeste Weg, eine strategische Entscheidung zu treffen – und die häufigste Stelle, an der sie versehentlich getroffen wird.

Die Unterscheidung, auf die es ankommt: Trainings-Crawler sperren kostet nichts an Sichtbarkeit. Antwort-Crawler sperren kostet genau die Sichtbarkeit, um die es beim Thema KI-Suche geht. Wer beides in einen Topf wirft, entscheidet über sein Geschäft, ohne es zu merken.

Häufige Fragen

Nein. Google stellt in der eigenen Dokumentation klar, dass Google-Extended nur steuert, ob Inhalte zum Training künftiger Gemini-Modelle verwendet werden dürfen. Auf die Aufnahme in die Google-Suche und auf Rankings hat die Sperre keinen Einfluss.

GPTBot sammelt Inhalte, die für das Training der Modelle verwendet werden können. OAI-SearchBot versorgt die Suchfunktionen in ChatGPT. Wer in ChatGPT als Quelle auftauchen möchte, muss OAI-SearchBot zulassen – unabhängig davon, wie er zum Training steht.

Die großen Anbieter geben an, die Angaben zu respektieren, und veröffentlichen IP-Listen zur Überprüfung. Verbindlich ist das nicht: robots.txt ist eine freiwillige Vereinbarung. Wer zuverlässig aussperren muss, braucht eine Sperre auf Serverebene.

Unter deine-domain.de/robots.txt im Browser. In WordPress wird sie meist vom SEO-Plugin erzeugt und lässt sich dort bearbeiten. Lohnt eine Prüfung: Häufig stehen dort Regeln, die vor Jahren ein Plugin gesetzt hat.

Quellen

  1. OpenAI: Overview of OpenAI Crawlers (abgerufen am 23.09.2026)
  2. Anthropic: Does Anthropic crawl data from the web? (abgerufen am 23.09.2026)
  3. Google Search Central: Google common crawlers (Google-Extended) (abgerufen am 23.09.2026)
  4. Semrush: AI SEO Statistics (abgerufen am 23.09.2026)

Lass uns dreißig Minuten über deine Sichtbarkeit sprechen

Kostenlos, unverbindlich, und mit einer ehrlichen Einschätzung - auch wenn die lautet, dass du mich gerade nicht brauchst.

Erstgespräch vereinbaren