Server-Logs protokollieren jeden einzelnen Zugriff auf eine Website – auch den von Crawlern. Sie beantworten Fragen, die kein anderes Werkzeug beantwortet: welche Verzeichnisse wie oft besucht werden, wie viel Crawling in Parametern und Weiterleitungen versickert und welchen Anteil KI-Crawler inzwischen ausmachen. Der User-Agent allein ist dabei kein Nachweis, er lässt sich frei fälschen.
Logfile-Analyse: Was Server-Logs über Googlebot und KI-Crawler verraten
Das Wichtigste in Kürze
- Der User-Agent ist fälschbar. Google nennt zwei Verifikationswege: Reverse-DNS mit Vorwärtsbestätigung oder Abgleich mit den veröffentlichten IP-Bereichen.
- Echte Googlebot-IPs lösen auf googlebot.com, google.com oder googleusercontent.com auf.
- Google veröffentlicht die IP-Bereiche seiner Crawler als JSON-Dateien zum automatisierten Abgleich.
- Logs zeigen, was die Search Console nicht zeigt: Crawl-Verteilung pro Verzeichnis, verschwendete Zugriffe und den Anteil von KI-Crawlern.
Die Search Console zeigt eine aufbereitete, verzögerte und gefilterte Sicht darauf, was Google mit einer Website macht. Das Server-Logfile zeigt die Rohdaten: jeder Zugriff, mit Zeitstempel, angeforderter URL, Statuscode, Datenmenge und User-Agent. Für eine Handvoll Fragen ist das die einzige verlässliche Quelle.
Was in einer Logzeile steht
Eine Zeile im verbreiteten Combined-Format enthält die anfragende IP-Adresse, den Zeitstempel, die Anfragemethode und den Pfad, den zurückgegebenen Statuscode, die übertragene Datenmenge, den Referrer und den User-Agent. Alles, was für eine Crawler-Analyse gebraucht wird, steckt in diesen Feldern.
Welche Fragen nur das Logfile beantwortet
| Frage | Search Console | Logfile |
|---|---|---|
| Wurde diese URL gecrawlt? | Ja, pro URL abfragbar | Ja, mit exaktem Zeitpunkt |
| Wie verteilt sich das Crawling auf Verzeichnisse? | Nein | Ja |
| Wie viele Zugriffe landen auf Weiterleitungen und Fehlern? | Nur aggregiert | Ja, vollständig |
| Welche Parameter-URLs werden gecrawlt? | Nur stichprobenhaft | Ja, alle |
| Wie oft kommen GPTBot, ClaudeBot, PerplexityBot? | Nein | Ja |
| Hat der Crawler den Relaunch bemerkt? | Verzögert | Unmittelbar |
Die vorletzte Zeile ist der Grund, warum Logfiles gerade wieder interessant werden. Wer wissen will, ob die eigenen Inhalte überhaupt für KI-Systeme abrufbar sind, findet im Log die einzige direkte Antwort – alles andere ist Ableitung. Die Steuerung dieser Zugriffe beschreibt der Artikel zur robots.txt für KI-Crawler, die Wirkungsmessung der zur Messung von KI-Sichtbarkeit.
Googlebot verifizieren – der User-Agent reicht nicht
Jeder kann sich als Googlebot ausgeben; es ist eine Zeile im HTTP-Header. Ein nennenswerter Teil der Zugriffe, die im Log nach Googlebot aussehen, stammt von Scrapern und Scannern. Wer diese Zeilen mitzählt, kommt zu falschen Schlüssen.
Google beschreibt zwei Wege der Überprüfung:
Reverse-DNS mit Vorwärtsbestätigung
- Rückwärtsauflösung der IP-Adresse durchführen.
- Prüfen, ob der Domainname auf
googlebot.com,google.comodergoogleusercontent.comendet. - Für diesen Domainnamen eine Vorwärtsauflösung durchführen.
- Prüfen, ob dabei wieder die ursprüngliche IP-Adresse herauskommt.
Echte Google-Crawler lösen dabei auf Muster wie crawl-***-***-***-***.googlebot.com, geo-crawl-***-***-***-***.geo.googlebot.com oder rate-limited-proxy-***-***-***-***.google.com auf. Der vierte Schritt ist der entscheidende: Ohne Vorwärtsbestätigung lässt sich ein Reverse-DNS-Eintrag manipulieren.
Abgleich mit den veröffentlichten IP-Bereichen
Für größere Datenmengen ist der manuelle Weg unpraktikabel. Google veröffentlicht die IP-Bereiche seiner Crawler in CIDR-Notation als JSON-Dateien – getrennt nach gängigen Crawlern, Spezial-Crawlern und nutzerausgelösten Abrufen. Diese Dateien lassen sich in ein Skript einlesen und gegen die IP-Spalte des Logs abgleichen. Das ist der Weg, den jedes ernsthafte Logfile-Tool intern geht.
Woran du die Logs bekommst
Bei Shared Hosting liegen die Zugriffsprotokolle meist im Kundenmenü unter „Statistiken“ oder „Logfiles“ und sind oft nur wenige Tage verfügbar. Bei eigenem Server liegen sie typischerweise unter /var/log/. Wenn ein CDN oder eine Firewall vorgeschaltet ist, siehst du im Server-Log nur die Zugriffe, die den Cache nicht bedient hat – die vollständigen Daten liefert dann der Dienst selbst. Diesen Punkt vorab zu klären, spart eine Auswertung auf unvollständiger Basis. Mehr zur Auswahl in Hosting für kleine Unternehmen.
Ein praktischer Rat: Wenn die Aufbewahrung standardmäßig bei sieben Tagen liegt, lohnt es sich, einen automatischen Export einzurichten, bevor man sie braucht. Nach einem Relaunch sind die Logs der Vorwoche rückwirkend nicht mehr zu beschaffen.
Die vier Auswertungen, die sich immer lohnen
- Statuscodes pro Crawler. Ein hoher Anteil an 301 und 404 bedeutet, dass ein Teil jedes Besuchs für nichts aufgewendet wird. Typische Ursache: alte interne Links und Weiterleitungsketten nach einem Relaunch.
- Crawl-Verteilung nach Verzeichnis. Wenn achtzig Prozent der Zugriffe auf Tag-Archive und Parameter-URLs entfallen und die Leistungsseiten kaum vorkommen, ist die Priorisierung falsch.
- Zuletzt besuchte wichtige Seiten. Eine Kernseite, die seit Wochen nicht abgerufen wurde, wird auch nicht neu bewertet – ein Hinweis auf fehlende interne Verlinkung.
- Crawler-Anteile im Zeitverlauf. Wie viel Traffic verursachen KI-Crawler inzwischen? Die Zahl ist einerseits eine Reichweiteninformation, andererseits ein Serverlast-Thema.
Womit auswerten
Bei überschaubaren Datenmengen reicht die Kommandozeile: filtern, zählen, sortieren. Wer lieber grafisch arbeitet, findet in Screaming Frog einen Log File Analyser, der den Abgleich mit einem Crawl der Website direkt mitliefert – damit lässt sich die aufschlussreichste Frage überhaupt beantworten: Welche URLs existieren, werden aber nie besucht? Diese Liste ist in fast jedem Projekt länger als erwartet und führt direkt zu den Seiten, die in der Indexierung fehlen.
Häufige Fragen
Bei wenigen hundert URLs meist nicht – dort ist ohnehin alles erfasst. Interessant wird es ab einigen tausend URLs, bei Shops mit Filtern, nach einem Relaunch mit vielen Weiterleitungen und immer dann, wenn Seiten trotz korrekter Technik nicht indexiert werden.
IP-Adressen sind personenbezogene Daten. Server-Logs dürfen zur Sicherstellung des Betriebs verarbeitet werden, brauchen aber eine Erwähnung in der Datenschutzerklärung und eine begrenzte Speicherdauer. Für die Crawler-Analyse reicht es, die Zeilen menschlicher Besucher gar nicht erst zu exportieren.
Mindestens sieben Tage, besser dreißig. Ein einzelner Tag zeigt Zufall. Erst über mehrere Wochen wird sichtbar, welche Bereiche systematisch besucht und welche systematisch übersehen werden.
Quellen
- Google Search Central: Verifying Googlebot and other Google crawlers (abgerufen am 28.09.2026)
- Google: IP-Bereiche der gängigen Crawler (JSON) (abgerufen am 28.09.2026)
Lass uns dreißig Minuten über deine Sichtbarkeit sprechen
Kostenlos, unverbindlich, und mit einer ehrlichen Einschätzung - auch wenn die lautet, dass du mich gerade nicht brauchst.
Erstgespräch vereinbaren