Kurz gesagt
Ein verifizierter Crawl ist ein Zugriff, dessen Absenderadresse belegt, dass er tatsächlich vom genannten Anbieter stammt. Die Kennung im User-Agent, etwa “GPTBot” oder “Googlebot”, reicht dafür nicht. Sie ist ein Text, den jeder Absender frei setzen kann.
Wie geprüft wird
Die grossen Anbieter veröffentlichen, aus welchen Netzen ihre Crawler kommen. OpenAI führt je eine eigene Liste für GPTBot, OAI-SearchBot, ChatGPT-User und OAI-AdsBot. Perplexity veröffentlicht je eine Liste für PerplexityBot und Perplexity-User. Bei Google gibt es zwei Wege: den Abgleich mit den veröffentlichten Bereichen oder eine Rückwärtsauflösung der Adresse im DNS, die auf googlebot.com, google.com oder googleusercontent.com führen muss, mit anschliessender Vorwärtsauflösung zurück auf dieselbe Adresse.
Liegt die Adresse im veröffentlichten Bereich, ist der Zugriff verifiziert. Liegt sie ausserhalb, gibt sich jemand als Crawler aus, der keiner ist.
Das geht nur mit Server-Logs, weil nur dort Kennung und Adresse zusammen stehen. Ein Zähler per JavaScript sieht Crawler gar nicht, sie führen kein Skript aus.
Beispiel aus unserer eigenen Messung
Wir haben die WAF-Logs von scmc.ch über 30 Tage ausgewertet, Stand 21. August 2026.
| Befund | Anzahl |
|---|---|
| Anfragen mit Crawler-Kennung | 7’118 |
| davon aus veröffentlichten Bereichen | 344 |
| davon gefälscht | 6’774, also 95 Prozent |
| gefälscht und trotzdem durchgelassen | 4’811 |
Geprüft wurde gegen die veröffentlichten Bereiche von OpenAI, Perplexity und Google. Die 4’811 durchgelassenen Fälschungen trugen keine Angriffssignatur, deshalb hatte die Firewall keinen Grund, sie aufzuhalten.
Über elf eigene und betreute Hosts sieht das milder aus, aber nicht harmlos. Im Fenster vom 11. August bis 10. September 2026 kamen auf 17’290 verifizierte KI-Crawler-Zugriffe 8’560 Fälschungen. Das sind 33 Prozent, gerechnet auf verifizierte Crawler plus Fälscher. Wie hoch die Quote ausfällt, hängt am Bestand und am Zeitraum. Genau deshalb gehört zu jeder solchen Zahl das Fenster und der Nenner dazu.
Der häufigste Denkfehler
“Wir sehen GPTBot in den Logs, also liest ChatGPT unsere Seite.”
Wer Zugriffe nach Kennung zählt, zählt die Fälschungen mit. Bei scmc.ch hätte die ungeprüfte Zahl den echten Crawl-Verkehr um das Zwanzigfache überschätzt. Jede Aussage über KI-Sichtbarkeit, die auf solchen Zahlen aufbaut, erbt diesen Fehler.
Abgrenzung
KI-Crawler ist der Oberbegriff für Programme von KI-Anbietern, die Seiten abrufen. Ohne Prüfung der Adresse ist jede Zählung von KI-Crawlern eine Zählung von Behauptungen.
Web Application Firewall. Die gängigen Regelsätze suchen nach Angriffsmustern. Ob ein Bot echt ist, prüfen sie ohne eigene Regel oder Bot-Management nicht. Das zeigt das Beispiel oben.
Prompt-Monitoring misst, was ein KI-System auf eine Frage antwortet. Ob das System deine Seite vorher überhaupt abgerufen hat, sieht es nicht. Ein verifizierter Crawl beantwortet genau diese Frage.
KI-Verweis ist ein Mensch, der über einen Link in einer KI-Antwort auf deine Seite kommt. ChatGPT hängt dafür utm_source=chatgpt.com an die Adresse. Das ist Besucherverkehr, kein Crawl.
So prüfst du es selbst
Du brauchst Zugriffslogs mit Quelladresse und User-Agent, etwa vom Webserver, von CloudFront oder von einer WAF. Die veröffentlichten Bereiche der Anbieter lädst du frisch, sie ändern sich. Dann gleichst du jede Anfrage mit Crawler-Kennung gegen den Bereich ihres Anbieters ab. Was ausserhalb liegt, zählst du getrennt.
Wir machen das mit einem eigenen Werkzeug für WAF-Logs. Für CloudFront-Logs ist die Prüfung in Munot eingebaut, dort erscheinen Fälschungen als eigene Klasse. Besuchersitzungen rekonstruieren wir dabei nicht. Geprüft werden nur Anfragen, die sich als Bot ausgeben.
Quellen
Alle Anbieterseiten am 10. September 2026 abgerufen.
- OpenAI, Übersicht der Crawler und veröffentlichten IP-Bereiche: https://developers.openai.com/api/docs/bots
- Google Search Central, Verifying Googlebot and other Google crawlers: https://developers.google.com/search/docs/crawling-indexing/verifying-googlebot
- Perplexity, Perplexity Crawlers: https://docs.perplexity.ai/guides/bots
- Eigene Messung scmc.ch, WAF-Logs, 30 Tage bis 21. August 2026
- Eigene Messung über elf Hosts, Munot-Tageswürfel, 11. August bis 10. September 2026