Zum Inhalt springen

KI-Crawler und Steuer-Tokens im Vergleich

Geprüft am Autor Patrick StolpVeröffentlicht

Diese Übersicht hilft Dir, eine Bot-Kennung einzuordnen und die passende Steuerung für Deine Website zu finden. Sie umfasst 14 Einträge von neun zugeordneten Betreibern, darunter Crawler, Nutzerabrufe und zwei reine Steuer-Tokens. Stand der Zusammenstellung ist der 8. September 2026.

Wo Betreiberangaben vorliegen, sind sie mit ihrer Quelle verlinkt. Bei Bytespider liegt mir keine entsprechende Betreiberdokumentation vor. Die eigenen Logbeobachtungen stehen getrennt davon: Eine dokumentierte Kennung und ein bestätigter Abruf sind zwei unterschiedliche Informationen.

Die Übersicht umfasst 14 Einträge von 9 zugeordneten Betreibern. Dazu gehören Crawler, Nutzerabrufe und reine Steuer-Tokens. Betreiberangaben und fehlende Nachweise sind je Zeile gekennzeichnet. Stand geprüft am 08.09.2026. IP-Verifikation der Treffer auf 07.–08.09.2026 gegen die am 08.09.2026 abgerufenen Listen.

Abrufart:
BotBetreiberAbrufartrobots.txt-TokenIP-Liste veröffentlichtverifizierte Treffer (07.–08.09.2026)beachtet robots.txt (dokumentiert)Primärquellegeprüft am
GPTBotOpenAITrainingsabrufGPTBotja (Stand 30.10.2025)4 von 29jaOpenAI-Dokumentation08.09.2026
OAI-SearchBotOpenAISuchabrufOAI-SearchBotja (Stand 02.01.2026)0 von 17jaOpenAI-Dokumentation08.09.2026
ChatGPT-UserOpenAINutzerabrufChatGPT-Userja (Stand 04.09.2026)10 von 37eingeschränktOpenAI-Dokumentation08.09.2026
ClaudeBotAnthropicTrainingsabrufClaudeBotja (Stand 18.08.2026)36 von 44jaAnthropic-Dokumentation08.09.2026
Claude-UserAnthropicNutzerabrufClaude-Userja (Stand 18.08.2026)0 von 23jaAnthropic-Dokumentation08.09.2026
Claude-SearchBotAnthropicSuchabrufClaude-SearchBotja (Stand 18.08.2026)0 von 14jaAnthropic-Dokumentation08.09.2026
PerplexityBotPerplexityIndexabrufPerplexityBotja (Stand 07.02.2025)6 von 16jaPerplexity-Dokumentation08.09.2026
Perplexity-UserPerplexityNutzerabrufPerplexity-Userja (Stand 17.10.2025)0 von 25neinPerplexity-Dokumentation08.09.2026
Google-ExtendedGoogleSteuer-Token ohne eigenen BotGoogle-Extended (kein eigener User-Agent)Liste des abrufenden Crawlers (Stand 07.09.2026)0 von 5 (kein eigener dokumentierter Abruf)jaGoogle-Dokumentation08.09.2026
CCBotCommon CrawlIndexabrufCCBotja (Stand 11.08.2026)kein Treffer im ZeitraumjaCommon Crawl-Dokumentation08.09.2026
BytespiderByteDanceTrainingsabrufBytespidernein19 Treffer, keine IP-Liste für diesen Abgleichnicht dokumentiertkeine Betreiberdokumentation08.09.2026
Meta-ExternalAgentMetaTrainingsabrufmeta-externalagentnein11 Treffer, keine IP-Liste für diesen AbgleichjaMeta-Dokumentation08.09.2026
AmazonbotAmazonTrainingsabrufAmazonbotja (Stand 30.04.2026)kein Treffer im ZeitraumjaAmazon-Dokumentation08.09.2026
Applebot-ExtendedAppleSteuer-Token ohne eigenen BotApplebot-Extended (kein eigener User-Agent)Liste des abrufenden Crawlers (Stand 31.07.2026)kein Treffer im ZeitraumjaApple-Dokumentation08.09.2026

Was unterscheidet Suche, Training und Nutzerabruf?

Abschnitt betitelt „Was unterscheidet Suche, Training und Nutzerabruf?“

Die Einordnung beschreibt den dokumentierten Zweck eines Abrufs. Sie beweist nicht, was mit einer einzelnen abgerufenen Seite anschließend geschieht.

Abrufart Aufgabe Beispiele
Suchabruf Inhalte für Suchfunktionen erfassen OAI-SearchBot, Claude-SearchBot
Trainingsabruf Inhalte sammeln, die für das Modelltraining verwendet werden können GPTBot, ClaudeBot
Nutzerabruf Eine Seite im Zusammenhang mit einer konkreten Nutzeraktion aufrufen ChatGPT-User, Claude-User, Perplexity-User
Index oder Datensammlung Webinhalte für einen Index oder einen weiterverwendbaren Datenbestand erfassen PerplexityBot, CCBot

Die Grenzen hängen vom Produkt ab. Common Crawl stellt beispielsweise Web-Crawl-Daten zur weiteren Nutzung bereit. Amazonbot dient laut Amazon der Verbesserung seiner Produkte und kann auch Trainingsdaten erfassen. Eine einzelne Kategorie beschreibt deshalb nicht immer sämtliche späteren Verwendungen.

Google-Extended und Applebot-Extended sind Sonderfälle. Sie bezeichnen keinen eigenen Seitenabruf, sondern steuern bestimmte Nutzungen bereits abgerufener Inhalte. Google erläutert das für Google-Extended, Apple für Applebot-Extended. Eine Regel für diese Tokens ist keine Abrufsperre für Googlebot oder Applebot.

Wie prüfst Du eine Kennung aus Deinem Zugriffslog?

Abschnitt betitelt „Wie prüfst Du eine Kennung aus Deinem Zugriffslog?“

Der User-Agent ist eine vom anfragenden Client übermittelte Kennung. Sein Wortlaut allein bestätigt die Herkunft nicht. Auch Common Crawl weist ausdrücklich auf fremde Abrufe mit CCBot-Kennung hin.

Für meine Auswertung vergleiche ich deshalb zusätzlich die Absender-IP mit den veröffentlichten Bereichen des jeweiligen Betreibers. Dabei bleiben drei Ergebnisse getrennt:

  • Die Adresse liegt innerhalb der zugeordneten Liste: Der IP-Abgleich bestätigt die Zuordnung für diesen Listenstand.
  • Die Adresse liegt außerhalb der Liste: Dieser Abgleich bestätigt den behaupteten Bot nicht.
  • Es fehlt eine zugeordnete Liste: Mit diesem Verfahren ist keine Prüfung möglich.

Halte bei eigenen Prüfungen auch den Zeitpunkt des Abrufs und den verwendeten Listenstand fest. Ein späterer Abgleich mit einer geänderten Liste beantwortet nicht automatisch dieselbe Frage wie eine Prüfung zum damaligen Zeitpunkt.

Für den 7. und 8. September 2026 habe ich 2.578 Logzeilen ausgewertet. Darunter waren 312 Zugriffe mit einer erkannten Such- oder KI-Bot-Kennung. Diese Gesamtzahl umfasst auch Vergleichsbots wie Googlebot und Bingbot, die nicht zu den 14 Einträgen der oberen Tabelle gehören.

Bei 116 Zugriffen passte die Absender-IP zur zugeordneten Betreiberliste. 161 Zugriffe stammten von Adressen außerhalb der jeweiligen Liste; für 35 Zugriffe fehlte eine zugeordnete Liste. Zusätzlich zeigten 151 Zugriffe typische Scanner-Pfade. Diese Zahl überschneidet sich mit den drei Gruppen und wird nicht hinzuaddiert.

Eigene Beobachtung: Zugriffslogs von patrickstolp.de, 07.–08.09.2026

Der IP-Abgleich vergleicht die Absender-IP mit den veröffentlichten Listen der Betreiber, abgerufen am 08.09.2026. Zugriffe auf typische Scan-Ziele wie /.aws/credentials oder /.env werden zusätzlich gezählt und überschneiden sich mit den übrigen Gruppen. Solche Pfade allein beweisen keine gefälschte Kennung. 2.578 Logzeilen an 2 Tagen. Es werden keine IP-Adressen ausgegeben.

BotTrefferIP-AbgleichScanner-Pfaderobots.txt-AbrufeTreffer auf Pfade, die im gespeicherten robots.txt-Stand gesperrt sind
GPTBot294 von 292300
OAI-SearchBot170 von 171400
ChatGPT-User3710 von 372100
ClaudeBot4436 von 446160
Claude-User230 von 232300
Claude-SearchBot140 von 141300
PerplexityBot166 von 16620
Perplexity-User250 von 251500
Google-Extended50 von 5 (kein eigener dokumentierter Abruf)500
CCBot0
Bytespider1919 Treffer, keine IP-Liste für diesen Abgleich500
Meta-ExternalAgent1111 Treffer, keine IP-Liste für diesen Abgleich900
Amazonbot0
Applebot-Extended0

Von 312 Zugriffen mit Such- oder KI-Bot-Kennung lassen sich 116 einer zugeordneten IP-Liste zuordnen. 161 liegen außerhalb dieser Listen; für 35 fehlt eine zugeordnete Liste. Zusätzlich zeigen 151 Zugriffe Scanner-Muster. Diese Zahl überschneidet sich mit den drei Gruppen. Die Gesamtzahl umfasst mehr Kennungen als die 14 Einträge dieser Tabelle, darunter Vergleichsbots wie Googlebot, Bingbot, Applebot und DuckAssistBot.

Die Zahlen beschreiben Zugriffe auf eine einzelne Website. Sie zeigen weder, wie häufig die Bots im gesamten Web auftreten, noch ob abgerufene Inhalte in KI-Antworten verwendet wurden. Der robots.txt-Abgleich nutzt einen gespeicherten Stand; daraus lässt sich kein damaliger Regelverstoß ableiten. Ausgewertet am 08.09.2026.

Aus einem Scanner-Pfad allein leite ich weder eine gefälschte Kennung noch einen böswilligen Betreiber ab. Auch die Zahl der Zugriffe sagt nicht, ob Inhalte in einer KI-Antwort verwendet wurden. Die Auswertung beschreibt eine Website an zwei beobachteten Tagen, keine allgemeine Verteilung des Bot-Traffics im Web.

Für eine konkrete Regel brauchst Du den passenden Token und die dokumentierte Zusage des Betreibers. Eine Regel für einen Trainingscrawler ist keine pauschale Einstellung für alle Produkte desselben Unternehmens.

Gerade bei Nutzerabrufen unterscheiden sich die Angaben:

Eintrag Dokumentierte Behandlung von robots.txt
Claude-User Anthropic erklärt, dass seine Bots robots.txt beachten.
ChatGPT-User OpenAI weist darauf hin, dass die Regeln bei Nutzeraktionen möglicherweise nicht gelten.
Perplexity-User Perplexity erklärt, dass der Abruf die Regeln in der Regel ignoriert.

Diese Unterschiede stehen in den Dokumentationen von Anthropic, OpenAI und Perplexity. „Nutzerabruf“ bedeutet also nicht automatisch, dass robots.txt unbeachtet bleibt. Umgekehrt ersetzt eine korrekt formulierte Regel keine fehlende Betreiberzusage.

Mit dem robots.txt-Tester prüfst Du, welche Regel für einen Bot und einen konkreten Pfad gilt. Der Generator erstellt eine Datei aus Deiner Bot-Auswahl. Beide Werkzeuge werten Regeln aus; sie kontrollieren nicht das tatsächliche Verhalten der Anbieter.

Wenn Du Inhalte technisch vor Zugriffen schützen willst, brauchst Du eine Zugriffskontrolle auf Serverebene. robots.txt ist dafür nicht vorgesehen. Das stellt bereits RFC 9309 klar. Für Indexierung und Darstellung gelten wiederum eigene Einstellungen, die die Referenz zur Inhaltssteuerung voneinander abgrenzt.

Die Steckbriefe verbinden die jeweilige Kennung und Betreiberquelle mit den passenden Regeln und vorhandenen eigenen Beobachtungen. Bei Einträgen ohne eigenen Abruf ist diese Grenze ausdrücklich gekennzeichnet.

OpenAI

Anthropic

Perplexity

Google

  • Google-Extended: Training und Grounding steuern

    Steuert, ob von Google gecrawlte Inhalte für das Training künftiger Gemini-Generationen (Gemini Apps, Vertex AI) und für Grounding dort verwendet werden dürfen. Der Abruf selbst läuft über bestehende Google-User-Agents.

    Token Google-Extended · Steuer-Token ohne eigenen Bot

Common Crawl

ByteDance

  • Bytespider: ByteDances Crawler und seine Grenzen

    ByteDance-Crawler; Zweck vom Betreiber nicht öffentlich dokumentiert. Unabhängige Berichte ordnen ihn dem Training zu.

    Token Bytespider · Trainingsabruf

Meta

  • Meta-ExternalAgent: Metas Trainingscrawler und seine Steuerung

    Sammelt Inhalte für das Training der Meta-Modelle und zur Produktverbesserung durch direkte Indexierung.

    Token meta-externalagent · Trainingsabruf

Amazon

  • Amazonbot: Amazons Crawler und seine Steuerung

    Verbessert Amazons Produkte und Dienste; die Inhalte können für das Training von Amazons KI-Modellen verwendet werden. Für Suche und Nutzerabruf nennt Amazon getrennte Tokens (Amzn-SearchBot, Amzn-User).

    Token Amazonbot · Trainingsabruf

Apple

Primärquellen

  1. Overview of OpenAI Crawlers · OpenAI · abgerufen am · Zweck, Token, User-Agent und robots.txt-Zusage der OpenAI-Bots
  2. Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic · abgerufen am · Drei Claude-Abrufarten und ihre dokumentierte Behandlung von robots.txt
  3. Perplexity Crawlers · Perplexity · abgerufen am · PerplexityBot und Perplexity-User; dokumentierte Ausnahme beim Nutzerabruf
  4. Google-Extended in der Dokumentation der Google-Crawler · Google · abgerufen am · Google-Extended ohne eigenen HTTP-User-Agent; steuert Training und Grounding, kein Suchausschluss
  5. About Applebot · Apple · abgerufen am · Applebot-Extended steuert die Datennutzung und ruft selbst keine Seiten ab
  6. CCBot · Common Crawl · abgerufen am · CCBot, robots.txt-Syntax und Hinweis auf fremde Abrufe mit CCBot-Kennung
  7. Amazonbot · Amazon · abgerufen am · Amazonbot, Amzn-SearchBot und Amzn-User; Zweck nicht ausschließlich Training
  8. Meta Web Crawlers · Meta · abgerufen am · Vorhandene Masterangabe zu meta-externalagent; in diesem Paket nicht erneut inhaltlich verifiziert (Abruf 429), Nachprüfung vor der Tabellenfreigabe
  9. RFC 9309: Robots Exclusion Protocol · IETF (Koster u. a., September 2022) · abgerufen am · Auswertung von Gruppen, Allow und Disallow; robots.txt ist keine Zugriffskontrolle
  10. Eigene Auswertung der Zugriffslogs von patrickstolp.de (Auswertung v3) · Patrick Stolp · abgerufen am · Eigene, nicht veröffentlichte Datengrundlage: 2.578 Logzeilen vom 7. und 8. September 2026, ausgewertet am 8. September 2026, IP-Abgleich gegen die an diesem Tag abgerufenen Betreiberlisten

Verwandte Referenzen

Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz