Zum Inhalt springen

ClaudeBot: Anthropics Trainingscrawler und seine Steuerung

Geprüft am Autor Patrick StolpVeröffentlicht

ClaudeBot sammelt Webinhalte, die zum Training von Anthropics Modellen beitragen können. Ein Abruf bedeutet deshalb noch nicht, dass eine Seite tatsächlich in Trainingsdaten übernommen wurde. Den Zweck beschreibt Anthropic in seiner Botdokumentation.

Stand geprüft am 08.09.2026 aus der Dokumentation von Anthropic und eigener Logprüfung (07.–08.09.2026).

BetreiberAnthropic
AbrufartTrainingsabruf
ZweckSammelt Webinhalte für das Training der Claude-Modelle.
helps enhance the utility and safety of our generative AI models by collecting web content
User-AgentMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com) (beobachtet in den Logs von patrickstolp.de)
Anthropic dokumentiert nur den Token, keinen vollständigen String. Der beobachtete String stammt aus Treffern, deren Absender-IP in der veröffentlichten Anthropic-Liste liegt (36 von 44, 07.–08.09.2026).
robots.txt-TokenClaudeBot (Altnamen: anthropic-ai, Claude-Web)
IP-Liste veröffentlichtja: https://claude.com/crawling/bots.json (Stand der Liste 18.08.2026, abgerufen am 08.09.2026)
JSON (ipv4Prefix), eine Liste für alle drei Anthropic-Agents
Bis August 2026 gab es keine veröffentlichte Liste; ältere Quellen nennen Anthropic deshalb als nicht verifizierbar.
IP-VerifikationAbgleich der Absender-IP gegen die veröffentlichte Liste (Stand der Liste 18.08.2026, abgerufen am 08.09.2026)
beachtet robots.txt (dokumentiert)ja, laut Dokumentation
respect 'do not crawl' signals by honoring industry standard directives in robots.txt
Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026)36 von 44 Kennungstreffern IP-verifiziert; 6 der 44 mit Scanner-Mustern (überlappende Zählung)
Scanner-Muster werden über alle Kennungstreffer gezählt, nicht nur über die IP-verifizierten.
Wirkung des Blockierens
Trainingsabruf
robots.txt steuert künftige ClaudeBot-Abrufe; eine nachträgliche Regel macht eine bereits erfolgte Nutzung nicht rückgängig. Laut Anthropic signalisiert eine Einschränkung, dass künftige Materialien der Website von den Trainingsdatensätzen ausgeschlossen werden sollen.
Suchabruf
Keine dokumentierte Wirkung. Suche läuft über Claude-SearchBot.
Nutzerabruf
Keine dokumentierte Wirkung. Nutzerabrufe laufen über Claude-User.
PrimärquelleDoes Anthropic crawl data from the web, and how can site owners block the crawler?
geprüft am

In den Zugriffslogs von patrickstolp.de vom 7. und 8. September 2026 gab es 44 Treffer mit ClaudeBot-Kennung. Bei 36 passte die Absender-IP zur veröffentlichten Anthropic-Liste, bei acht lag sie außerhalb. Sechs der insgesamt 44 Treffer zeigten typische Scanner-Pfade; diese Zahl überschneidet sich mit der Herkunftsauswertung.

Die bestätigten Abrufe verteilen sich auf vier Pfade:

Pfad Bestätigte Abrufe
/robots.txt 16
/sitemap_index.xml 16
/ 3
/seo-luebeck-unternehmen/ 1
Eigene Beobachtung: Zugriffslogs von patrickstolp.de, 07.–08.09.2026

Der IP-Abgleich vergleicht die Absender-IP mit den veröffentlichten Listen der Betreiber, abgerufen am 08.09.2026. Zugriffe auf typische Scan-Ziele wie /.aws/credentials oder /.env werden zusätzlich gezählt und überschneiden sich mit den übrigen Gruppen. Solche Pfade allein beweisen keine gefälschte Kennung. 2.578 Logzeilen an 2 Tagen. Es werden keine IP-Adressen ausgegeben.

Zeitraum07.–08.09.2026
Treffer mit Kennung ClaudeBot44
IP-Abgleich36 von 44
mit Scanner-Pfaden (überlappende Zählung über alle Kennungstreffer)6
eindeutige Absender-IPs2 (nur gezählt)
Statuscodes2xx 35 · 3xx 2 · 4xx 1 · 5xx 0 · sonstige/fehlend 6
Abrufe von /robots.txt16
Abrufe von /llms.txt0
Treffer auf Pfade, die im gespeicherten robots.txt-Stand gesperrt sind0
häufigste Pfade (nur IP-verifiziert)/robots.txt (16)
/sitemap_index.xml (16)
/ (3)
/seo-luebeck-unternehmen/ (1)

Die Zahlen beschreiben Zugriffe auf eine einzelne Website. Sie zeigen weder, wie häufig die Bots im gesamten Web auftreten, noch ob abgerufene Inhalte in KI-Antworten verwendet wurden. Der robots.txt-Abgleich nutzt einen gespeicherten Stand; daraus lässt sich kein damaliger Regelverstoß ableiten. Ausgewertet am 08.09.2026.

Der größte Teil dieser Zugriffe betraf also die robots.txt und die Sitemap. Die 36 bestätigten Abrufe sind keine 36 gelesenen Fachartikel. Auch der einzelne Zugriff auf die Angebotsseite belegt keine Trainingsnutzung oder Empfehlung.

Vergleiche den User-Agent mit der angegebenen Bot-Kennung und die Absender-IP mit Anthropics veröffentlichter Liste. Die Liste dient der Zuordnung zu Anthropic; welcher der drei Bots angegeben wird, ergibt sich zusätzlich aus der Kennung. Halte den verwendeten Listenstand fest.

Im Steckbrief bleiben die dokumentierte Kennung und der in meinen Logs beobachtete vollständige User-Agent getrennt. Eine beobachtete Zeichenfolge wird dadurch nicht automatisch zur verbindlichen Formatvorgabe des Betreibers. Die Crawler-Übersicht erklärt die Herkunftsprüfung ausführlicher.

Für die vollständige Sperre lautet die robots.txt-Gruppe:

User-agent: ClaudeBot
Disallow: /

Anthropic erklärt, robots.txt zu beachten. Eine Einschränkung für ClaudeBot signalisiert laut Dokumentation, dass künftige Materialien der Website von den Trainingsdatensätzen ausgeschlossen werden sollen.

Prüfe die vollständige Datei im robots.txt-Tester. Eine eigene Bot-Gruppe übernimmt nicht zusätzlich die Regeln der Stern-Gruppe. Wenn Du nur einzelne Bereiche sperrst, müssen deshalb alle für ClaudeBot benötigten Pfadregeln in der passenden Gruppe stehen. Grundlage ist RFC 9309.

Die Regel ist kein Nachweis, dass bereits verwendete Inhalte aus einem trainierten Modell entfernt wurden. Für die getrennten Abrufarten Suche und Nutzeranfrage gibt es eigene Steckbriefe.

Primärquellen

  1. Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic · abgerufen am · Betreiberdokumentation mit sichtbarem Datum 07.04.2026, keine empirische Stichprobe: Zweck von ClaudeBot, getrennte Tokens für die drei Abrufarten, robots.txt-Zusage; eine Sperre signalisiert den Ausschluss künftiger Materialien und sagt nichts über bereits verwendete Trainingsdaten
  2. Veröffentlichte IP-Bereiche (Anthropic) · Anthropic · abgerufen am · Gemeinsame Liste für alle drei Anthropic-Agents, Stand der Liste laut Master 18.08.2026: Abgleichskriterium für die Herkunft einer Kennung; aus dem Listenstand folgt kein Erstveröffentlichungsdatum des Bots
  3. RFC 9309: Robots Exclusion Protocol · IETF (Koster, Illyes, Zeller, Sassman, September 2022) · abgerufen am · Normativer Standard: Eine eigene Bot-Gruppe übernimmt die Regeln der Stern-Gruppe nicht (Abschnitt 2.2.1); daraus folgt keine Betreiberzusage
  4. Eigene Auswertung der Zugriffslogs von patrickstolp.de (Auswertung v3) · Patrick Stolp · abgerufen am · Eigene, nicht veröffentlichte Datengrundlage, 07.–08.09.2026: 2.578 Logzeilen, 44 Treffer mit ClaudeBot-Kennung, davon 36 per IP bestätigt; keine Aussage über eine Trainingsnutzung

Verwandte Referenzen

Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz