CCBot: Common Crawls Archivcrawler und seine Steuerung
CCBot erfasst Webseiten für das offene Datenarchiv von Common Crawl. Der Datenbestand steht anderen zur Auswertung und Weiterverwendung zur Verfügung. Ein CCBot-Abruf ist deshalb zunächst eine Erfassung für dieses Archiv, kein Nachweis einer Nutzung durch ein bestimmtes KI-Modell. Das Angebot beschreibt Common Crawl auf seiner Botseite.
Stand geprüft am 08.09.2026 aus der Dokumentation von Common Crawl.
| Betreiber | Common Crawl |
|---|---|
| Abrufart | Indexabruf |
| Zweck | Erzeugt das offene Common-Crawl-Archiv, das viele Anbieter als Trainingsquelle nutzen. Indirekter Trainingsabruf.producing and maintaining an open repository of web crawl data that is universally accessible |
| User-Agent | CCBot/2.0 (https://commoncrawl.org/faq/) (laut Dokumentation)Im Zeitraum kein Treffer auf patrickstolp.de. |
| robots.txt-Token | CCBot |
| IP-Liste veröffentlicht | ja: https://index.commoncrawl.org/ccbot.json (Stand der Liste 11.08.2026, abgerufen am 08.09.2026) JSON (ipv4Prefix/ipv6Prefix), zusätzlich Reverse DNS empfohlen |
| IP-Verifikation | Abgleich der Absender-IP gegen die veröffentlichte Liste (Stand der Liste 11.08.2026, abgerufen am 08.09.2026) |
| beachtet robots.txt (dokumentiert) | ja, laut Dokumentation Common Crawl nennt Disallow für CCBot als Sperrweg. Daneben führt Common Crawl den Opt-Out Ledger (vormals Opt-Out Registry, angekündigt 17.09.2025): ein rechtlicher Ausschlussmechanismus, kein technisches Crawl-Signal und keine garantierte Löschung fremder Kopien. |
| Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026) | kein Treffer im Zeitraum |
| Wirkung des Blockierens |
|
| Primärquelle | CCBot |
| geprüft am |
Wie sperrst Du weitere Abrufe?
Abschnitt betitelt „Wie sperrst Du weitere Abrufe?“Common Crawl nennt diese robots.txt-Gruppe als Ausschluss für die gesamte Website:
User-agent: CCBot
Disallow: /Das Beispiel stammt aus der Betreiberdokumentation. Wenn Du nur bestimmte Pfade ausschließen möchtest, prüfe die vollständige Datei im robots.txt-Tester. Eine eigene Bot-Gruppe übernimmt nicht zusätzlich die Regeln der Stern-Gruppe. Benötigte Pfadsperren gehören deshalb in die passende Gruppe. Grundlage ist RFC 9309.
Verhindert die Sperre jede spätere Trainingsnutzung?
Abschnitt betitelt „Verhindert die Sperre jede spätere Trainingsnutzung?“Eine CCBot-Regel allein trägt diese Schlussfolgerung nicht. Sie richtet sich an den Abruf durch CCBot. Ob eine frühere Fassung bereits erfasst oder an anderer Stelle gespeichert wurde, beantwortet sie nicht. Ebenso wenig kontrolliert sie andere Crawler und Datenquellen.
Für Deine Prüfung sind deshalb drei Schritte auseinanderzuhalten: der Abruf einer Seite, ihre Aufnahme in einen Datenbestand und die spätere Verwendung dieses Bestands. Ein Nachweis für den ersten Schritt belegt nicht automatisch die beiden folgenden. Umgekehrt macht eine neu gesetzte Abrufregel frühere Vorgänge nicht ungeschehen.
Common Crawl veröffentlicht daneben ein Opt-Out Ledger. Es dokumentiert erhaltene rechtliche Ausschlussanfragen und soll auch nachgelagerte Datennutzer darüber informieren. Das ist ein anderer Vorgang als die technische Auswertung Deiner robots.txt und kein Nachweis, dass sämtliche fremden Kopien entfernt wurden.
Wie erkennst Du echte CCBot-Abrufe?
Abschnitt betitelt „Wie erkennst Du echte CCBot-Abrufe?“Common Crawl warnt vor fremden Clients, die dieselbe Kennung verwenden. Für die Herkunftsprüfung stehen eine IP-Liste und für IPv4 eine DNS-Prüfung zur Verfügung. Dabei wird die Adresse zum Hostnamen und der Hostname zurück zur ursprünglichen Adresse aufgelöst. Für IPv6 nennt der Betreiber derzeit keine entsprechende Reverse-DNS-Unterstützung. Die Prüfung erklärt die CCBot-Dokumentation.
Halte Kennung, Absenderadresse, Abrufzeitpunkt und Listenstand gemeinsam fest. Damit kannst Du später nachvollziehen, worauf Deine Zuordnung beruht.
Habe ich CCBot auf patrickstolp.de beobachtet?
Abschnitt betitelt „Habe ich CCBot auf patrickstolp.de beobachtet?“In der ausgewerteten Logdatei vom 7. und 8. September 2026 gab es keinen Treffer mit CCBot-Kennung. Für diesen Ausschnitt kann ich deshalb keinen eigenen Abruf beschreiben.
Daraus folgt nicht, dass meine Website noch nie von Common Crawl erfasst wurde. Die Auswertung deckt zwei Tage ab und durchsucht kein Archiv. Die Crawler-Übersicht erklärt den Umfang der Beobachtung.
Primärquellen
- CCBot · Common Crawl · abgerufen am · Betreiberregel ohne ausgewiesenes Publikationsdatum, keine empirische Stichprobe: offenes Web-Crawl-Archiv, User-Agent CCBot/2.0, Sperrgruppe für robots.txt, Warnung vor fremden CCBot-Kennungen, dedizierte IPs und vorwärts bestätigtes Reverse DNS für IPv4 (für IPv6 laut Betreiber noch nicht); aus der robots.txt-Regel folgt keine Zusage über den Ausschluss sämtlicher Drittverwendungen
- Veröffentlichte IP-Bereiche (CCBot) · Common Crawl · abgerufen am · Nur Herkunftsprüfung, keine Archiv- oder Trainingsaussage: creationTime der Liste 11.08.2026, fünf Präfixe (vier IPv4, eines IPv6)
- Common Crawl Foundation Opt-Out Registry · Common Crawl Foundation · abgerufen am · Betreiberankündigung vom 17.09.2025, keine empirische Stichprobe: heute Opt-Out Ledger genannt; veröffentlicht erhaltene rechtliche Ausschlussanfragen und informiert nachgelagerte Datennutzer; rechtlicher Ausschlussmechanismus, kein technisches Crawl-Signal und keine garantierte Löschung fremder Kopien
- RFC 9309: Robots Exclusion Protocol · IETF (Koster, Illyes, Zeller, Sassman, September 2022) · abgerufen am · Normativer Standard: Gruppenauswahl und Pfadregeln in der robots.txt (Abschnitt 2.2.1); daraus folgt keine Wirkung auf Drittverwendung oder Löschung
- Eigene Auswertung der Zugriffslogs von patrickstolp.de (Auswertung v3) · Patrick Stolp · abgerufen am · Eigene, nicht veröffentlichte Datengrundlage, 07.–08.09.2026: 2.578 Logzeilen, keine CCBot-Kennung im Zeitraum; der fehlende Treffer belegt nicht, dass die Website nie erfasst wurde oder nichts im Archiv liegt
Verwandte Referenzen
Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz