Zum Inhalt springen

GPTBot: OpenAIs Trainingscrawler und seine Steuerung

Geprüft am Autor Patrick StolpVeröffentlicht

GPTBot ruft Webinhalte ab, die OpenAI für das Training seiner Modelle verwenden kann. Ein Zugriff ist damit noch kein Beleg, dass die abgerufenen Inhalte tatsächlich in einen Trainingsdatensatz aufgenommen wurden.

Stand geprüft am 08.09.2026 aus der Dokumentation von OpenAI und eigener Logprüfung (07.–08.09.2026).

BetreiberOpenAI
AbrufartTrainingsabruf
ZweckRuft Webinhalte ab, die OpenAI für das Training seiner Modelle verwenden kann.
used to make our generative AI foundation models more useful and safe
User-AgentMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot (laut Dokumentation)
OpenAI kann beim Abruf der robots.txt einen zusätzlichen Marker in der Kennung verwenden.
robots.txt-TokenGPTBot
IP-Liste veröffentlichtja: https://openai.com/gptbot.json (Stand der Liste 30.10.2025, abgerufen am 08.09.2026)
JSON (ipv4Prefix)
IP-VerifikationAbgleich der Absender-IP gegen die veröffentlichte Liste (Stand der Liste 30.10.2025, abgerufen am 08.09.2026)
beachtet robots.txt (dokumentiert)ja, laut Dokumentation
Disallow für GPTBot signalisiert laut OpenAI, dass Inhalte nicht für das Training verwendet werden sollen.
Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026)4 von 29 Kennungstreffern IP-verifiziert; 23 der 29 mit Scanner-Mustern (überlappende Zählung)
Scanner-Muster werden über alle Kennungstreffer gezählt, nicht nur über die IP-verifizierten.
Wirkung des Blockierens
Trainingsabruf
robots.txt steuert künftige GPTBot-Abrufe; eine nachträgliche Regel macht eine bereits erfolgte Modellnutzung nicht rückgängig.
Suchabruf
Kein allgemeiner Suchausschluss; OAI-SearchBot wird separat gesteuert.
Nutzerabruf
ChatGPT-User wird separat beurteilt.
PrimärquelleOverview of OpenAI Crawlers
geprüft am

Prüfe neben der Kennung mit GPTBot auch die Absender-IP gegen die von OpenAI veröffentlichten GPTBot-Bereiche. Der User-Agent allein reicht zur Zuordnung nicht aus, weil ein anderer Client denselben Namen senden kann.

Die vollständige Beispielkennung steht im Steckbrief. Versionsnummern können sich ändern; beim Abruf der robots.txt kann ein zusätzlicher Marker hinzukommen. Die OpenAI-Dokumentation beschreibt diese Varianten.

Wie wichtig der zusätzliche IP-Abgleich ist, zeigt auch das Crawler-Experiment von Metehan Yesilyurt vom 4. März 2026. Für seine Website mit 60.000 generierten Seiten ergänzte er die Erkennung anhand des User-Agents um einen Vergleich mit OpenAIs IP-Bereichen. Seine Abrufzahlen stammen allerdings aus einer anderen Website und mehreren Messphasen. Ich verwende sie deshalb nicht als Erwartungswert dafür, wie häufig GPTBot eine gewöhnliche Website besucht.

In den Zugriffslogs vom 7. und 8. September 2026 standen 29 Einträge mit GPTBot-Kennung. Vier davon kamen aus den veröffentlichten GPTBot-IP-Bereichen; 25 lagen außerhalb dieser Liste. Bei 23 der insgesamt 29 Kennungstreffer wurden typische Scanner-Pfade angefragt. Das ist eine gesonderte Zählung und keine zusätzliche Gruppe.

Die vier per IP bestätigten Zugriffe betrafen zweimal die Startseite und zweimal /sitemap_index.xml. In diesem Ausschnitt ist damit kein Abruf eines einzelnen Fachartikels durch GPTBot belegt.

Eigene Beobachtung: Zugriffslogs von patrickstolp.de, 07.–08.09.2026

Der IP-Abgleich vergleicht die Absender-IP mit den veröffentlichten Listen der Betreiber, abgerufen am 08.09.2026. Zugriffe auf typische Scan-Ziele wie /.aws/credentials oder /.env werden zusätzlich gezählt und überschneiden sich mit den übrigen Gruppen. Solche Pfade allein beweisen keine gefälschte Kennung. 2.578 Logzeilen an 2 Tagen. Es werden keine IP-Adressen ausgegeben.

Zeitraum07.–08.09.2026
Treffer mit Kennung GPTBot29
IP-Abgleich4 von 29
mit Scanner-Pfaden (überlappende Zählung über alle Kennungstreffer)23
eindeutige Absender-IPs4 (nur gezählt)
Statuscodes2xx 3 · 3xx 6 · 4xx 2 · 5xx 0 · sonstige/fehlend 18
Abrufe von /robots.txt0
Abrufe von /llms.txt0
Treffer auf Pfade, die im gespeicherten robots.txt-Stand gesperrt sind0
häufigste Pfade (nur IP-verifiziert)/sitemap_index.xml (2)
/ (2)

Die Zahlen beschreiben Zugriffe auf eine einzelne Website. Sie zeigen weder, wie häufig die Bots im gesamten Web auftreten, noch ob abgerufene Inhalte in KI-Antworten verwendet wurden. Der robots.txt-Abgleich nutzt einen gespeicherten Stand; daraus lässt sich kein damaliger Regelverstoß ableiten. Ausgewertet am 08.09.2026.

Im beobachteten Zeitraum gab es unter dieser Kennung keinen Abruf von /robots.txt. Daraus folgt nicht, dass GPTBot die Regeln ignoriert hat: Der Ausschnitt enthält weder die vollständige vorherige Abrufhistorie noch Angaben dazu, welche gespeicherte Fassung der Bot verwendet hat.

Die gesamte Crawler-Auswertung erklärt den IP-Abgleich und die Grenzen dieser Beobachtung. Weder eine Trainingsnutzung noch eine spätere Zitation lässt sich aus den vier bestätigten Zugriffen ablesen.

Für die vollständige Sperre lautet die Gruppe:

User-agent: GPTBot
Disallow: /

Wenn Du ausschließlich den Bereich /artikel/ freigeben möchtest, lautet sie stattdessen:

User-agent: GPTBot
Allow: /artikel/
Disallow: /

Die längere passende Freigabe lässt Abrufe unter /artikel/ zu. Andere Pfade bleiben durch Disallow: / ausgeschlossen. Diese Auswertung folgt RFC 9309, Abschnitt 2.2.2.

Verwende die Variante, die Deiner Entscheidung entspricht, und prüfe danach die vollständige Datei im robots.txt-Tester. Bereits vorhandene Gruppen und Ausnahmen gehören in diese Prüfung hinein.

Eine GPTBot-Regel ist kein allgemeiner Ausschluss aus ChatGPT. OpenAI unterscheidet GPTBot für mögliche Trainingsinhalte, OAI-SearchBot für die Suche und ChatGPT-User für bestimmte Nutzeraktionen. Diese Zuordnung ist in der Botdokumentation beschrieben.

Wenn Dein Ziel die Steuerung der Suche ist, musst Du deshalb die Regeln für OAI-SearchBot betrachten. Bei einem durch eine Nutzeraktion ausgelösten Abruf gelten die dokumentierten Besonderheiten von ChatGPT-User. Umgekehrt garantiert eine Freigabe für GPTBot weder eine Nennung noch einen Quellenlink.

Eine nachträglich geänderte robots.txt macht auch kein bereits erfolgtes Training rückgängig. Sie enthält Abrufregeln, keine Anweisung zum nachträglichen Löschen von Modellwissen.

Primärquellen

  1. Overview of OpenAI Crawlers · OpenAI · abgerufen am · Zweck, Token, User-Agent und robots.txt-Zusage; GPTBot, OAI-SearchBot und ChatGPT-User sind getrennt dokumentiert
  2. Veröffentlichte IP-Bereiche (GPTBot) · OpenAI · abgerufen am · Stand der Liste 30.10.2025; Abgleichskriterium für die Kennung, keine Aussage über Trainingsnutzung
  3. Crawler-Experiment mit 60.000 generierten Seiten (StateGlobe.com) · Metehan Yesilyurt, 04.03.2026 · abgerufen am · Methodischer Bezug: Kennung zusammen mit IP-Prüfung; die Abrufzahlen stammen von einer anderen Website und aus mehreren Messphasen und sind kein Erwartungswert
  4. RFC 9309: Robots Exclusion Protocol · IETF (Koster u. a., September 2022) · abgerufen am · Auswertung der längsten passenden Regel (Abschnitt 2.2.2); robots.txt enthält keine Anweisung zum Löschen bereits trainierter Modellgewichte

Verwandte Referenzen

Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz