GPTBot: OpenAIs Trainingscrawler und seine Steuerung
GPTBot ruft Webinhalte ab, die OpenAI für das Training seiner Modelle verwenden kann. Ein Zugriff ist damit noch kein Beleg, dass die abgerufenen Inhalte tatsächlich in einen Trainingsdatensatz aufgenommen wurden.
Stand geprüft am 08.09.2026 aus der Dokumentation von OpenAI und eigener Logprüfung (07.–08.09.2026).
| Betreiber | OpenAI |
|---|---|
| Abrufart | Trainingsabruf |
| Zweck | Ruft Webinhalte ab, die OpenAI für das Training seiner Modelle verwenden kann.used to make our generative AI foundation models more useful and safe |
| User-Agent | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot (laut Dokumentation)OpenAI kann beim Abruf der robots.txt einen zusätzlichen Marker in der Kennung verwenden. |
| robots.txt-Token | GPTBot |
| IP-Liste veröffentlicht | ja: https://openai.com/gptbot.json (Stand der Liste 30.10.2025, abgerufen am 08.09.2026) JSON (ipv4Prefix) |
| IP-Verifikation | Abgleich der Absender-IP gegen die veröffentlichte Liste (Stand der Liste 30.10.2025, abgerufen am 08.09.2026) |
| beachtet robots.txt (dokumentiert) | ja, laut Dokumentation Disallow für GPTBot signalisiert laut OpenAI, dass Inhalte nicht für das Training verwendet werden sollen. |
| Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026) | 4 von 29 Kennungstreffern IP-verifiziert; 23 der 29 mit Scanner-Mustern (überlappende Zählung) Scanner-Muster werden über alle Kennungstreffer gezählt, nicht nur über die IP-verifizierten. |
| Wirkung des Blockierens |
|
| Primärquelle | Overview of OpenAI Crawlers |
| geprüft am |
Wie erkennst Du GPTBot in Deinen Server-Logs?
Abschnitt betitelt „Wie erkennst Du GPTBot in Deinen Server-Logs?“Prüfe neben der Kennung mit GPTBot auch die Absender-IP gegen die von OpenAI veröffentlichten GPTBot-Bereiche. Der User-Agent allein reicht zur Zuordnung nicht aus, weil ein anderer Client denselben Namen senden kann.
Die vollständige Beispielkennung steht im Steckbrief. Versionsnummern können sich ändern; beim Abruf der robots.txt kann ein zusätzlicher Marker hinzukommen. Die OpenAI-Dokumentation beschreibt diese Varianten.
Wie wichtig der zusätzliche IP-Abgleich ist, zeigt auch das Crawler-Experiment von Metehan Yesilyurt vom 4. März 2026. Für seine Website mit 60.000 generierten Seiten ergänzte er die Erkennung anhand des User-Agents um einen Vergleich mit OpenAIs IP-Bereichen. Seine Abrufzahlen stammen allerdings aus einer anderen Website und mehreren Messphasen. Ich verwende sie deshalb nicht als Erwartungswert dafür, wie häufig GPTBot eine gewöhnliche Website besucht.
Was habe ich auf patrickstolp.de beobachtet?
Abschnitt betitelt „Was habe ich auf patrickstolp.de beobachtet?“In den Zugriffslogs vom 7. und 8. September 2026 standen 29 Einträge mit GPTBot-Kennung. Vier davon kamen aus den veröffentlichten GPTBot-IP-Bereichen; 25 lagen außerhalb dieser Liste. Bei 23 der insgesamt 29 Kennungstreffer wurden typische Scanner-Pfade angefragt. Das ist eine gesonderte Zählung und keine zusätzliche Gruppe.
Die vier per IP bestätigten Zugriffe betrafen zweimal die Startseite und zweimal /sitemap_index.xml. In diesem Ausschnitt ist damit kein Abruf eines einzelnen Fachartikels durch GPTBot belegt.
Eigene Beobachtung: Zugriffslogs von patrickstolp.de, 07.–08.09.2026
Der IP-Abgleich vergleicht die Absender-IP mit den veröffentlichten Listen der Betreiber, abgerufen am 08.09.2026. Zugriffe auf typische Scan-Ziele wie /.aws/credentials oder /.env werden zusätzlich gezählt und überschneiden sich mit den übrigen Gruppen. Solche Pfade allein beweisen keine gefälschte Kennung. 2.578 Logzeilen an 2 Tagen. Es werden keine IP-Adressen ausgegeben.
| Zeitraum | 07.–08.09.2026 |
|---|---|
| Treffer mit Kennung GPTBot | 29 |
| IP-Abgleich | 4 von 29 |
| mit Scanner-Pfaden (überlappende Zählung über alle Kennungstreffer) | 23 |
| eindeutige Absender-IPs | 4 (nur gezählt) |
| Statuscodes | 2xx 3 · 3xx 6 · 4xx 2 · 5xx 0 · sonstige/fehlend 18 |
| Abrufe von /robots.txt | 0 |
| Abrufe von /llms.txt | 0 |
| Treffer auf Pfade, die im gespeicherten robots.txt-Stand gesperrt sind | 0 |
| häufigste Pfade (nur IP-verifiziert) | /sitemap_index.xml (2)/ (2) |
Die Zahlen beschreiben Zugriffe auf eine einzelne Website. Sie zeigen weder, wie häufig die Bots im gesamten Web auftreten, noch ob abgerufene Inhalte in KI-Antworten verwendet wurden. Der robots.txt-Abgleich nutzt einen gespeicherten Stand; daraus lässt sich kein damaliger Regelverstoß ableiten. Ausgewertet am 08.09.2026.
Im beobachteten Zeitraum gab es unter dieser Kennung keinen Abruf von /robots.txt. Daraus folgt nicht, dass GPTBot die Regeln ignoriert hat: Der Ausschnitt enthält weder die vollständige vorherige Abrufhistorie noch Angaben dazu, welche gespeicherte Fassung der Bot verwendet hat.
Die gesamte Crawler-Auswertung erklärt den IP-Abgleich und die Grenzen dieser Beobachtung. Weder eine Trainingsnutzung noch eine spätere Zitation lässt sich aus den vier bestätigten Zugriffen ablesen.
Wie sperrst Du GPTBot mit robots.txt?
Abschnitt betitelt „Wie sperrst Du GPTBot mit robots.txt?“Für die vollständige Sperre lautet die Gruppe:
User-agent: GPTBot
Disallow: /Wenn Du ausschließlich den Bereich /artikel/ freigeben möchtest, lautet sie stattdessen:
User-agent: GPTBot
Allow: /artikel/
Disallow: /Die längere passende Freigabe lässt Abrufe unter /artikel/ zu. Andere Pfade bleiben durch Disallow: / ausgeschlossen. Diese Auswertung folgt RFC 9309, Abschnitt 2.2.2.
Verwende die Variante, die Deiner Entscheidung entspricht, und prüfe danach die vollständige Datei im robots.txt-Tester. Bereits vorhandene Gruppen und Ausnahmen gehören in diese Prüfung hinein.
Verhindert eine GPTBot-Sperre Zitate in ChatGPT?
Abschnitt betitelt „Verhindert eine GPTBot-Sperre Zitate in ChatGPT?“Eine GPTBot-Regel ist kein allgemeiner Ausschluss aus ChatGPT. OpenAI unterscheidet GPTBot für mögliche Trainingsinhalte, OAI-SearchBot für die Suche und ChatGPT-User für bestimmte Nutzeraktionen. Diese Zuordnung ist in der Botdokumentation beschrieben.
Wenn Dein Ziel die Steuerung der Suche ist, musst Du deshalb die Regeln für OAI-SearchBot betrachten. Bei einem durch eine Nutzeraktion ausgelösten Abruf gelten die dokumentierten Besonderheiten von ChatGPT-User. Umgekehrt garantiert eine Freigabe für GPTBot weder eine Nennung noch einen Quellenlink.
Eine nachträglich geänderte robots.txt macht auch kein bereits erfolgtes Training rückgängig. Sie enthält Abrufregeln, keine Anweisung zum nachträglichen Löschen von Modellwissen.
Die drei OpenAI-Abrufarten im Vergleich
Abschnitt betitelt „Die drei OpenAI-Abrufarten im Vergleich“- GPTBot: OpenAIs Trainingscrawler und seine Steuerung
Ruft Webinhalte ab, die OpenAI für das Training seiner Modelle verwenden kann.
Token
GPTBot· Trainingsabruf - OAI-SearchBot: OpenAIs Suchcrawler und seine Steuerung
Ruft Inhalte für die Suchfunktionen von ChatGPT ab.
Token
OAI-SearchBot· Suchabruf - ChatGPT-User: OpenAIs Nutzerabruf und seine Grenzen
Ruft einzelne Seiten ab, wenn eine Person in ChatGPT oder einer Custom GPT eine Frage stellt oder eine URL einfügt. Kein automatisches Crawling.
Token
ChatGPT-User· Nutzerabruf
Primärquellen
- Overview of OpenAI Crawlers · OpenAI · abgerufen am · Zweck, Token, User-Agent und robots.txt-Zusage; GPTBot, OAI-SearchBot und ChatGPT-User sind getrennt dokumentiert
- Veröffentlichte IP-Bereiche (GPTBot) · OpenAI · abgerufen am · Stand der Liste 30.10.2025; Abgleichskriterium für die Kennung, keine Aussage über Trainingsnutzung
- Crawler-Experiment mit 60.000 generierten Seiten (StateGlobe.com) · Metehan Yesilyurt, 04.03.2026 · abgerufen am · Methodischer Bezug: Kennung zusammen mit IP-Prüfung; die Abrufzahlen stammen von einer anderen Website und aus mehreren Messphasen und sind kein Erwartungswert
- RFC 9309: Robots Exclusion Protocol · IETF (Koster u. a., September 2022) · abgerufen am · Auswertung der längsten passenden Regel (Abschnitt 2.2.2); robots.txt enthält keine Anweisung zum Löschen bereits trainierter Modellgewichte
Verwandte Referenzen
Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz