Google-Extended: Training und Grounding steuern
Google-Extended ist ein Steuer-Token in der robots.txt. Er legt fest, ob Google bereits gecrawlte Inhalte für bestimmte Gemini-Anwendungen nutzen darf. Einen eigenen Crawler mit dieser Kennung gibt es laut Google-Dokumentation nicht; die Seitenabrufe erfolgen mit bestehenden Google-User-Agents.
Stand geprüft am 08.09.2026 aus der Dokumentation von Google und eigener Logprüfung (07.–08.09.2026).
| Betreiber | |
|---|---|
| Abrufart | Steuer-Token ohne eigenen Bot |
| Zweck | Steuert, ob von Google gecrawlte Inhalte für das Training künftiger Gemini-Generationen (Gemini Apps, Vertex AI) und für Grounding dort verwendet werden dürfen. Der Abruf selbst läuft über bestehende Google-User-Agents.Google-Extended doesn't have a separate HTTP request user agent string. Crawling is done with existing Google user agent strings |
| User-Agent | Mozilla/5.0 (compatible; Google-Extended/1.0; +http://www.google.com/bot.html) (beobachtet in den Logs von patrickstolp.de)Google dokumentiert: kein eigener User-Agent-String. Zu einem Treffer mit „Google-Extended“ im User-Agent gibt es keinen dokumentierten eigenen Google-Extended-Crawler; die Herkunft dieser Treffer ist dadurch nicht bestätigt (5 von 5 im Zeitraum). |
| robots.txt-Token | Google-Extended |
| IP-Liste veröffentlicht | Liste des abrufenden Crawlers: https://developers.google.com/static/crawling/ipranges/common-crawlers.json (Stand der Liste 07.09.2026, abgerufen am 08.09.2026) JSON (ipv4Prefix/ipv6Prefix); Liste der Common Crawlers, da der Abruf über Googlebot läuft Keine eigene Google-Extended-IP-Liste: Die Liste der Common Crawlers prüft die Herkunft von Google-Abrufen und verifiziert keinen Extended-Crawler. Alte URL /static/search/apis/ipranges/googlebot.json liefert identischen Inhalt. |
| IP-Verifikation | entfällt: kein eigener dokumentierter Abruf unter diesem Token; die veröffentlichte Liste gehört zum abrufenden Crawler |
| beachtet robots.txt (dokumentiert) | ja, laut Dokumentation Als Produkt-Token in robots.txt ausgewertet. |
| Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026) | 5 Kennungstreffer, kein eigener dokumentierter Abruf unter diesem Token; 5 der 5 mit Scanner-Mustern (überlappende Zählung) Scanner-Muster werden über alle Kennungstreffer gezählt, nicht nur über die IP-verifizierten. |
| Wirkung des Blockierens |
|
| Primärquelle | Google's common crawlers |
| geprüft am |
Welche Nutzung betrifft Google-Extended?
Abschnitt betitelt „Welche Nutzung betrifft Google-Extended?“Google nennt zwei Bereiche: das Training künftiger Gemini-Modelle für Gemini Apps und die Vertex AI API sowie Grounding in Gemini Apps und in „Grounding with Google Search“ auf Vertex AI. Mit Grounding ist hier gemeint, dem Modell bei einer Anfrage Inhalte aus dem Suchindex als zusätzliche Grundlage bereitzustellen. Diese Abgrenzung steht in der Beschreibung des Tokens.
Der Name ist deshalb keine pauschale Einstellung für alles, was Google mit KI anbietet. Besonders die KI-Funktionen innerhalb der Google-Suche musst Du getrennt betrachten.
Wie sieht die robots.txt-Regel aus?
Abschnitt betitelt „Wie sieht die robots.txt-Regel aus?“Wenn Du die vom Token erfasste Nutzung für sämtliche Pfade ausschließen möchtest, lautet die Gruppe:
User-agent: Google-Extended
Disallow: /Du kannst die Zuordnung eines Pfads im robots.txt-Tester prüfen. Bei diesem Token beschreibt das Ergebnis die Regel zur Inhaltsnutzung. Es bedeutet nicht, dass Googlebot die Seite nicht mehr abrufen darf.
Prüfe Googlebot und Google-Extended deshalb getrennt. Ein erlaubter Googlebot-Abruf neben einer ausschließenden Extended-Regel ist kein Widerspruch, sondern kann genau Deiner beabsichtigten Einstellung entsprechen.
Schaltet die Regel AI Overviews oder den KI-Modus ab?
Abschnitt betitelt „Schaltet die Regel AI Overviews oder den KI-Modus ab?“Für die KI-Funktionen der Suche verweist Google auf Googlebot sowie die Regeln zur Indexierung und Vorschau. Dazu gehören nosnippet, data-nosnippet, max-snippet und noindex. Google-Extended betrifft dagegen die oben beschriebenen Nutzungen in anderen Systemen. Quelle ist Googles Dokumentation zu KI-Funktionen und Websites.
Welche dieser Einstellungen zu Deinem Ziel passt, hängt davon ab, ob Du einen Abruf, die Indexierung oder die Darstellung von Inhalten beeinflussen möchtest. Die Referenz zur Inhaltssteuerung trennt diese Aufgaben. Eine Extended-Regel allein ist kein Ausschluss aus AI Overviews oder dem KI-Modus.
Was bedeutet Google-Extended in einem Zugriffslog?
Abschnitt betitelt „Was bedeutet Google-Extended in einem Zugriffslog?“In meinen Logs von patrickstolp.de vom 7. und 8. September 2026 gab es fünf Treffer, deren User-Agent Google-Extended enthielt. Alle fünf betrafen typische Scanner-Pfade. Diese Kennungen passen nicht zu einem dokumentierten eigenen Google-Extended-Crawler und bestätigen keine Herkunft von Google.
Eigene Beobachtung: Zugriffslogs von patrickstolp.de, 07.–08.09.2026
Der IP-Abgleich vergleicht die Absender-IP mit den veröffentlichten Listen der Betreiber, abgerufen am 08.09.2026. Zugriffe auf typische Scan-Ziele wie /.aws/credentials oder /.env werden zusätzlich gezählt und überschneiden sich mit den übrigen Gruppen. Solche Pfade allein beweisen keine gefälschte Kennung. 2.578 Logzeilen an 2 Tagen. Es werden keine IP-Adressen ausgegeben.
| Zeitraum | 07.–08.09.2026 |
|---|---|
| Treffer mit Kennung Google-Extended | 5 |
| IP-Abgleich | 0 von 5 (kein eigener dokumentierter Abruf) |
| mit Scanner-Pfaden (überlappende Zählung über alle Kennungstreffer) | 5 |
| eindeutige Absender-IPs | 1 (nur gezählt) |
| Statuscodes | 2xx 0 · 3xx 1 · 4xx 0 · 5xx 0 · sonstige/fehlend 4 |
| Abrufe von /robots.txt | 0 |
| Abrufe von /llms.txt | 0 |
| Treffer auf Pfade, die im gespeicherten robots.txt-Stand gesperrt sind | 0 |
| häufigste Pfade (nur IP-verifiziert) | – |
Die Zahlen beschreiben Zugriffe auf eine einzelne Website. Sie zeigen weder, wie häufig die Bots im gesamten Web auftreten, noch ob abgerufene Inhalte in KI-Antworten verwendet wurden. Der robots.txt-Abgleich nutzt einen gespeicherten Stand; daraus lässt sich kein damaliger Regelverstoß ableiten. Ausgewertet am 08.09.2026.
Auch reguläre Google-Abrufe zeigen nicht, ob die Inhalte später für Training oder Grounding verwendet wurden. Ein Zugriffslog dokumentiert Anfragen an den Server. Die nachgelagerte Nutzung liegt außerhalb dieses Ausschnitts.
- Applebot-Extended: Die Nutzung für KI-Training steuern
Steuert, ob von Applebot gecrawlte Inhalte für das Training der Apple-Foundation-Modelle verwendet werden.
Token
Applebot-Extended· Steuer-Token ohne eigenen Bot
Primärquellen
- List of Google's common crawlers · Google · abgerufen am · Betreiberdokumentation mit Stand 14.07.2026, keine empirische Stichprobe: kein eigener HTTP-User-Agent, der Abruf läuft über bestehende Google-Kennungen; das Token steuert das Training künftiger Gemini-Generationen für Gemini Apps und die Vertex AI API sowie Grounding in Gemini Apps und in „Grounding with Google Search“ auf Vertex AI; keine Wirkung auf die Suchaufnahme und kein Rankingsignal
- AI Features and Your Website · Google · abgerufen am · Betreiberregel mit Stand 10.12.2025, keine empirische Stichprobe: Googlebot steuert den Suchabruf, nosnippet, data-nosnippet, max-snippet und noindex steuern angezeigte Inhalte, Google-Extended das Training und Grounding anderer Systeme; das Token trennt nicht automatisch zwischen klassischer Suche und AI Overviews
- RFC 9309: Robots Exclusion Protocol · IETF (Koster, Illyes, Zeller, Sassman, September 2022) · abgerufen am · Normativer Standard: Gruppenauswahl und Regelauswertung in der robots.txt; die produktspezifische Nutzungswirkung eines Tokens stammt vom Betreiber, nicht aus dem RFC
- Eigene Auswertung der Zugriffslogs von patrickstolp.de (Auswertung v3) · Patrick Stolp · abgerufen am · Eigene, nicht veröffentlichte Datengrundlage, 07.–08.09.2026: 2.578 Logzeilen, fünf Treffer mit Google-Extended-Kennung, alle mit Scanner-Mustern und ohne zugeordnete eigene IP-Liste; die Herkunft dieser Treffer ist nicht bestätigt, eine Trainings- oder Grounding-Nutzung folgt daraus nicht
Verwandte Referenzen
Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz