Zum Inhalt springen

Google-Extended: Training und Grounding steuern

Geprüft am Autor Patrick StolpVeröffentlicht

Google-Extended ist ein Steuer-Token in der robots.txt. Er legt fest, ob Google bereits gecrawlte Inhalte für bestimmte Gemini-Anwendungen nutzen darf. Einen eigenen Crawler mit dieser Kennung gibt es laut Google-Dokumentation nicht; die Seitenabrufe erfolgen mit bestehenden Google-User-Agents.

Stand geprüft am 08.09.2026 aus der Dokumentation von Google und eigener Logprüfung (07.–08.09.2026).

BetreiberGoogle
AbrufartSteuer-Token ohne eigenen Bot
ZweckSteuert, ob von Google gecrawlte Inhalte für das Training künftiger Gemini-Generationen (Gemini Apps, Vertex AI) und für Grounding dort verwendet werden dürfen. Der Abruf selbst läuft über bestehende Google-User-Agents.
Google-Extended doesn't have a separate HTTP request user agent string. Crawling is done with existing Google user agent strings
User-AgentMozilla/5.0 (compatible; Google-Extended/1.0; +http://www.google.com/bot.html) (beobachtet in den Logs von patrickstolp.de)
Google dokumentiert: kein eigener User-Agent-String. Zu einem Treffer mit „Google-Extended“ im User-Agent gibt es keinen dokumentierten eigenen Google-Extended-Crawler; die Herkunft dieser Treffer ist dadurch nicht bestätigt (5 von 5 im Zeitraum).
robots.txt-TokenGoogle-Extended
IP-Liste veröffentlichtListe des abrufenden Crawlers: https://developers.google.com/static/crawling/ipranges/common-crawlers.json (Stand der Liste 07.09.2026, abgerufen am 08.09.2026)
JSON (ipv4Prefix/ipv6Prefix); Liste der Common Crawlers, da der Abruf über Googlebot läuft
Keine eigene Google-Extended-IP-Liste: Die Liste der Common Crawlers prüft die Herkunft von Google-Abrufen und verifiziert keinen Extended-Crawler. Alte URL /static/search/apis/ipranges/googlebot.json liefert identischen Inhalt.
IP-Verifikationentfällt: kein eigener dokumentierter Abruf unter diesem Token; die veröffentlichte Liste gehört zum abrufenden Crawler
beachtet robots.txt (dokumentiert)ja, laut Dokumentation
Als Produkt-Token in robots.txt ausgewertet.
Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026)5 Kennungstreffer, kein eigener dokumentierter Abruf unter diesem Token; 5 der 5 mit Scanner-Mustern (überlappende Zählung)
Scanner-Muster werden über alle Kennungstreffer gezählt, nicht nur über die IP-verifizierten.
Wirkung des Blockierens
Trainingsabruf
Inhalte werden nicht für das Training künftiger Gemini-Generationen für Gemini Apps und die Vertex AI API und nicht für Grounding in Gemini Apps und in „Grounding with Google Search“ auf Vertex AI verwendet. Das Token ist keine globale Sperre für jeden Gemini-Einsatz.
Suchabruf
Keine Wirkung auf die Aufnahme in die Google-Suche und kein Rankingsignal. Zitat: „Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search.“ Das Token trennt nicht automatisch zwischen klassischer Suche und AI Overviews; Steuerung für die KI-Funktionen der Suche siehe /referenz/steuerung/.
Nutzerabruf
Nicht zutreffend.
PrimärquelleGoogle's common crawlers
geprüft am

Google nennt zwei Bereiche: das Training künftiger Gemini-Modelle für Gemini Apps und die Vertex AI API sowie Grounding in Gemini Apps und in „Grounding with Google Search“ auf Vertex AI. Mit Grounding ist hier gemeint, dem Modell bei einer Anfrage Inhalte aus dem Suchindex als zusätzliche Grundlage bereitzustellen. Diese Abgrenzung steht in der Beschreibung des Tokens.

Der Name ist deshalb keine pauschale Einstellung für alles, was Google mit KI anbietet. Besonders die KI-Funktionen innerhalb der Google-Suche musst Du getrennt betrachten.

Wenn Du die vom Token erfasste Nutzung für sämtliche Pfade ausschließen möchtest, lautet die Gruppe:

User-agent: Google-Extended
Disallow: /

Du kannst die Zuordnung eines Pfads im robots.txt-Tester prüfen. Bei diesem Token beschreibt das Ergebnis die Regel zur Inhaltsnutzung. Es bedeutet nicht, dass Googlebot die Seite nicht mehr abrufen darf.

Prüfe Googlebot und Google-Extended deshalb getrennt. Ein erlaubter Googlebot-Abruf neben einer ausschließenden Extended-Regel ist kein Widerspruch, sondern kann genau Deiner beabsichtigten Einstellung entsprechen.

Schaltet die Regel AI Overviews oder den KI-Modus ab?

Abschnitt betitelt „Schaltet die Regel AI Overviews oder den KI-Modus ab?“

Für die KI-Funktionen der Suche verweist Google auf Googlebot sowie die Regeln zur Indexierung und Vorschau. Dazu gehören nosnippet, data-nosnippet, max-snippet und noindex. Google-Extended betrifft dagegen die oben beschriebenen Nutzungen in anderen Systemen. Quelle ist Googles Dokumentation zu KI-Funktionen und Websites.

Welche dieser Einstellungen zu Deinem Ziel passt, hängt davon ab, ob Du einen Abruf, die Indexierung oder die Darstellung von Inhalten beeinflussen möchtest. Die Referenz zur Inhaltssteuerung trennt diese Aufgaben. Eine Extended-Regel allein ist kein Ausschluss aus AI Overviews oder dem KI-Modus.

Was bedeutet Google-Extended in einem Zugriffslog?

Abschnitt betitelt „Was bedeutet Google-Extended in einem Zugriffslog?“

In meinen Logs von patrickstolp.de vom 7. und 8. September 2026 gab es fünf Treffer, deren User-Agent Google-Extended enthielt. Alle fünf betrafen typische Scanner-Pfade. Diese Kennungen passen nicht zu einem dokumentierten eigenen Google-Extended-Crawler und bestätigen keine Herkunft von Google.

Eigene Beobachtung: Zugriffslogs von patrickstolp.de, 07.–08.09.2026

Der IP-Abgleich vergleicht die Absender-IP mit den veröffentlichten Listen der Betreiber, abgerufen am 08.09.2026. Zugriffe auf typische Scan-Ziele wie /.aws/credentials oder /.env werden zusätzlich gezählt und überschneiden sich mit den übrigen Gruppen. Solche Pfade allein beweisen keine gefälschte Kennung. 2.578 Logzeilen an 2 Tagen. Es werden keine IP-Adressen ausgegeben.

Zeitraum07.–08.09.2026
Treffer mit Kennung Google-Extended5
IP-Abgleich0 von 5 (kein eigener dokumentierter Abruf)
mit Scanner-Pfaden (überlappende Zählung über alle Kennungstreffer)5
eindeutige Absender-IPs1 (nur gezählt)
Statuscodes2xx 0 · 3xx 1 · 4xx 0 · 5xx 0 · sonstige/fehlend 4
Abrufe von /robots.txt0
Abrufe von /llms.txt0
Treffer auf Pfade, die im gespeicherten robots.txt-Stand gesperrt sind0
häufigste Pfade (nur IP-verifiziert)

Die Zahlen beschreiben Zugriffe auf eine einzelne Website. Sie zeigen weder, wie häufig die Bots im gesamten Web auftreten, noch ob abgerufene Inhalte in KI-Antworten verwendet wurden. Der robots.txt-Abgleich nutzt einen gespeicherten Stand; daraus lässt sich kein damaliger Regelverstoß ableiten. Ausgewertet am 08.09.2026.

Auch reguläre Google-Abrufe zeigen nicht, ob die Inhalte später für Training oder Grounding verwendet wurden. Ein Zugriffslog dokumentiert Anfragen an den Server. Die nachgelagerte Nutzung liegt außerhalb dieses Ausschnitts.

Primärquellen

  1. List of Google's common crawlers · Google · abgerufen am · Betreiberdokumentation mit Stand 14.07.2026, keine empirische Stichprobe: kein eigener HTTP-User-Agent, der Abruf läuft über bestehende Google-Kennungen; das Token steuert das Training künftiger Gemini-Generationen für Gemini Apps und die Vertex AI API sowie Grounding in Gemini Apps und in „Grounding with Google Search“ auf Vertex AI; keine Wirkung auf die Suchaufnahme und kein Rankingsignal
  2. AI Features and Your Website · Google · abgerufen am · Betreiberregel mit Stand 10.12.2025, keine empirische Stichprobe: Googlebot steuert den Suchabruf, nosnippet, data-nosnippet, max-snippet und noindex steuern angezeigte Inhalte, Google-Extended das Training und Grounding anderer Systeme; das Token trennt nicht automatisch zwischen klassischer Suche und AI Overviews
  3. RFC 9309: Robots Exclusion Protocol · IETF (Koster, Illyes, Zeller, Sassman, September 2022) · abgerufen am · Normativer Standard: Gruppenauswahl und Regelauswertung in der robots.txt; die produktspezifische Nutzungswirkung eines Tokens stammt vom Betreiber, nicht aus dem RFC
  4. Eigene Auswertung der Zugriffslogs von patrickstolp.de (Auswertung v3) · Patrick Stolp · abgerufen am · Eigene, nicht veröffentlichte Datengrundlage, 07.–08.09.2026: 2.578 Logzeilen, fünf Treffer mit Google-Extended-Kennung, alle mit Scanner-Mustern und ohne zugeordnete eigene IP-Liste; die Herkunft dieser Treffer ist nicht bestätigt, eine Trainings- oder Grounding-Nutzung folgt daraus nicht

Verwandte Referenzen

Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz