Zum Inhalt springen

Meta-ExternalAgent: Abrufe für Training und Produktverbesserung

Geprüft am Autor Patrick StolpVeröffentlicht

Wenn Du Abrufe von Meta steuern möchtest, lohnt sich ein genauer Blick auf die Kennung. Meta-ExternalAgent ist für das Training grundlegender KI-Modelle und für Produktverbesserungen durch direkte Indexierung vorgesehen. Die Regel betrifft damit mehrere beschriebene Nutzungen. Gleichzeitig verwendet Meta für andere Aufgaben eigene Kennungen, sodass eine ExternalAgent-Sperre noch nicht festlegt, wie Du etwa mit Suchabrufen oder Linkvorschauen umgehen möchtest.

Stand geprüft am 08.09.2026 aus der Dokumentation von Meta und eigener Logprüfung (07.–08.09.2026).

BetreiberMeta
AbrufartTrainingsabruf
ZweckRuft Inhalte für das Training grundlegender KI-Modelle oder für die Produktverbesserung durch direkte Indexierung ab.
training foundation AI models or improving products by indexing content directly
User-Agentmeta-externalagent/1.1 (+/documentation/sharing/webmasters/web-crawlers) (laut Dokumentation)
Keine veröffentlichte IP-Liste, Abgleich nicht möglich; 9 von 11 Treffern im Zeitraum mit Scanner-Pfaden. Der beobachtete String aus den Logs vom 07.–08.09.2026 nennt noch die frühere Dokumentationsadresse.
robots.txt-Tokenmeta-externalagent
IP-Liste veröffentlichtnein
Keine IP-Liste und kein botspezifisches Verifikationsverfahren in der aktuellen Dokumentation (Stand 21.05.2026). Eine zu Meta gehörende Netzadresse erklärt nicht, welcher Dienst die Anfrage ausgelöst hat.
IP-Verifikationdieser IP-Abgleich nicht möglich: keine veröffentlichte Liste
beachtet robots.txt (dokumentiert)ja, laut Dokumentation
Meta dokumentiert die Sperre per robots.txt als vorgesehenen Weg; Änderungen können bis zu 24 Stunden zwischengespeichert bleiben.
Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026)11 Kennungstreffer, keine veröffentlichte IP-Liste für diesen Abgleich; 9 der 11 mit Scanner-Mustern (überlappende Zählung)
Scanner-Muster werden über alle Kennungstreffer gezählt, nicht nur über die IP-verifizierten.
Wirkung des Blockierens
Trainingsabruf
Inhalte werden nicht für das Training der Meta-Modelle abgerufen.
Suchabruf
Keine dokumentierte Wirkung auf meta-webindexer, der laut Meta Suchergebnisse in Meta AI versorgt.
Nutzerabruf
Keine Wirkung auf meta-externalfetcher, der laut Meta robots.txt umgehen kann.
PrimärquelleMeta Web Crawlers
geprüft am

Die aktuelle Meta-Dokumentation unterscheidet unter anderem:

Kennung Beschriebene Aufgabe
meta-externalagent KI-Training oder Produktverbesserung durch direkte Indexierung
meta-webindexer Qualität der Suchergebnisse in Meta AI verbessern
meta-externalfetcher Nutzerveranlasste Linkabrufe und agentische Funktionen
facebookexternalhit Vorschauen für geteilte Links
meta-externalads Werbe- und Geschäftsprodukte verbessern

Eine Regel für ExternalAgent sperrt diese anderen Kennungen nicht mit. Bei ExternalFetcher beschreibt Meta mögliche Ausnahmen von robots.txt, bei FacebookExternalHit Ausnahmen für Sicherheits- und Integritätsprüfungen. Übertrage die ExternalAgent-Regel deshalb nicht als allgemeine Zusage auf jeden Meta-Abruf.

User-agent: meta-externalagent
Disallow: /

Meta dokumentiert robots.txt als Steuerung und nennt eine Zwischenspeicherung von bis zu 24 Stunden. Eine Änderung muss daher nicht beim unmittelbar nächsten Abruf berücksichtigt sein. Prüfe die Gruppenzuordnung im robots.txt-Tester und kontrolliere anschließend die tatsächlichen Serverzugriffe. Eine syntaktisch passende Regel belegt deren Befolgung noch nicht.

In meiner Auswertung der Logs vom 7. und 8. September 2026 taucht die ExternalAgent-Kennung elfmal auf. Neun dieser Treffer passen zu Scanner-Mustern. Für diesen Bot lag im verwendeten Abgleich keine IP-Liste vor; die Abrufe sind darüber nicht als Meta-Zugriffe bestätigt.

Die elf Einträge könnte ich zwar problemlos als Zahl in eine Auswertung übernehmen. Würde ich sie dort als Trainingsabrufe von Meta bezeichnen, hätte ich allerdings gleich zwei ungeklärte Fragen übersprungen: Stammen die Anfragen überhaupt vom angegebenen Betreiber, und wofür wurden die Inhalte anschließend verwendet? Selbst eine Netzadresse von Meta würde die zweite Frage nicht beantworten und auch nicht allein den auslösenden Dienst bestimmen.

Für Deine eigene Prüfung gehören deshalb Kennung, Absender, aufgerufener Pfad und Zeitpunkt zusammen. Die Crawler-Übersicht zeigt, bei welchen Einträgen das Wiki Betreiberangaben und eigene bestätigte Beobachtungen getrennt ausweist.

Primärquellen

  1. Meta Web Crawlers · Meta · abgerufen am · Betreiberbeschreibung, sichtbarer Stand 21.05.2026, keine Stichprobe: meta-externalagent für Training grundlegender KI-Modelle oder Produktverbesserung durch direkte Indexierung; meta-webindexer für Suchergebnisse in Meta AI; meta-externalads für Werbeprodukte; meta-externalfetcher für Nutzerlinks und agentische Funktionen, kann robots.txt umgehen; facebookexternalhit für Vorschauen mit Ausnahmen für Sicherheitsprüfungen. Steuerung per robots.txt, Zwischenspeicherung bis 24 Stunden. Keine botspezifische IP-Liste und kein Verifikationsverfahren dokumentiert
  2. RFC 9309: Robots Exclusion Protocol · IETF (Koster, Illyes, Zeller, Sassman, September 2022) · abgerufen am · Normativer Standard, keine Stichprobe: Gruppenauswahl und Pfadregeln (Abschnitt 2.2); robots.txt ist keine Zugriffssicherung (Abschnitt 1)
  3. Eigene Auswertung der Zugriffslogs von patrickstolp.de (Auswertung v3) · Patrick Stolp · abgerufen am · Eigene, nicht veröffentlichte Datengrundlage, 07.–08.09.2026: elf Treffer mit ExternalAgent-Kennung, neun mit Scanner-Mustern, eine IP-Adresse, ein beobachteter Tag; keine IP-Liste im Abgleich, die Abrufe sind nicht als Meta-Zugriffe bestätigt. Keine Aussage über Herkunft oder spätere Inhaltsnutzung

Verwandte Referenzen

Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz