Zum Inhalt springen

PerplexityBot: Suchabrufe erkennen und steuern

Geprüft am Autor Patrick StolpVeröffentlicht

PerplexityBot erfasst Inhalte für die Suchergebnisse von Perplexity. Laut Betreiber dient er nicht dazu, Inhalte für das Training von KI-Basismodellen zu sammeln. Die Perplexity-Dokumentation unterscheidet ihn vom Nutzerabruf Perplexity-User.

Stand geprüft am 08.09.2026 aus der Dokumentation von Perplexity und eigener Logprüfung (07.–08.09.2026).

BetreiberPerplexity
AbrufartIndexabruf
ZweckBaut den Suchindex von Perplexity auf; laut Perplexity sammelt dieser Abruf nicht für das Training von KI-Basismodellen.
designed to surface and link websites in search results on Perplexity
User-AgentMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot) (laut Dokumentation)
robots.txt-TokenPerplexityBot
IP-Liste veröffentlichtja: https://www.perplexity.com/perplexitybot.json (Stand der Liste 07.02.2025, abgerufen am 08.09.2026)
JSON (ipv4Prefix)
IP-VerifikationAbgleich der Absender-IP gegen die veröffentlichte Liste (Stand der Liste 07.02.2025, abgerufen am 08.09.2026)
beachtet robots.txt (dokumentiert)ja, laut Dokumentation
Perplexity empfiehlt, PerplexityBot zuzulassen. Der Cloudflare-Bericht vom 04.08.2025 beschreibt Testabrufe mit anderen, nicht deklarierten Kennungen und gilt nicht für jeden Treffer mit PerplexityBot-Kennung. Eine Gegenstellung Perplexitys ist nicht verifiziert.
Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026)6 von 16 Kennungstreffern IP-verifiziert; 6 der 16 mit Scanner-Mustern (überlappende Zählung)
Scanner-Muster werden über alle Kennungstreffer gezählt, nicht nur über die IP-verifizierten.
Wirkung des Blockierens
Trainingsabruf
Laut Perplexity nicht betroffen, da dieser Abruf nicht für das Training von KI-Basismodellen sammelt; über sonstige Datenverarbeitung im Unternehmen sagt das nichts.
Suchabruf
Laut Perplexity steuert robots.txt die Abrufe von PerplexityBot, die Suchergebnisse und Verlinkungen versorgen; Änderungen können bis zu 24 Stunden dauern. Eine vollständige Unsichtbarkeit in Perplexity ist damit nicht zugesagt.
Nutzerabruf
Keine dokumentierte Wirkung; Nutzerabrufe laufen über Perplexity-User.
PrimärquellePerplexity Crawlers
geprüft am

In den Zugriffslogs vom 7. und 8. September 2026 standen 16 Einträge mit PerplexityBot-Kennung. Sechs davon kamen aus den veröffentlichten IP-Bereichen; bei zehn lag die Absenderadresse außerhalb. Sechs der insgesamt 16 Treffer zeigten typische Scanner-Pfade. Diese Zählung überschneidet sich mit der Herkunftsauswertung.

Die bestätigten Abrufe betrafen folgende Inhalte:

Angefragter Inhalt Bestätigte Abrufe
robots.txt 2
Artikel zum eigenen Schreibstil mit ChatGPT 1
Artikel zur Bewertung von SEO-Reportings 1
Artikel zur KI-Auswertung von Search-Console-Daten 1
ZIP-Datei mit Schreibstilmaterial 1
Eigene Beobachtung: Zugriffslogs von patrickstolp.de, 07.–08.09.2026

Der IP-Abgleich vergleicht die Absender-IP mit den veröffentlichten Listen der Betreiber, abgerufen am 08.09.2026. Zugriffe auf typische Scan-Ziele wie /.aws/credentials oder /.env werden zusätzlich gezählt und überschneiden sich mit den übrigen Gruppen. Solche Pfade allein beweisen keine gefälschte Kennung. 2.578 Logzeilen an 2 Tagen. Es werden keine IP-Adressen ausgegeben.

Zeitraum07.–08.09.2026
Treffer mit Kennung PerplexityBot16
IP-Abgleich6 von 16
mit Scanner-Pfaden (überlappende Zählung über alle Kennungstreffer)6
eindeutige Absender-IPs6 (nur gezählt)
Statuscodes2xx 6 · 3xx 0 · 4xx 4 · 5xx 0 · sonstige/fehlend 6
Abrufe von /robots.txt2
Abrufe von /llms.txt0
Treffer auf Pfade, die im gespeicherten robots.txt-Stand gesperrt sind0
häufigste Pfade (nur IP-verifiziert)/robots.txt (2)
/chatgpt-eigener-schreibstil/ (1)
/seo-reporting-bewerten/ (1)
/wp-content/uploads/2026/09/schreibstil-linguistisch-v2.zip (1)
/daten-mit-ki-in-der-google-search-console-analysieren/ (1)

Die Zahlen beschreiben Zugriffe auf eine einzelne Website. Sie zeigen weder, wie häufig die Bots im gesamten Web auftreten, noch ob abgerufene Inhalte in KI-Antworten verwendet wurden. Der robots.txt-Abgleich nutzt einen gespeicherten Stand; daraus lässt sich kein damaliger Regelverstoß ableiten. Ausgewertet am 08.09.2026.

Es wurden also drei Artikel angefragt, außerdem eine Datei und die robots.txt. Aus diesen sechs Abrufen lässt sich nicht ablesen, ob Perplexity einen der Inhalte in einer Antwort verwendet oder verlinkt hat. Dafür müssten die zugehörigen Antworten vorliegen.

Vergleiche neben der Kennung die Absender-IP mit der PerplexityBot-Liste. Notiere den verwendeten Listenstand. Ein Name im User-Agent allein ist kein Herkunftsnachweis, und ein späterer Abgleich beantwortet nicht automatisch die Frage nach früher gültigen Adressbereichen.

Die Crawler-Übersicht zeigt, wie ich bestätigte Abrufe, Adressen außerhalb einer Liste und Scanner-Muster getrennt auswerte.

Für sämtliche Pfade lautet die Gruppe:

User-agent: PerplexityBot
Disallow: /

Perplexity nennt robots.txt als Steuerung für den Bot. Änderungen können laut Dokumentation bis zu 24 Stunden benötigen, bis sie in den Systemen berücksichtigt werden.

Prüfe im robots.txt-Tester die vollständige Datei. Eine eigene Bot-Gruppe übernimmt nicht zusätzlich die Regeln der Stern-Gruppe. Für eine Teilfreigabe oder einzelne Pfadsperren müssen deshalb alle benötigten Regeln in der passenden Gruppe stehen. Grundlage ist RFC 9309.

Cloudflare berichtete am 4. August 2025 über Tests mit neu angelegten Websites, auf denen robots.txt und Firewall-Regeln die deklarierten Perplexity-Bots ausschlossen. Nach Fragen zu diesen Seiten beobachteten die Autoren weitere Abrufe mit anderen Kennungen und IP-Adressen. Den Versuchsaufbau beschreibt der Originalbericht.

Der Bericht betrifft damit auch Abrufe außerhalb der deklarierten Bot-Kennungen. Er lässt sich nicht auf die Aussage verkürzen, jeder Zugriff mit PerplexityBot-Kennung ignoriere robots.txt. Meine eigene zweitägige Auswertung prüft dieses Verhalten ebenfalls nicht und ist keine Wiederholung des Cloudflare-Experiments.

Für Deine technische Kontrolle bleiben deshalb zwei Fragen getrennt: Welche Regel gilt für den angegebenen Bot, und welche Anfragen erreichen Deinen Server tatsächlich? Eine korrekt formulierte robots.txt beantwortet nur die erste.

Primärquellen

  1. Perplexity Crawlers · Perplexity · abgerufen am · Betreiberdokumentation ohne ausgewiesenes Veröffentlichungsdatum, keine empirische Stichprobe: PerplexityBot ruft für Suchergebnisse und Verlinkungen ab, nicht für das Training von Basismodellen; robots.txt und IP-Abgleich sind die genannten Steuerungen, Änderungen können bis zu 24 Stunden dauern; keine Zusage völliger Unsichtbarkeit nach einer Sperre
  2. Veröffentlichte IP-Bereiche (PerplexityBot) · Perplexity · abgerufen am · Betreiberliste mit creationTime 07.02.2025, acht Adressbereiche: Abgleichskriterium für die Herkunft einer Kennung; kein Zitat- oder Nutzungsnachweis und kein Beleg für früher gültige Bereiche
  3. RFC 9309: Robots Exclusion Protocol · IETF (Koster, Illyes, Zeller, Sassman, September 2022) · abgerufen am · Normativer Standard: Eine eigene Bot-Gruppe übernimmt die Regeln der Stern-Gruppe nicht (Abschnitt 2.2.1); daraus folgt kein Nachweis, dass ein Bot die Regel befolgt
  4. Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives · Cloudflare (Gabriel Corral, Vaibhav Singhal, Brian Mitchell, Reid Tatoris), 04.08.2025 · abgerufen am · Primäruntersuchung eines Sicherheitsanbieters mit eigens angelegten Testdomains, Anzahl der Domains und Versuche im Methodenteil nicht angegeben: beobachtet wurden Abrufe mit anderen Kennungen und IP-Adressen; nicht auf jeden Treffer mit PerplexityBot-Kennung übertragbar, keine eigene Replikation, Gegenstellung Perplexitys nicht verifiziert
  5. Eigene Auswertung der Zugriffslogs von patrickstolp.de (Auswertung v3) · Patrick Stolp · abgerufen am · Eigene, nicht veröffentlichte Datengrundlage, 07.–08.09.2026: 2.578 Logzeilen, 16 Treffer mit PerplexityBot-Kennung, davon sechs per IP bestätigt; keine Aussage über eine Verwendung in Antworten

Verwandte Referenzen

Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz