PerplexityBot: Suchabrufe erkennen und steuern
PerplexityBot erfasst Inhalte für die Suchergebnisse von Perplexity. Laut Betreiber dient er nicht dazu, Inhalte für das Training von KI-Basismodellen zu sammeln. Die Perplexity-Dokumentation unterscheidet ihn vom Nutzerabruf Perplexity-User.
Stand geprüft am 08.09.2026 aus der Dokumentation von Perplexity und eigener Logprüfung (07.–08.09.2026).
| Betreiber | Perplexity |
|---|---|
| Abrufart | Indexabruf |
| Zweck | Baut den Suchindex von Perplexity auf; laut Perplexity sammelt dieser Abruf nicht für das Training von KI-Basismodellen.designed to surface and link websites in search results on Perplexity |
| User-Agent | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot) (laut Dokumentation) |
| robots.txt-Token | PerplexityBot |
| IP-Liste veröffentlicht | ja: https://www.perplexity.com/perplexitybot.json (Stand der Liste 07.02.2025, abgerufen am 08.09.2026) JSON (ipv4Prefix) |
| IP-Verifikation | Abgleich der Absender-IP gegen die veröffentlichte Liste (Stand der Liste 07.02.2025, abgerufen am 08.09.2026) |
| beachtet robots.txt (dokumentiert) | ja, laut Dokumentation Perplexity empfiehlt, PerplexityBot zuzulassen. Der Cloudflare-Bericht vom 04.08.2025 beschreibt Testabrufe mit anderen, nicht deklarierten Kennungen und gilt nicht für jeden Treffer mit PerplexityBot-Kennung. Eine Gegenstellung Perplexitys ist nicht verifiziert. |
| Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026) | 6 von 16 Kennungstreffern IP-verifiziert; 6 der 16 mit Scanner-Mustern (überlappende Zählung) Scanner-Muster werden über alle Kennungstreffer gezählt, nicht nur über die IP-verifizierten. |
| Wirkung des Blockierens |
|
| Primärquelle | Perplexity Crawlers |
| geprüft am |
Was habe ich auf patrickstolp.de beobachtet?
Abschnitt betitelt „Was habe ich auf patrickstolp.de beobachtet?“In den Zugriffslogs vom 7. und 8. September 2026 standen 16 Einträge mit PerplexityBot-Kennung. Sechs davon kamen aus den veröffentlichten IP-Bereichen; bei zehn lag die Absenderadresse außerhalb. Sechs der insgesamt 16 Treffer zeigten typische Scanner-Pfade. Diese Zählung überschneidet sich mit der Herkunftsauswertung.
Die bestätigten Abrufe betrafen folgende Inhalte:
| Angefragter Inhalt | Bestätigte Abrufe |
|---|---|
| robots.txt | 2 |
| Artikel zum eigenen Schreibstil mit ChatGPT | 1 |
| Artikel zur Bewertung von SEO-Reportings | 1 |
| Artikel zur KI-Auswertung von Search-Console-Daten | 1 |
| ZIP-Datei mit Schreibstilmaterial | 1 |
Eigene Beobachtung: Zugriffslogs von patrickstolp.de, 07.–08.09.2026
Der IP-Abgleich vergleicht die Absender-IP mit den veröffentlichten Listen der Betreiber, abgerufen am 08.09.2026. Zugriffe auf typische Scan-Ziele wie /.aws/credentials oder /.env werden zusätzlich gezählt und überschneiden sich mit den übrigen Gruppen. Solche Pfade allein beweisen keine gefälschte Kennung. 2.578 Logzeilen an 2 Tagen. Es werden keine IP-Adressen ausgegeben.
| Zeitraum | 07.–08.09.2026 |
|---|---|
| Treffer mit Kennung PerplexityBot | 16 |
| IP-Abgleich | 6 von 16 |
| mit Scanner-Pfaden (überlappende Zählung über alle Kennungstreffer) | 6 |
| eindeutige Absender-IPs | 6 (nur gezählt) |
| Statuscodes | 2xx 6 · 3xx 0 · 4xx 4 · 5xx 0 · sonstige/fehlend 6 |
| Abrufe von /robots.txt | 2 |
| Abrufe von /llms.txt | 0 |
| Treffer auf Pfade, die im gespeicherten robots.txt-Stand gesperrt sind | 0 |
| häufigste Pfade (nur IP-verifiziert) | /robots.txt (2)/chatgpt-eigener-schreibstil/ (1)/seo-reporting-bewerten/ (1)/wp-content/uploads/2026/09/schreibstil-linguistisch-v2.zip (1)/daten-mit-ki-in-der-google-search-console-analysieren/ (1) |
Die Zahlen beschreiben Zugriffe auf eine einzelne Website. Sie zeigen weder, wie häufig die Bots im gesamten Web auftreten, noch ob abgerufene Inhalte in KI-Antworten verwendet wurden. Der robots.txt-Abgleich nutzt einen gespeicherten Stand; daraus lässt sich kein damaliger Regelverstoß ableiten. Ausgewertet am 08.09.2026.
Es wurden also drei Artikel angefragt, außerdem eine Datei und die robots.txt. Aus diesen sechs Abrufen lässt sich nicht ablesen, ob Perplexity einen der Inhalte in einer Antwort verwendet oder verlinkt hat. Dafür müssten die zugehörigen Antworten vorliegen.
Wie prüfst Du die Herkunft?
Abschnitt betitelt „Wie prüfst Du die Herkunft?“Vergleiche neben der Kennung die Absender-IP mit der PerplexityBot-Liste. Notiere den verwendeten Listenstand. Ein Name im User-Agent allein ist kein Herkunftsnachweis, und ein späterer Abgleich beantwortet nicht automatisch die Frage nach früher gültigen Adressbereichen.
Die Crawler-Übersicht zeigt, wie ich bestätigte Abrufe, Adressen außerhalb einer Liste und Scanner-Muster getrennt auswerte.
Wie formulierst Du eine robots.txt-Sperre?
Abschnitt betitelt „Wie formulierst Du eine robots.txt-Sperre?“Für sämtliche Pfade lautet die Gruppe:
User-agent: PerplexityBot
Disallow: /Perplexity nennt robots.txt als Steuerung für den Bot. Änderungen können laut Dokumentation bis zu 24 Stunden benötigen, bis sie in den Systemen berücksichtigt werden.
Prüfe im robots.txt-Tester die vollständige Datei. Eine eigene Bot-Gruppe übernimmt nicht zusätzlich die Regeln der Stern-Gruppe. Für eine Teilfreigabe oder einzelne Pfadsperren müssen deshalb alle benötigten Regeln in der passenden Gruppe stehen. Grundlage ist RFC 9309.
Wie ist der Cloudflare-Bericht einzuordnen?
Abschnitt betitelt „Wie ist der Cloudflare-Bericht einzuordnen?“Cloudflare berichtete am 4. August 2025 über Tests mit neu angelegten Websites, auf denen robots.txt und Firewall-Regeln die deklarierten Perplexity-Bots ausschlossen. Nach Fragen zu diesen Seiten beobachteten die Autoren weitere Abrufe mit anderen Kennungen und IP-Adressen. Den Versuchsaufbau beschreibt der Originalbericht.
Der Bericht betrifft damit auch Abrufe außerhalb der deklarierten Bot-Kennungen. Er lässt sich nicht auf die Aussage verkürzen, jeder Zugriff mit PerplexityBot-Kennung ignoriere robots.txt. Meine eigene zweitägige Auswertung prüft dieses Verhalten ebenfalls nicht und ist keine Wiederholung des Cloudflare-Experiments.
Für Deine technische Kontrolle bleiben deshalb zwei Fragen getrennt: Welche Regel gilt für den angegebenen Bot, und welche Anfragen erreichen Deinen Server tatsächlich? Eine korrekt formulierte robots.txt beantwortet nur die erste.
- Perplexity-User: Nutzerabrufe und die Grenzen von robots.txt
Ruft eine Seite ab, wenn eine Person Perplexity eine Frage stellt; laut Perplexity kein Webcrawl und keine Sammlung für das Training von KI-Basismodellen.
Token
Perplexity-User· Nutzerabruf
Primärquellen
- Perplexity Crawlers · Perplexity · abgerufen am · Betreiberdokumentation ohne ausgewiesenes Veröffentlichungsdatum, keine empirische Stichprobe: PerplexityBot ruft für Suchergebnisse und Verlinkungen ab, nicht für das Training von Basismodellen; robots.txt und IP-Abgleich sind die genannten Steuerungen, Änderungen können bis zu 24 Stunden dauern; keine Zusage völliger Unsichtbarkeit nach einer Sperre
- Veröffentlichte IP-Bereiche (PerplexityBot) · Perplexity · abgerufen am · Betreiberliste mit creationTime 07.02.2025, acht Adressbereiche: Abgleichskriterium für die Herkunft einer Kennung; kein Zitat- oder Nutzungsnachweis und kein Beleg für früher gültige Bereiche
- RFC 9309: Robots Exclusion Protocol · IETF (Koster, Illyes, Zeller, Sassman, September 2022) · abgerufen am · Normativer Standard: Eine eigene Bot-Gruppe übernimmt die Regeln der Stern-Gruppe nicht (Abschnitt 2.2.1); daraus folgt kein Nachweis, dass ein Bot die Regel befolgt
- Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives · Cloudflare (Gabriel Corral, Vaibhav Singhal, Brian Mitchell, Reid Tatoris), 04.08.2025 · abgerufen am · Primäruntersuchung eines Sicherheitsanbieters mit eigens angelegten Testdomains, Anzahl der Domains und Versuche im Methodenteil nicht angegeben: beobachtet wurden Abrufe mit anderen Kennungen und IP-Adressen; nicht auf jeden Treffer mit PerplexityBot-Kennung übertragbar, keine eigene Replikation, Gegenstellung Perplexitys nicht verifiziert
- Eigene Auswertung der Zugriffslogs von patrickstolp.de (Auswertung v3) · Patrick Stolp · abgerufen am · Eigene, nicht veröffentlichte Datengrundlage, 07.–08.09.2026: 2.578 Logzeilen, 16 Treffer mit PerplexityBot-Kennung, davon sechs per IP bestätigt; keine Aussage über eine Verwendung in Antworten
Verwandte Referenzen
Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz