Zum Inhalt springen

Bytespider: ByteDances Suchcrawler erkennen und einordnen

Geprüft am Autor Patrick StolpVeröffentlicht

Bei Bytespider ist für mich zunächst die Zuordnung zum dokumentierten Zweck wichtig. Die chinesischsprachige Toutiao-Dokumentation beschreibt ihn als Crawler der Suche und erklärt, wie abgerufene Seiten für einen Suchindex verarbeitet werden. Daraus lässt sich eine Suchaufgabe ableiten. Ob ein bestimmter Inhalt zusätzlich für KI-Training verwendet wurde, beantwortet diese Beschreibung dagegen nicht. Ein Bytespider-Eintrag im Serverlog reicht für eine solche Aussage ebenfalls nicht aus, zumal zuerst die Herkunft des Abrufs geklärt werden muss.

Stand geprüft am 09.09.2026 aus der Dokumentation von ByteDance und eigener Logprüfung (07.–08.09.2026).

BetreiberByteDance
AbrufartIndexabruf
ZweckCrawler der Toutiao-Suche: ruft Seiten ab, verarbeitet sie für den Suchindex und liefert daraus Suchergebnisse. Eine Nutzung für KI-Training belegt die Betreiberdokumentation nicht.
User-AgentMozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com) (beobachtet in den Logs von patrickstolp.de)
Toutiao dokumentiert eigene Kennungen für Desktop, Android und iOS; hier stehen die in den Logs von patrickstolp.de beobachteten Strings. Die Kennung kann auch von anderen Absendern verwendet werden.
robots.txt-TokenBytespider
IP-Liste veröffentlichtja: https://zhanzhang.toutiao.com/docs/intro/26899 (abgerufen am 09.09.2026)
Zehn IPv4-Bereiche (/24) im Dokumenttext; zusätzlich Reverse DNS auf Hostnamen unter bytedance.com, mit Vorwärtsabgleich prüfen
Kein sichtbares Aktualisierungsdatum. Die Bereiche wurden noch nicht gegen die Rohlogs vom 07.–08.09.2026 gerechnet; die eigenen Zahlen bleiben unverifiziert.
IP-VerifikationAbgleich der Absender-IP gegen die veröffentlichte Liste (abgerufen am 09.09.2026)
beachtet robots.txt (dokumentiert)ja, laut Dokumentation
Toutiao dokumentiert Pfadregeln, * und $ sowie eine Parameterauswertung unabhängig von der Reihenfolge. Ob ein konkreter Abruf vom Betreiber stammt und die Regeln beachtet, muss getrennt geprüft werden.
Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026)19 Kennungstreffer, keine veröffentlichte IP-Liste für diesen Abgleich; 5 der 19 mit Scanner-Mustern (überlappende Zählung)
Scanner-Muster werden über alle Kennungstreffer gezählt, nicht nur über die IP-verifizierten.
Wirkung des Blockierens
Trainingsabruf
Nicht dokumentiert; die Betreiberdokumentation beschreibt nur die Suchindexierung.
Suchabruf
Laut Toutiao steuert robots.txt den Abruf für den Suchindex der Toutiao-Suche. Die tatsächliche Befolgung jedes Abrufs ist damit nicht bewiesen.
Nutzerabruf
Nicht zutreffend.
Primärquelle关于Bytespider (Über Bytespider), Toutiao-Suche
geprüft am

Der User-Agent enthält die Kennung Bytespider. Sie lässt sich allerdings auch von anderen Absendern verwenden. Toutiao veröffentlicht dazu zehn IPv4-Bereiche und beschreibt eine DNS-Rückauflösung auf Hostnamen unter bytedance.com. Prüfe bei einer solchen Rückauflösung zusätzlich, ob der gefundene Hostname wieder zur ursprünglichen IP-Adresse auflöst. Ein passender Name im User-Agent genügt dafür nicht.

Die dokumentierten Bereiche sind eine Grundlage für die Herkunftsprüfung. Da die Seite kein sichtbares Aktualisierungsdatum nennt, würde ich einen fehlenden Treffer nicht ohne weitere Prüfung als Beweis für einen fremden Absender werten.

Für eine vollständige Abrufsperre der Kennung kannst Du diese Gruppe verwenden:

User-agent: Bytespider
Disallow: /

Toutiao beschreibt in einer eigenen Referenz zur Regelauswertung auch Pfad- und Parameterregeln. Daraus folgt keine Garantie, dass jeder Abruf mit dieser Kennung die Vorgaben einhält. Bei URLs mit mehreren Abfrageparametern ist außerdem Vorsicht nötig: Toutiao dokumentiert eine besondere Auswertung unabhängig von deren Reihenfolge. Der robots.txt-Tester bildet damit nicht automatisch jede Besonderheit dieses Crawlers ab.

Wenn Inhalte tatsächlich unzugänglich sein müssen, brauchst Du eine Zugangsbeschränkung am Server. robots.txt allein sichert sie nicht ab.

In den ausgewerteten Logs vom 7. und 8. September 2026 stehen 19 Abrufe mit Bytespider-Kennung. Fünf davon passen zu den erfassten Scanner-Mustern. Der damalige Auswertungslauf enthielt noch keine Bytespider-IP-Liste; diese Treffer sind deshalb nicht als Betreiberabrufe bestätigt.

Inzwischen liegt die Betreiberliste vor. Das macht eine zusätzliche Prüfung möglich, bestätigt die 19 früher gezählten Abrufe aber nicht von selbst: Ihre Absender müssen erst mit den veröffentlichten Bereichen verglichen werden. Bis dahin kann ich die Anfragen nicht dem Betreiber zuschreiben und folglich auch nicht als Beleg dafür verwenden, dass er robots.txt missachtet hat. Eine spätere Trainingsnutzung wäre selbst mit bestätigter Herkunft noch eine weitere, hier nicht beantwortete Frage.

Primärquellen

  1. 关于Bytespider (Über Bytespider) · Toutiao / ByteDance · abgerufen am · Chinesischsprachige Betreiberbeschreibung ohne sichtbares Datum, keine Studie oder Stichprobe: Bytespider als Suchcrawler von Toutiao, Kennungen für Desktop, Android und iOS, Ablauf Abruf, Verarbeitung und Suchdienst, zehn IPv4-Bereiche (/24) und Reverse DNS auf Hostnamen unter bytedance.com. Keine belegte Vollständigkeit der Bereiche, kein Beleg für Trainingsnutzung
  2. Robots匹配说明 (Robots-Matching) · Toutiao / ByteDance · abgerufen am · Undatierte technische Betreiberbeschreibung: Pfadregeln, * und $, gesonderte Parameterbehandlung unabhängig von der Parameterreihenfolge. Beschriebene Regeln beweisen keine tatsächliche Befolgung jedes Abrufs; der robots.txt-Tester des Wikis bildet die Parameterauswertung nicht ab
  3. Cloudflare Radar: Toutiao (ByteDance) · Cloudflare · abgerufen am · Undatiertes Bot-Verzeichnis, kein Verhaltensexperiment: Betreiber ByteDance, Kategorie Search, Bytespider-Kennung, Verweis auf die Toutiao-Dokumentation. Nur Recherchehinweis; die Betreiberquelle geht vor
  4. RFC 9309: Robots Exclusion Protocol · IETF (Koster, Illyes, Zeller, Sassman, September 2022) · abgerufen am · Normativer Standard, keine Stichprobe: robots.txt ist keine Zugriffssicherung (Abschnitt 1); Gruppenauswahl und Pfadregeln (Abschnitt 2.2)
  5. Eigene Auswertung der Zugriffslogs von patrickstolp.de (Auswertung v3) · Patrick Stolp · abgerufen am · Eigene, nicht veröffentlichte Datengrundlage, 07.–08.09.2026: 19 Treffer mit Bytespider-Kennung, fünf mit Scanner-Mustern, zwei IP-Adressen, ein beobachteter Tag; im Auswertungslauf lag keine Bytespider-IP-Liste vor, die Treffer sind nicht als Betreiberabrufe bestätigt. Die neu gefundenen Bereiche wurden noch nicht gegen die Rohlogs gerechnet

Verwandte Referenzen

Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz