Bytespider: ByteDances Suchcrawler erkennen und einordnen
Bei Bytespider ist für mich zunächst die Zuordnung zum dokumentierten Zweck wichtig. Die chinesischsprachige Toutiao-Dokumentation beschreibt ihn als Crawler der Suche und erklärt, wie abgerufene Seiten für einen Suchindex verarbeitet werden. Daraus lässt sich eine Suchaufgabe ableiten. Ob ein bestimmter Inhalt zusätzlich für KI-Training verwendet wurde, beantwortet diese Beschreibung dagegen nicht. Ein Bytespider-Eintrag im Serverlog reicht für eine solche Aussage ebenfalls nicht aus, zumal zuerst die Herkunft des Abrufs geklärt werden muss.
Stand geprüft am 09.09.2026 aus der Dokumentation von ByteDance und eigener Logprüfung (07.–08.09.2026).
| Betreiber | ByteDance |
|---|---|
| Abrufart | Indexabruf |
| Zweck | Crawler der Toutiao-Suche: ruft Seiten ab, verarbeitet sie für den Suchindex und liefert daraus Suchergebnisse. Eine Nutzung für KI-Training belegt die Betreiberdokumentation nicht. |
| User-Agent | Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com) (beobachtet in den Logs von patrickstolp.de)Toutiao dokumentiert eigene Kennungen für Desktop, Android und iOS; hier stehen die in den Logs von patrickstolp.de beobachteten Strings. Die Kennung kann auch von anderen Absendern verwendet werden. |
| robots.txt-Token | Bytespider |
| IP-Liste veröffentlicht | ja: https://zhanzhang.toutiao.com/docs/intro/26899 (abgerufen am 09.09.2026) Zehn IPv4-Bereiche (/24) im Dokumenttext; zusätzlich Reverse DNS auf Hostnamen unter bytedance.com, mit Vorwärtsabgleich prüfen Kein sichtbares Aktualisierungsdatum. Die Bereiche wurden noch nicht gegen die Rohlogs vom 07.–08.09.2026 gerechnet; die eigenen Zahlen bleiben unverifiziert. |
| IP-Verifikation | Abgleich der Absender-IP gegen die veröffentlichte Liste (abgerufen am 09.09.2026) |
| beachtet robots.txt (dokumentiert) | ja, laut Dokumentation Toutiao dokumentiert Pfadregeln, * und $ sowie eine Parameterauswertung unabhängig von der Reihenfolge. Ob ein konkreter Abruf vom Betreiber stammt und die Regeln beachtet, muss getrennt geprüft werden. |
| Treffer mit dieser Kennung auf patrickstolp.de (07.–08.09.2026) | 19 Kennungstreffer, keine veröffentlichte IP-Liste für diesen Abgleich; 5 der 19 mit Scanner-Mustern (überlappende Zählung) Scanner-Muster werden über alle Kennungstreffer gezählt, nicht nur über die IP-verifizierten. |
| Wirkung des Blockierens |
|
| Primärquelle | 关于Bytespider (Über Bytespider), Toutiao-Suche |
| geprüft am |
Die Herkunft eines Abrufs prüfen
Abschnitt betitelt „Die Herkunft eines Abrufs prüfen“Der User-Agent enthält die Kennung Bytespider. Sie lässt sich allerdings auch von anderen Absendern verwenden. Toutiao veröffentlicht dazu zehn IPv4-Bereiche und beschreibt eine DNS-Rückauflösung auf Hostnamen unter bytedance.com. Prüfe bei einer solchen Rückauflösung zusätzlich, ob der gefundene Hostname wieder zur ursprünglichen IP-Adresse auflöst. Ein passender Name im User-Agent genügt dafür nicht.
Die dokumentierten Bereiche sind eine Grundlage für die Herkunftsprüfung. Da die Seite kein sichtbares Aktualisierungsdatum nennt, würde ich einen fehlenden Treffer nicht ohne weitere Prüfung als Beweis für einen fremden Absender werten.
robots.txt ist dokumentiert
Abschnitt betitelt „robots.txt ist dokumentiert“Für eine vollständige Abrufsperre der Kennung kannst Du diese Gruppe verwenden:
User-agent: Bytespider
Disallow: /Toutiao beschreibt in einer eigenen Referenz zur Regelauswertung auch Pfad- und Parameterregeln. Daraus folgt keine Garantie, dass jeder Abruf mit dieser Kennung die Vorgaben einhält. Bei URLs mit mehreren Abfrageparametern ist außerdem Vorsicht nötig: Toutiao dokumentiert eine besondere Auswertung unabhängig von deren Reihenfolge. Der robots.txt-Tester bildet damit nicht automatisch jede Besonderheit dieses Crawlers ab.
Wenn Inhalte tatsächlich unzugänglich sein müssen, brauchst Du eine Zugangsbeschränkung am Server. robots.txt allein sichert sie nicht ab.
Was die eigenen Logs bisher zeigen
Abschnitt betitelt „Was die eigenen Logs bisher zeigen“In den ausgewerteten Logs vom 7. und 8. September 2026 stehen 19 Abrufe mit Bytespider-Kennung. Fünf davon passen zu den erfassten Scanner-Mustern. Der damalige Auswertungslauf enthielt noch keine Bytespider-IP-Liste; diese Treffer sind deshalb nicht als Betreiberabrufe bestätigt.
Inzwischen liegt die Betreiberliste vor. Das macht eine zusätzliche Prüfung möglich, bestätigt die 19 früher gezählten Abrufe aber nicht von selbst: Ihre Absender müssen erst mit den veröffentlichten Bereichen verglichen werden. Bis dahin kann ich die Anfragen nicht dem Betreiber zuschreiben und folglich auch nicht als Beleg dafür verwenden, dass er robots.txt missachtet hat. Eine spätere Trainingsnutzung wäre selbst mit bestätigter Herkunft noch eine weitere, hier nicht beantwortete Frage.
Primärquellen
- 关于Bytespider (Über Bytespider) · Toutiao / ByteDance · abgerufen am · Chinesischsprachige Betreiberbeschreibung ohne sichtbares Datum, keine Studie oder Stichprobe: Bytespider als Suchcrawler von Toutiao, Kennungen für Desktop, Android und iOS, Ablauf Abruf, Verarbeitung und Suchdienst, zehn IPv4-Bereiche (/24) und Reverse DNS auf Hostnamen unter bytedance.com. Keine belegte Vollständigkeit der Bereiche, kein Beleg für Trainingsnutzung
- Robots匹配说明 (Robots-Matching) · Toutiao / ByteDance · abgerufen am · Undatierte technische Betreiberbeschreibung: Pfadregeln, * und $, gesonderte Parameterbehandlung unabhängig von der Parameterreihenfolge. Beschriebene Regeln beweisen keine tatsächliche Befolgung jedes Abrufs; der robots.txt-Tester des Wikis bildet die Parameterauswertung nicht ab
- Cloudflare Radar: Toutiao (ByteDance) · Cloudflare · abgerufen am · Undatiertes Bot-Verzeichnis, kein Verhaltensexperiment: Betreiber ByteDance, Kategorie Search, Bytespider-Kennung, Verweis auf die Toutiao-Dokumentation. Nur Recherchehinweis; die Betreiberquelle geht vor
- RFC 9309: Robots Exclusion Protocol · IETF (Koster, Illyes, Zeller, Sassman, September 2022) · abgerufen am · Normativer Standard, keine Stichprobe: robots.txt ist keine Zugriffssicherung (Abschnitt 1); Gruppenauswahl und Pfadregeln (Abschnitt 2.2)
- Eigene Auswertung der Zugriffslogs von patrickstolp.de (Auswertung v3) · Patrick Stolp · abgerufen am · Eigene, nicht veröffentlichte Datengrundlage, 07.–08.09.2026: 19 Treffer mit Bytespider-Kennung, fünf mit Scanner-Mustern, zwei IP-Adressen, ein beobachteter Tag; im Auswertungslauf lag keine Bytespider-IP-Liste vor, die Treffer sind nicht als Betreiberabrufe bestätigt. Die neu gefundenen Bereiche wurden noch nicht gegen die Rohlogs gerechnet
Verwandte Referenzen
Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz