Zum Inhalt springen

Quellen zählen nach URL, Host und Domain

Geprüft am Autor Patrick StolpVeröffentlicht

Mit dem Quellenzähler wertest Du URLs aus einer Quellenliste oder aus KI-Antworten aus. Das Werkzeug zählt, wie oft eine Adresse vorkommt, und fasst die Ergebnisse zusätzlich nach Host und registrierbarer Domain zusammen. Welche Schreibweisen dabei als dieselbe URL gelten, bestimmst Du über die Normalisierung.

Füge die URLs möglichst mit https:// oder http:// ein, jeweils in einer eigenen Zeile oder im Fließtext. Prüfe die Einstellungen und wähle „Zählen“. Du erhältst drei Tabellen sowie ein Protokoll der Änderungen an den erkannten URLs. Über „Tabellen als CSV kopieren“ kannst Du die Auswertung übernehmen.

Deine Eingaben bleiben im Browser. Das Werkzeug ruft die verlinkten Seiten nicht ab und prüft weder ihre Erreichbarkeit noch ihren Inhalt.

URL-Normalisierung und Zählkonventionen

Immer angewandt und im Protokoll ausgewiesen: Fehlendes Schema als https ergänzen (Konvention) · Benutzerinformationen entfernen (Werkzeugentscheidung, vgl. RFC 3986, Abschnitt 3.2.1). Entfernte Kampagnenparameter: utm_*, gclid, fbclid, mc_cid, mc_eid.

Zählung
Läuft lokal im Browser. Es wird nichts übertragen.

Registrierbare Domains werden mit tldts unbekannt (MIT) gegen die Public Suffix List bestimmt. Der Stand der Liste entspricht der gebündelten Fassung im Paket tldts unbekannt; es findet keine Live-Aktualisierung statt. Ein späterer Eintrag in der Liste ist hier noch nicht enthalten.

Was ist der Unterschied zwischen URL, Host und Domain?

Abschnitt betitelt „Was ist der Unterschied zwischen URL, Host und Domain?“

Die drei Tabellen beantworten unterschiedliche Fragen:

Einheit Beispiel Was Du damit vergleichst
URL https://blog.example.de/bericht/ Einzelne Adressen nach der gewählten Normalisierung
Host blog.example.de Adressen unter demselben Hostnamen, unabhängig vom Pfad
Registrierbare Domain example.de Zusammengehörige Hostnamen nach den verwendeten Suffixregeln

Angenommen Deine Liste enthält diese drei Einträge:

https://example.de/bericht/?utm_source=newsletter
https://example.de/bericht/#fazit
https://blog.example.de/notizen

Mit den Voreinstellungen entfernt der Zähler den Tracking-Parameter und das Fragment #fazit. Die ersten beiden Einträge werden dadurch zu https://example.de/bericht/ zusammengefasst. Das Ergebnis sind drei URL-Vorkommen, aber nur zwei unterschiedliche URLs, zwei Hosts und eine registrierbare Domain.

Ein wiederholter Link verschwindet also nicht aus der Auswertung. Er erhöht die Häufigkeit der zusammengefassten Adresse.

Zu den voreingestellten Schritten gehören die Kleinschreibung von Schema und Host, das Entfernen passender Standardports und das Auflösen von . und .. im Pfad. Der Pfad selbst wird nicht kleingeschrieben: /Bericht/ und /bericht/ bleiben verschieden. Die technischen Grundlagen stehen in RFC 3986 zur URI-Syntax und Normalisierung.

Zusätzlich wendet der Zähler Entscheidungen für diese Auswertung an. Voreingestellt werden Fragmente nach # und die Tracking-Parameter utm_*, gclid, fbclid, mc_cid und mc_eid entfernt. So kannst Du verschiedene Verweise auf dieselbe Seitenadresse zusammenfassen. Wenn Du einzelne Abschnitte oder solche Parameter getrennt untersuchen möchtest, schalte den jeweiligen Schritt aus.

Zwei weitergehende Optionen sind zunächst ausgeschaltet:

  • Query vollständig entfernen: Das würde beispielsweise /produkt?id=1 und /produkt?id=2 zusammenfassen. Aktiviere es nur, wenn diese Unterscheidung für Deine Auswertung tatsächlich entfallen soll.
  • Abschließenden Schrägstrich entfernen: Damit werden /bericht und /bericht/ gleich gezählt. Ob der Server darunter dieselben Inhalte ausliefert, prüft das Werkzeug nicht.

Bei einer erkannten Adresse ohne Schema ergänzt der Zähler immer https://. Benutzerinformationen vor dem Host werden ebenfalls immer entfernt. Diese Schritte sind im Protokoll sichtbar, lassen sich aber nicht abschalten.

Werden Adressen mit und ohne www zusammengezählt?

Abschnitt betitelt „Werden Adressen mit und ohne www zusammengezählt?“

Voreingestellt zählt www.example.de zusammen mit example.de als ein Host. Du kannst diese Zusammenfassung ausschalten. Die URL-Tabelle bleibt davon unberührt: https://www.example.de/bericht/ und https://example.de/bericht/ bleiben dort zwei Adressen.

Die registrierbare Domain lässt sich nicht zuverlässig bestimmen, indem man einfach die letzten beiden Teile eines Hostnamens nimmt. Bei www.bbc.co.uk wäre das co.uk. Die registrierbare Domain ist jedoch bbc.co.uk.

Die Public Suffix List beschreibt solche Grenzen. Der Zähler verwendet sie über die Bibliothek tldts. Maßgeblich ist der mit dem Werkzeug ausgelieferte Listenstand; während Deiner Auswertung wird keine aktuelle Liste nachgeladen.

Der private Abschnitt berücksichtigt unter anderem Plattformen, auf denen verschiedene Nutzer eigene Websites betreiben. Im Zähler ist er standardmäßig aktiviert.

Dadurch zählen anna.github.io und ben.github.io als zwei registrierbare Domains. Schaltest Du die Option aus, werden beide unter github.io zusammengefasst. Die Wahl verändert also, ob Du einzelne Plattform-Websites oder die Plattform-Domain gemeinsam betrachtest. Verwende bei Vergleichen dieselbe Einstellung.

Wie liest Du Häufigkeiten, Anteile und Fehlzeilen?

Abschnitt betitelt „Wie liest Du Häufigkeiten, Anteile und Fehlzeilen?“

„Anzahl“ bezeichnet die erkannten URL-Vorkommen der jeweiligen Tabellenzeile. Der Anteil bezieht sich auf sämtliche ausgewerteten URL-Vorkommen, einschließlich Wiederholungen. Es ist kein Anteil an KI-Antworten: Der Zähler weiß nicht, welche URLs aus derselben Antwort stammen.

IP-Adressen und andere Einträge ohne bestimmbare registrierbare Domain können in der URL- und Host-Tabelle vorkommen, ohne einer Domain zugeordnet zu werden. Dann müssen sich die Anteile der Domain-Tabelle nicht zu 100 Prozent addieren.

Kontrolliere auch die nicht ausgewerteten Zeilen und das Änderungsprotokoll. Eine syntaktisch erkannte Adresse ist noch kein gültiger Quellenbeleg. Zwei Domains sind außerdem nicht automatisch zwei unabhängige Herausgeber, und mehrere Adressen können denselben Inhalt wiedergeben.

Für eine Zitatquote je KI-Antwort musst Du deshalb zuvor je Antwort feststellen, ob Deine Domain mindestens einmal als Quelle genannt wurde. Die Häufigkeit aus dieser URL-Liste ist dafür nicht unmittelbar der passende Zähler.

Primärquellen

  1. RFC 3986: Uniform Resource Identifier (URI): Generic Syntax · Berners-Lee, Fielding, Masinter / IETF, Januar 2005 · abgerufen am · Host und Schema sind ohne Rücksicht auf Groß- und Kleinschreibung zu vergleichen; unreservierte Prozentkodierung, Punktsegmente, schemabezogene Normalisierung. Ein Fragment kann eine sekundäre Ressource bezeichnen (§ 3.5); Query-Verwurf, Tracking-Filter und www-Faltung folgen nicht aus dem RFC.
  2. Learn more about the Public Suffix List · Public-Suffix-List-Projekt · abgerufen am · Mehrteilige Suffixe wie co.uk und die Grenze der registrierbaren Domain. Kein Nachweis gemeinsamer Eigentümer oder unabhängiger Redaktionen.
  3. View the Public Suffix List · Public-Suffix-List-Projekt · abgerufen am · Laufend gepflegter Listenbestand mit ICANN-Abschnitt und privatem Abschnitt.
  4. tldts · Rémi Berson und Mitwirkende · abgerufen am · allowPrivateDomains schaltet die privaten Suffixe zu; das Verhalten wurde mit dem lokalen Paket geprüft. Das Veröffentlichungsdatum des Pakets belegt keinen genauen Snapshot der Public Suffix List.

Verwandte Referenzen

Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz