Quellen zählen nach URL, Host und Domain
Mit dem Quellenzähler wertest Du URLs aus einer Quellenliste oder aus KI-Antworten aus. Das Werkzeug zählt, wie oft eine Adresse vorkommt, und fasst die Ergebnisse zusätzlich nach Host und registrierbarer Domain zusammen. Welche Schreibweisen dabei als dieselbe URL gelten, bestimmst Du über die Normalisierung.
Quellenliste einfügen und auswerten
Abschnitt betitelt „Quellenliste einfügen und auswerten“Füge die URLs möglichst mit https:// oder http:// ein, jeweils in einer eigenen Zeile oder im Fließtext. Prüfe die Einstellungen und wähle „Zählen“. Du erhältst drei Tabellen sowie ein Protokoll der Änderungen an den erkannten URLs. Über „Tabellen als CSV kopieren“ kannst Du die Auswertung übernehmen.
Deine Eingaben bleiben im Browser. Das Werkzeug ruft die verlinkten Seiten nicht ab und prüft weder ihre Erreichbarkeit noch ihren Inhalt.
Was ist der Unterschied zwischen URL, Host und Domain?
Abschnitt betitelt „Was ist der Unterschied zwischen URL, Host und Domain?“Die drei Tabellen beantworten unterschiedliche Fragen:
| Einheit | Beispiel | Was Du damit vergleichst |
|---|---|---|
| URL | https://blog.example.de/bericht/ |
Einzelne Adressen nach der gewählten Normalisierung |
| Host | blog.example.de |
Adressen unter demselben Hostnamen, unabhängig vom Pfad |
| Registrierbare Domain | example.de |
Zusammengehörige Hostnamen nach den verwendeten Suffixregeln |
Angenommen Deine Liste enthält diese drei Einträge:
https://example.de/bericht/?utm_source=newsletterhttps://example.de/bericht/#fazithttps://blog.example.de/notizenMit den Voreinstellungen entfernt der Zähler den Tracking-Parameter und das Fragment #fazit. Die ersten beiden Einträge werden dadurch zu https://example.de/bericht/ zusammengefasst. Das Ergebnis sind drei URL-Vorkommen, aber nur zwei unterschiedliche URLs, zwei Hosts und eine registrierbare Domain.
Ein wiederholter Link verschwindet also nicht aus der Auswertung. Er erhöht die Häufigkeit der zusammengefassten Adresse.
Welche Änderungen nimmt die Normalisierung vor?
Abschnitt betitelt „Welche Änderungen nimmt die Normalisierung vor?“Zu den voreingestellten Schritten gehören die Kleinschreibung von Schema und Host, das Entfernen passender Standardports und das Auflösen von . und .. im Pfad. Der Pfad selbst wird nicht kleingeschrieben: /Bericht/ und /bericht/ bleiben verschieden. Die technischen Grundlagen stehen in RFC 3986 zur URI-Syntax und Normalisierung.
Zusätzlich wendet der Zähler Entscheidungen für diese Auswertung an. Voreingestellt werden Fragmente nach # und die Tracking-Parameter utm_*, gclid, fbclid, mc_cid und mc_eid entfernt. So kannst Du verschiedene Verweise auf dieselbe Seitenadresse zusammenfassen. Wenn Du einzelne Abschnitte oder solche Parameter getrennt untersuchen möchtest, schalte den jeweiligen Schritt aus.
Zwei weitergehende Optionen sind zunächst ausgeschaltet:
- Query vollständig entfernen: Das würde beispielsweise
/produkt?id=1und/produkt?id=2zusammenfassen. Aktiviere es nur, wenn diese Unterscheidung für Deine Auswertung tatsächlich entfallen soll. - Abschließenden Schrägstrich entfernen: Damit werden
/berichtund/bericht/gleich gezählt. Ob der Server darunter dieselben Inhalte ausliefert, prüft das Werkzeug nicht.
Bei einer erkannten Adresse ohne Schema ergänzt der Zähler immer https://. Benutzerinformationen vor dem Host werden ebenfalls immer entfernt. Diese Schritte sind im Protokoll sichtbar, lassen sich aber nicht abschalten.
Werden Adressen mit und ohne www zusammengezählt?
Abschnitt betitelt „Werden Adressen mit und ohne www zusammengezählt?“Voreingestellt zählt www.example.de zusammen mit example.de als ein Host. Du kannst diese Zusammenfassung ausschalten. Die URL-Tabelle bleibt davon unberührt: https://www.example.de/bericht/ und https://example.de/bericht/ bleiben dort zwei Adressen.
Wozu braucht der Zähler die Public Suffix List?
Abschnitt betitelt „Wozu braucht der Zähler die Public Suffix List?“Die registrierbare Domain lässt sich nicht zuverlässig bestimmen, indem man einfach die letzten beiden Teile eines Hostnamens nimmt. Bei www.bbc.co.uk wäre das co.uk. Die registrierbare Domain ist jedoch bbc.co.uk.
Die Public Suffix List beschreibt solche Grenzen. Der Zähler verwendet sie über die Bibliothek tldts. Maßgeblich ist der mit dem Werkzeug ausgelieferte Listenstand; während Deiner Auswertung wird keine aktuelle Liste nachgeladen.
Was ändert der private Abschnitt der Liste?
Abschnitt betitelt „Was ändert der private Abschnitt der Liste?“Der private Abschnitt berücksichtigt unter anderem Plattformen, auf denen verschiedene Nutzer eigene Websites betreiben. Im Zähler ist er standardmäßig aktiviert.
Dadurch zählen anna.github.io und ben.github.io als zwei registrierbare Domains. Schaltest Du die Option aus, werden beide unter github.io zusammengefasst. Die Wahl verändert also, ob Du einzelne Plattform-Websites oder die Plattform-Domain gemeinsam betrachtest. Verwende bei Vergleichen dieselbe Einstellung.
Wie liest Du Häufigkeiten, Anteile und Fehlzeilen?
Abschnitt betitelt „Wie liest Du Häufigkeiten, Anteile und Fehlzeilen?“„Anzahl“ bezeichnet die erkannten URL-Vorkommen der jeweiligen Tabellenzeile. Der Anteil bezieht sich auf sämtliche ausgewerteten URL-Vorkommen, einschließlich Wiederholungen. Es ist kein Anteil an KI-Antworten: Der Zähler weiß nicht, welche URLs aus derselben Antwort stammen.
IP-Adressen und andere Einträge ohne bestimmbare registrierbare Domain können in der URL- und Host-Tabelle vorkommen, ohne einer Domain zugeordnet zu werden. Dann müssen sich die Anteile der Domain-Tabelle nicht zu 100 Prozent addieren.
Kontrolliere auch die nicht ausgewerteten Zeilen und das Änderungsprotokoll. Eine syntaktisch erkannte Adresse ist noch kein gültiger Quellenbeleg. Zwei Domains sind außerdem nicht automatisch zwei unabhängige Herausgeber, und mehrere Adressen können denselben Inhalt wiedergeben.
Für eine Zitatquote je KI-Antwort musst Du deshalb zuvor je Antwort feststellen, ob Deine Domain mindestens einmal als Quelle genannt wurde. Die Häufigkeit aus dieser URL-Liste ist dafür nicht unmittelbar der passende Zähler.
Primärquellen
- RFC 3986: Uniform Resource Identifier (URI): Generic Syntax · Berners-Lee, Fielding, Masinter / IETF, Januar 2005 · abgerufen am · Host und Schema sind ohne Rücksicht auf Groß- und Kleinschreibung zu vergleichen; unreservierte Prozentkodierung, Punktsegmente, schemabezogene Normalisierung. Ein Fragment kann eine sekundäre Ressource bezeichnen (§ 3.5); Query-Verwurf, Tracking-Filter und www-Faltung folgen nicht aus dem RFC.
- Learn more about the Public Suffix List · Public-Suffix-List-Projekt · abgerufen am · Mehrteilige Suffixe wie co.uk und die Grenze der registrierbaren Domain. Kein Nachweis gemeinsamer Eigentümer oder unabhängiger Redaktionen.
- View the Public Suffix List · Public-Suffix-List-Projekt · abgerufen am · Laufend gepflegter Listenbestand mit ICANN-Abschnitt und privatem Abschnitt.
- tldts · Rémi Berson und Mitwirkende · abgerufen am · allowPrivateDomains schaltet die privaten Suffixe zu; das Verhalten wurde mit dem lokalen Paket geprüft. Das Veröffentlichungsdatum des Pakets belegt keinen genauen Snapshot der Public Suffix List.
Verwandte Referenzen
Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz