Zum Inhalt springen

KI-Antworten dokumentieren: Ein Referenzbogen für den Vergleich

Geprüft am Autor Patrick StolpVeröffentlicht

Eine gespeicherte KI-Antwort wird erst dann für einen Vergleich brauchbar, wenn ich auch weiß, unter welchen Bedingungen sie entstanden ist. Die Frage kann bereits einen Ort oder einen bestimmten Anbieter enthalten haben. Vielleicht gab es vorherige Nachrichten, vielleicht war die Websuche eingeschaltet. Diese Angaben gehören für mich zur Beobachtung, weil sonst offenbleibt, was die Antwort eigentlich beantwortet hat.

Mit dem folgenden Referenzbogen kannst Du eine einzelne Ausgabe dokumentieren. Er ist ein Arbeitsvorschlag für die Nachprüfung und schreibt keine bestimmte Messsoftware vor.

Feld Eintrag
Antwort-ID Eine eindeutige Kennung, die auch im Dateinamen verwendet wird
Zeitpunkt Datum, Uhrzeit und Zeitzone der Abfrage
Produkt und Zugang Produktname sowie Browser, App oder API
Modellangabe Sichtbare Bezeichnung oder zurückgegebene Modellkennung; fehlende Angaben als unbekannt markieren
Frage Vollständiger Wortlaut einschließlich Ort, Sprache, Budget und anderer Vorgaben
Gesprächskontext Neue Unterhaltung oder relevante vorherige Nachrichten
Weitere Vorgaben Bei einer API-Abfrage beispielsweise Systemanweisung und dokumentierte Konfiguration
Webzugriff Was eingestellt war und welche tatsächliche Nutzung die Ausgabe oder das Protokoll erkennen lässt
Personalisierung Bekannte Erinnerungen, individuelle Anweisungen oder sonstige dokumentierte Einstellungen
Standort Standort im Prompt, in einer Einstellung oder in der Abfragekonfiguration; unbekannte Einflüsse offenlassen
Antwort Vollständige Ausgabe in der ursprünglichen Reihenfolge
Quellen Sichtbare Links, Quellenmarker und deren Zuordnung zu Aussagen
Prüfstand Datum des späteren Quellenabrufs und Ergebnis der inhaltlichen Prüfung

Du kannst die Tabelle kopieren oder den Referenzbogen als Textdatei verwenden. Private Gesprächsinhalte und Kontodaten gehören nicht in eine öffentliche Beispielsammlung. Für die interne Nachprüfung genügt gegebenenfalls ein Vermerk, dass zusätzlicher Kontext vorhanden war und deshalb keine vollständig offene Reproduktion möglich ist.

Beobachtete Angaben und vermutete Bedingungen trennen

Abschnitt betitelt „Beobachtete Angaben und vermutete Bedingungen trennen“

Wenn ein Produkt einen Modellnamen anzeigt, halte ich genau diese Bezeichnung fest. Daraus würde ich keine nicht sichtbare Modellversion ableiten. Ähnlich ist es bei der Suche: Ein bereitgestelltes Suchwerkzeug und seine tatsächliche Nutzung sind zwei unterschiedliche Angaben. Bei einer API-Abfrage kann das Protokoll Suchaufrufe ausweisen; in einer Chat-Oberfläche steht möglicherweise nur eine Quellenliste zur Verfügung.

Fehlt ein Quellenlink, belegt das allein noch nicht, dass das System ausschließlich mit Trainingswissen gearbeitet hat. Umgekehrt lässt sich aus einem sichtbaren Link keine vollständige Liste aller abgerufenen Seiten rekonstruieren. Welche dieser Beobachtungen Du tatsächlich prüfen kannst, hängt vom jeweiligen Zugang und seinen gespeicherten Daten ab.

Erhebungsdatum und Datum der Frage auseinanderhalten

Abschnitt betitelt „Erhebungsdatum und Datum der Frage auseinanderhalten“

In einem gespeicherten Vorversuch meiner Lübecker Reiseplan-Erhebung entstand am 9. August 2026 eine Antwort zu einem geplanten Besuch am 24. August 2026. Beide Daten sind erforderlich: Das erste bezeichnet die Abfrage, das zweite den Tag, für den die vorgeschlagenen Öffnungszeiten gelten sollten.

Die Antwort kam laut Laufbericht über die API mit der Konfiguration gpt-5-mini und Websuchwerkzeug zustande. Das macht sie zu einer dokumentierten API-Beobachtung. Wie dieselbe Frage in der ChatGPT-Oberfläche beantwortet worden wäre, wurde damit nicht mitgemessen. Am gespeicherten Zitatfall zum Buddenbrookhaus lässt sich außerdem nachvollziehen, weshalb auch der Zeitpunkt der späteren Quellenprüfung erhalten bleiben muss.

Für wiederholte Abfragen halte ich Wortlaut, Zugang und bekannte Einstellungen möglichst gleich und dokumentiere Änderungen. Unterschiedliche Fragen können ebenfalls sinnvoll sein, sollten aber getrennt auswertbar bleiben. Eine direkte Frage nach Deinem Unternehmen beantwortet beispielsweise etwas anderes als eine offene Frage nach geeigneten Anbietern.

Der Nennungs- und Zitatrechner verarbeitet die daraus gewonnenen Summen. Ob die zugrunde liegenden Antworten sinnvoll zusammengefasst werden können, musst Du vorher anhand ihrer Bedingungen entscheiden. Wie ich Wiederholungen und Abhängigkeiten in meinen eigenen Erhebungen behandle, begründe ich in der Methodik des Lübecker KI-Monitors.

Primärquellen

  1. Methodik des Lübecker KI-Monitors · Patrick Stolp · abgerufen am · Eigene Messgrundsätze; keine unabhängige Bestätigung der Wiki-Inhalte.
  2. KI-Reiseplanung Lübeck · Patrick Stolp · abgerufen am · Originalveröffentlichung der Erhebung; der hier verwendete Ausschnitt stammt gesondert aus dem Vorversuch vom 09.08.2026.

Verwandte Referenzen

Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz