KI-Antworten dokumentieren: Ein Referenzbogen für den Vergleich
Eine gespeicherte KI-Antwort wird erst dann für einen Vergleich brauchbar, wenn ich auch weiß, unter welchen Bedingungen sie entstanden ist. Die Frage kann bereits einen Ort oder einen bestimmten Anbieter enthalten haben. Vielleicht gab es vorherige Nachrichten, vielleicht war die Websuche eingeschaltet. Diese Angaben gehören für mich zur Beobachtung, weil sonst offenbleibt, was die Antwort eigentlich beantwortet hat.
Diese Angaben gehören zur gespeicherten Antwort
Abschnitt betitelt „Diese Angaben gehören zur gespeicherten Antwort“Mit dem folgenden Referenzbogen kannst Du eine einzelne Ausgabe dokumentieren. Er ist ein Arbeitsvorschlag für die Nachprüfung und schreibt keine bestimmte Messsoftware vor.
| Feld | Eintrag |
|---|---|
| Antwort-ID | Eine eindeutige Kennung, die auch im Dateinamen verwendet wird |
| Zeitpunkt | Datum, Uhrzeit und Zeitzone der Abfrage |
| Produkt und Zugang | Produktname sowie Browser, App oder API |
| Modellangabe | Sichtbare Bezeichnung oder zurückgegebene Modellkennung; fehlende Angaben als unbekannt markieren |
| Frage | Vollständiger Wortlaut einschließlich Ort, Sprache, Budget und anderer Vorgaben |
| Gesprächskontext | Neue Unterhaltung oder relevante vorherige Nachrichten |
| Weitere Vorgaben | Bei einer API-Abfrage beispielsweise Systemanweisung und dokumentierte Konfiguration |
| Webzugriff | Was eingestellt war und welche tatsächliche Nutzung die Ausgabe oder das Protokoll erkennen lässt |
| Personalisierung | Bekannte Erinnerungen, individuelle Anweisungen oder sonstige dokumentierte Einstellungen |
| Standort | Standort im Prompt, in einer Einstellung oder in der Abfragekonfiguration; unbekannte Einflüsse offenlassen |
| Antwort | Vollständige Ausgabe in der ursprünglichen Reihenfolge |
| Quellen | Sichtbare Links, Quellenmarker und deren Zuordnung zu Aussagen |
| Prüfstand | Datum des späteren Quellenabrufs und Ergebnis der inhaltlichen Prüfung |
Du kannst die Tabelle kopieren oder den Referenzbogen als Textdatei verwenden. Private Gesprächsinhalte und Kontodaten gehören nicht in eine öffentliche Beispielsammlung. Für die interne Nachprüfung genügt gegebenenfalls ein Vermerk, dass zusätzlicher Kontext vorhanden war und deshalb keine vollständig offene Reproduktion möglich ist.
Beobachtete Angaben und vermutete Bedingungen trennen
Abschnitt betitelt „Beobachtete Angaben und vermutete Bedingungen trennen“Wenn ein Produkt einen Modellnamen anzeigt, halte ich genau diese Bezeichnung fest. Daraus würde ich keine nicht sichtbare Modellversion ableiten. Ähnlich ist es bei der Suche: Ein bereitgestelltes Suchwerkzeug und seine tatsächliche Nutzung sind zwei unterschiedliche Angaben. Bei einer API-Abfrage kann das Protokoll Suchaufrufe ausweisen; in einer Chat-Oberfläche steht möglicherweise nur eine Quellenliste zur Verfügung.
Fehlt ein Quellenlink, belegt das allein noch nicht, dass das System ausschließlich mit Trainingswissen gearbeitet hat. Umgekehrt lässt sich aus einem sichtbaren Link keine vollständige Liste aller abgerufenen Seiten rekonstruieren. Welche dieser Beobachtungen Du tatsächlich prüfen kannst, hängt vom jeweiligen Zugang und seinen gespeicherten Daten ab.
Erhebungsdatum und Datum der Frage auseinanderhalten
Abschnitt betitelt „Erhebungsdatum und Datum der Frage auseinanderhalten“In einem gespeicherten Vorversuch meiner Lübecker Reiseplan-Erhebung entstand am 9. August 2026 eine Antwort zu einem geplanten Besuch am 24. August 2026. Beide Daten sind erforderlich: Das erste bezeichnet die Abfrage, das zweite den Tag, für den die vorgeschlagenen Öffnungszeiten gelten sollten.
Die Antwort kam laut Laufbericht über die API mit der Konfiguration gpt-5-mini und Websuchwerkzeug zustande. Das macht sie zu einer dokumentierten API-Beobachtung. Wie dieselbe Frage in der ChatGPT-Oberfläche beantwortet worden wäre, wurde damit nicht mitgemessen. Am gespeicherten Zitatfall zum Buddenbrookhaus lässt sich außerdem nachvollziehen, weshalb auch der Zeitpunkt der späteren Quellenprüfung erhalten bleiben muss.
Was bei einem Vergleich gleich bleiben sollte
Abschnitt betitelt „Was bei einem Vergleich gleich bleiben sollte“Für wiederholte Abfragen halte ich Wortlaut, Zugang und bekannte Einstellungen möglichst gleich und dokumentiere Änderungen. Unterschiedliche Fragen können ebenfalls sinnvoll sein, sollten aber getrennt auswertbar bleiben. Eine direkte Frage nach Deinem Unternehmen beantwortet beispielsweise etwas anderes als eine offene Frage nach geeigneten Anbietern.
Der Nennungs- und Zitatrechner verarbeitet die daraus gewonnenen Summen. Ob die zugrunde liegenden Antworten sinnvoll zusammengefasst werden können, musst Du vorher anhand ihrer Bedingungen entscheiden. Wie ich Wiederholungen und Abhängigkeiten in meinen eigenen Erhebungen behandle, begründe ich in der Methodik des Lübecker KI-Monitors.
Primärquellen
- Methodik des Lübecker KI-Monitors · Patrick Stolp · abgerufen am · Eigene Messgrundsätze; keine unabhängige Bestätigung der Wiki-Inhalte.
- KI-Reiseplanung Lübeck · Patrick Stolp · abgerufen am · Originalveröffentlichung der Erhebung; der hier verwendete Ausschnitt stammt gesondert aus dem Vorversuch vom 09.08.2026.
Verwandte Referenzen
Herausgeber und verantwortlicher Autor: Patrick Stolp · Redaktion · Impressum · Datenschutz