Studie „Evaluating Verifiability in Generative Search Engines“ (Stanford, 2023)
Erstellt am 08.10.2026
KI-Suchdienste setzen Quellenverweise hinter ihre Aussagen. Das wirkt belegt. Drei Forscher der Stanford University ließen Menschen nachprüfen, ob die verlinkten Seiten die Aussagen wirklich tragen. Das Ergebnis: Nur gut die Hälfte der Aussagen war voll durch ihre Quellen gedeckt, und jeder vierte Verweis stützte die Aussage nicht, hinter der er stand.
01
Steckbrief
| Titel | Evaluating Verifiability in Generative Search Engines |
|---|---|
| Autoren | Nelson F. Liu, Tianyi Zhang, Percy Liang (Stanford University, Informatik) |
| Veröffentlicht | April 2023 als Vorabdruck, 2023 im Band „Findings of EMNLP“ (begutachtet) |
| Art | Prüfung echter Dienste durch 34 geschulte Prüfer |
| Daten | Vier Dienste, je 1.450 Fragen; die Antworten wurden von Ende Februar bis Ende März 2023 abgerufen; die Bewertungen der Prüfer sind öffentlich |
| Förderung | Programm AI2050 von Schmidt Futures |
| Quelle | arxiv.org/abs/2304.09848 (Fassung 2 vom 23.10.2023, gelesen am 08.10.2026), DOI der Konferenzfassung: 10.18653/v1/2023.findings-emnlp.467 |
02
Was untersucht wurde
Geprüft wurden Bing Chat, NeevaAI, Perplexity und YouChat. ChatGPT und Googles Bard blieben außen vor, weil sie im März 2023 noch keine Quellenverweise im Text setzten. Die Fragen stammten aus zwölf Sammlungen: frühere Google-Suchanfragen, Fragen aus einem Erklärforum, Aufsatzthemen einer Aufnahmeprüfung in Oxford, Streitfragen und Anleitungsfragen.
Die Prüfer bewerteten jede Antwort in drei Schritten:
- Ist die Antwort flüssig geschrieben, und wirkt sie hilfreich? Jeweils auf einer Skala von 1 bis 5.
- Für jede Aussage über die Welt: Ist sie durch die angegebenen Quellen voll gedeckt? Als eine Aussage zählte dabei jeweils ein Satz der Antwort.
- Für jeden Verweis: Stützt die verlinkte Seite die Aussage ganz, teilweise oder gar nicht?
Daraus ergeben sich zwei Kennzahlen. Der Anteil belegter Aussagen sagt, wie viel der Antwort sich nachprüfen lässt. Der Anteil stützender Verweise sagt, wie oft ein Verweis hält, was er verspricht. Jede Antwort wurde einmal bewertet; an 250 Antworten mit je drei Prüfern lag die Übereinstimmung über 82 Prozent.
03
Die Ergebnisse
| Dienst | Aussagen voll belegt | Verweise, die stützen |
|---|---|---|
| Perplexity | 68,7 % | 72,7 % |
| NeevaAI | 67,6 % | 72,0 % |
| Bing Chat | 58,7 % | 89,5 % |
| YouChat | 11,1 % | 63,6 % |
| Mittel der vier Dienste | 51,5 % | 74,5 % |
Werte aus dem Text und den Tabellen 7 und 8 der Arbeit, Mittel über alle 1.450 Fragen je Dienst.
Weitere Befunde:
- Die Antworten wirken gut. Flüssigkeit erhielt im Mittel 4,48 von 5 Punkten, der Eindruck von Nützlichkeit 4,50.
- Je offener die Frage, desto weniger ist belegt. Bei Suchanfragen mit kurzer, eindeutiger Antwort waren 63,4 Prozent der Aussagen belegt, bei den offenen Aufsatzthemen 44,3 Prozent.
- Belegte Aussagen sind oft fast abgeschrieben. Wo eine Aussage durch ihre Quelle gedeckt war, lag sie im Wortlaut nah an der verlinkten Seite, am stärksten bei Bing Chat.
- Genaue Verweise und hilfreicher Eindruck liefen gegeneinander. Bing Chat hatte die verlässlichsten Verweise und galt als am wenigsten hilfreich, YouChat umgekehrt.
04
Grenzen
Belegt heißt nicht wahr. Die Autoren betonen selbst: Geprüft wurde, ob die Quelle die Aussage deckt, nicht, ob die Aussage stimmt.
Stand Frühjahr 2023. Die Dienste haben sich seither stark verändert, NeevaAI wurde eingestellt. ChatGPT und Gemini, die heute meistgenutzten, fehlen.
Vier Dienste sind wenig für einen Zusammenhang. Die Aussage, genaue Verweise gingen mit weniger hilfreichem Eindruck einher, stützt sich auf vier Wertepaare.
Satzweise Prüfung. Ein Satz mit zwei Aussagen und zwei Verweisen wurde als Ganzes bewertet. Die Autoren nennen das als Vereinfachung.
Englische Wissensfragen. Empfehlungsfragen zu Betrieben an einem Ort kommen nicht vor.
Eine Bewertung je Antwort. Die Übereinstimmung der Prüfer wurde nur an einer Stichprobe gemessen.
05
Abgleich mit unserer Messung
Unsere Breitenmessung vom 29.09.2026 hat gezählt, welche Quellen die Dienste angeben. Ob die Quellen die Aussagen tragen, haben wir nicht geprüft; dafür müsste ein Mensch jede verlinkte Seite lesen. Unsere Daten können das Ergebnis aus Stanford deshalb weder bestätigen noch widerlegen. Sie zeigen aber, wie oft bei lokalen Fragen schon die Voraussetzung fehlt: eine Quelle, an der sich die Antwort prüfen ließe.
Antworten ganz ohne Quelle
gemessen
| Dienst | Antworten | ohne jede Quelle |
|---|---|---|
| ChatGPT | 1.000 | 11 % |
| Gemini | 1.500 | 7 % |
| Perplexity | 1.500 | 0 % |
Breitenmessung vom 29.09.2026, Antworten über die Programmierschnittstellen mit eingeschalteter Websuche, ausgewertet am 08.10.2026. In der App der Dienste können die Werte anders liegen.
Betriebe werden genannt, ihre Website nicht immer zitiert
gemessen Bei allgemeinen Empfehlungsfragen zitierten die Dienste in 64 Prozent der Antworten die Website eines der genannten Betriebe, bei Fragen nach einer bestimmten Leistung in 94 Prozent. In gut einem Drittel der Empfehlungsantworten war also keine Website eines genannten Betriebs unter den Quellen. Woher die Angaben über die Betriebe dort stammen, lässt sich nur über Portale oder gar nicht nachvollziehen.
Was sich nicht vergleichen lässt
Die Stanford-Zahlen gelten für Wissensfragen im Jahr 2023 und für andere Dienste. Ob ChatGPT, Gemini und Perplexity heute bei Fragen nach Betrieben genauer belegen, wissen wir nicht. Eine Handprüfung an einer Stichprobe unserer Antworten wäre der passende nächste Schritt.
06
Was Betriebe daraus mitnehmen können
Einschätzung
- Ein Quellenverweis in einer KI-Antwort ist kein Beleg dafür, dass die Aussage über den eigenen Betrieb stimmt. Es lohnt sich, nachzulesen, was die Dienste über den Betrieb schreiben und worauf sie sich stützen.
- Die Dienste übernehmen Sätze oft fast wörtlich von den Seiten, die sie zitieren. Klare, für sich verständliche Sätze auf der eigenen Website (Leistung, Ort, Öffnungszeiten, Qualifikation) haben deshalb gute Aussichten, richtig wiedergegeben zu werden. Das folgt aus der Studie, wir haben es nicht selbst gemessen.
- Falsche Angaben über den Betrieb stammen nicht zwingend von der eigenen Seite. Einträge in Portalen und Verzeichnissen sollten deshalb dieselben Daten tragen.
Zu dieser Seite: Die Auswertung der Studie ist mit Hilfe eines KI-Assistenten entstanden, der den Volltext gelesen hat. Die Angaben wurden von Robert Fischer gegen die Arbeit geprüft. Weitere Studien: Übersicht.