Studie „Diagnosing and Repairing Citation Failures“ (2026)
Erstellt am 08.10.2026
Die meisten Arbeiten zu GEO fragen, wie man mehr Raum in einer KI-Antwort bekommt. Diese fragt, was davor liegt: Warum wird eine Seite, die zum Thema passt und gefunden wurde, überhaupt nicht als Quelle genannt? Forscher von Virginia Tech und der Zhejiang-Universität haben dafür ein Antwortsystem nachgebaut. Zwei Ergebnisse sind für Betriebe wichtig: Meist passt der Inhalt nicht zur Frage, und manche Seiten kommen gegen bekannte Namen nicht an, egal was man an ihnen ändert.
01
Steckbrief
| Titel | Diagnosing and Repairing Citation Failures in Generative Engine Optimization |
|---|---|
| Autoren | Zhihua Tian, Yuhan Chen, Yao Tang, Jian Liu, Ruoxi Jia (Virginia Tech, USA, und Zhejiang-Universität, China) |
| Veröffentlicht | März 2026 als Vorabdruck bei arXiv, nicht begutachtet |
| Art | Experiment mit einem nachgebauten Antwortsystem, keine echten Dienste |
| Daten | 949 Paare aus einer nicht zitierten und einer zitierten Seite zur selben Frage; für den Versuch 204 Webseiten mit je 60 Fragen (12.240 Fragen), die ein Sprachmodell erzeugt hat |
| Förderung | im gelesenen Teil keine Angabe |
| Quelle | arxiv.org/abs/2603.09296 (Fassung 1 vom 10.03.2026, gelesen am 08.10.2026) |
02
Was untersucht wurde
Die Arbeit hat zwei Teile.
- Ursachen. Für 949 Fälle, in denen eine gefundene Seite nicht zitiert wurde, eine andere zur selben Frage aber schon, wurde der Unterschied bestimmt und in Gruppen eingeteilt.
- Abhilfe. Ein Programm namens AgentGEO stellt je Seite fest, woran es liegt, ändert gezielt die betroffene Stelle und prüft, ob die Seite danach zitiert wird. Verglichen wurde es mit den pauschalen Methoden der Princeton-Arbeit und einem weiteren Verfahren.
Gemessen wurde nicht der Anteil am Antworttext, sondern die einfache Frage: zitiert oder nicht? Geprüft wurde mit Fragen, die das Programm beim Ändern nicht kannte. Das Antwortsystem bestand aus üblichen Bausteinen mit den Sprachmodellen GPT-4.1 mini und Claude Haiku 4.5.
03
Die Ergebnisse
Woran es liegt, wenn eine Seite nicht zitiert wird
| Ursache | Anteil der Fälle |
|---|---|
| Inhalt passt nicht zur Frage (andere Absicht, fehlende Begriffe, veraltet, falsches Land) | 62,2 % |
| Inhalt passt, ist aber schwach aufbereitet (zu dünn, zerstückelt, zu ausschweifend, ungegliedert) | 27,1 % |
| Technik (Abruf gesperrt, Inhalt nur über JavaScript, viel Beiwerk um wenig Text) | 10,1 % |
| Außerhalb der Seite (eine bekanntere Quelle sagt dasselbe; Inhalt steht zu weit hinten) | 0,6 % |
Werte aus Abbildung 2 und Abschnitt 3.2 der Arbeit, 949 Fälle.
Ohne jede Änderung blieben 43 Prozent der thematisch passenden Seiten unzitiert.
Was die Änderungen brachten
| Verfahren | Seite wird zitiert | Veränderung |
|---|---|---|
| ohne Änderung | 56,6 % | – |
| Zitate einfügen | 59,0 % | +4 % |
| Zahlen einfügen | 60,5 % | +7 % |
| Quellen nennen | 60,5 % | +7 % |
| Suchbegriffe häufen | 62,4 % | +10 % |
| Einfacher formulieren | 71,1 % | +26 % |
| Gezielte Diagnose und Korrektur (AgentGEO) | 79,5 % | +41 % |
Werte aus Tabelle 2 der Arbeit (Antwortsystem mit GPT-4.1 mini, Verweise im Text); die Spalte „Veränderung“ haben wir daraus berechnet. Nicht alle geprüften Verfahren sind aufgeführt.
- Die bekannten Rezepte bringen hier wenig. Zahlen, Zitate und Quellenangaben, die in der Princeton-Arbeit vorn lagen, hoben die Zitierquote nur um wenige Punkte. Einfachere Sprache half deutlich mehr.
- Gezielt ändern genügt. AgentGEO veränderte rund 5 Prozent des Textes, die pauschalen Verfahren rund 25 Prozent.
- Pauschale Regeln können schaden. Bei Themen, deren Seiten schon oft zitiert wurden, senkte das zweite Vergleichsverfahren die Quote. Bei Gesundheitsthemen verschlechterte auch AgentGEO das Ergebnis leicht, weil beim Ändern Fachangaben verloren gingen.
- Nicht jede Seite ist zu retten. In einem Teilversuch mit 50 Seiten stieg die Quote bei den Fragen, an denen geändert wurde, von 57,0 auf 83,7 Prozent; 163 Fragen blieben ohne Zitat. Beispiel der Autoren: Die Kursseite einer Universität wurde bei der Frage nach den besten Online-Kursen trotz verbesserter Beschreibung nicht zitiert; genannt wurden die großen Kursplattformen.
04
Grenzen
Nachbau statt echter Dienst. Die Autoren schreiben selbst, dass die Prüfung an ChatGPT, Perplexity oder Google noch aussteht.
Nicht begutachtet. Die Arbeit ist ein Vorabdruck.
Erfundene Fragen. Die 12.240 Fragen hat ein Sprachmodell zu den Seiten erzeugt. Ob Menschen so fragen, ist offen.
Die Einteilung der Ursachen. Wie die 949 Fälle den Gruppen zugeordnet wurden und ob Menschen das nachgeprüft haben, steht nicht im Hauptteil.
Nur gefundene Seiten. Untersucht wurden Seiten, die die Suche schon geliefert hatte. Ob eine Seite gefunden wird, bleibt wie bei Princeton außen vor.
Kleiner Teilversuch. Der Vergleich zweier Sprachmodelle und die Analyse der Fehlschläge stützen sich auf 50 Seiten.
05
Abgleich mit unserer Messung
Wir haben echte Dienste befragt und gezählt, was sie zitieren. Die Studie hat ein nachgebautes System und kann dafür in die einzelne Seite hineinsehen. Die Zahlen lassen sich nicht nebeneinanderstellen, zwei Befunde aber schon.
Passung zur Frage: stützt unseren Befund
gemessen In der Studie ist fehlende Passung mit 62 Prozent die häufigste Ursache dafür, nicht zitiert zu werden. Bei uns zeigt sich die Kehrseite: Bei Fragen nach einer bestimmten Leistung zitierten die Dienste in 94 Prozent der Antworten die Website eines genannten Betriebs, bei allgemeinen Empfehlungsfragen in 64 Prozent. Eine Seite, die genau die gefragte Leistung beschreibt, wird also deutlich häufiger herangezogen.
Bekannte Namen gewinnen: stützt unseren Befund
gemessen Die Studie beschreibt Seiten, die trotz Verbesserung gegen große Plattformen verlieren. In unseren 4.000 Antworten zu lokalen Betrieben stehen an der Spitze der zitierten Websites ebenfalls keine Betriebe, sondern Verzeichnisse: werkenntdenbesten.de in 21 Prozent der Antworten, dasoertliche.de in 14, trustlocal.de und gelbeseiten.de in je 13 Prozent. Einschätzung Für einen Betrieb heißt das: Neben der eigenen Seite zählt der Eintrag dort, wo die Dienste ohnehin nachsehen.
Was wir nicht prüfen können
Ob einfachere Sprache oder eine gezielte Korrektur die Zitierquote bei ChatGPT, Gemini oder Perplexity tatsächlich hebt, haben wir nicht gemessen. Dafür müsste man Seiten ändern und vorher wie nachher messen.
06
Was Betriebe daraus mitnehmen können
Einschätzung
- Zuerst prüfen, ob die Seite die Frage beantwortet, die Kunden stellen: die Leistung, der Ort, die Begriffe, die Kunden verwenden. Das war in der Studie der häufigste Mangel.
- Die Technik nicht vergessen: Inhalte, die nur per JavaScript erscheinen oder für KI-Dienste gesperrt sind, können nicht zitiert werden. Das war jeder zehnte Fall.
- Pauschale Rezepte („Zahlen einbauen, Zitate einbauen“) mit Vorsicht behandeln. In dieser Studie brachten sie wenig, und Umschreiben kann Fachangaben zerstören.
- Bei allgemeinen Fragen gewinnen oft große Plattformen. Dort hilft eher der eigene Eintrag auf der Plattform als eine weitere Überarbeitung der eigenen Seite.
Zu dieser Seite: Die Auswertung der Studie ist mit Hilfe eines KI-Assistenten entstanden, der den Hauptteil der Arbeit gelesen hat. Die Angaben wurden von Robert Fischer gegen die Arbeit geprüft. Weitere Studien: Übersicht.