Studie „GEO: Generative Engine Optimization“ (Princeton, 2024)
Erstellt am 08.10.2026
Diese Arbeit hat dem Thema seinen Namen gegeben. Sie wird in fast jedem Text über GEO mit einem Satz zitiert: Zahlen, Zitate und Quellenangaben auf der eigenen Seite erhöhen die Sichtbarkeit in KI-Antworten um bis zu 40 Prozent. Wir haben die Arbeit im Volltext gelesen. Der Satz stimmt, aber nur für eine enge Versuchsanordnung, die mit der Frage eines Handwerksbetriebs wenig zu tun hat.
01
Steckbrief
| Titel | GEO: Generative Engine Optimization |
|---|---|
| Autoren | Pranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit, Ashwin Kalyan, Karthik Narasimhan, Ameet Deshpande (Princeton University, Indian Institute of Technology Delhi, zwei ohne Hochschule) |
| Veröffentlicht | November 2023 als Vorabdruck, 2024 auf der Fachkonferenz KDD (begutachtet) |
| Art | Experiment mit einem selbst gebauten Antwortsystem, ergänzt um einen Test bei Perplexity |
| Daten | 10.000 Fragen, ausgewertet wurden die 1.000 Fragen des Testteils; Fragen und Programmcode sind öffentlich |
| Förderung | National Science Foundation (USA) |
| Quelle | arxiv.org/abs/2311.09735 (Fassung 3 vom 28.06.2024, gelesen am 08.10.2026), DOI der Konferenzfassung: 10.1145/3637528.3671900 |
02
Was untersucht wurde
Die Autoren wollten wissen, ob sich der Text einer Webseite so verändern lässt, dass ein KI-Suchdienst mehr davon in seine Antwort übernimmt. Dazu bauten sie ein eigenes Antwortsystem:
- Zu jeder Frage holte das System die fünf obersten Treffer der Google-Suche.
- Das Sprachmodell GPT-3.5 schrieb aus diesen fünf Texten eine Antwort mit Quellenverweisen.
- Eine der fünf Quellen wurde zufällig ausgewählt und ihr Text mit je einer von neun Methoden umgeschrieben. Das Umschreiben erledigte ebenfalls ein Sprachmodell.
- Danach wurde die Antwort neu erzeugt und verglichen.
„Sichtbarkeit“ heißt in der Arbeit: der Anteil des Antworttexts, der sich auf diese eine Quelle stützt, gewichtet danach, wie weit vorn er steht. Als zweites Maß ließ man GPT-3.5 selbst einschätzen, wie auffällig die Quelle in der Antwort ist. Vier Fünftel der Fragen waren Wissensfragen, etwa „Was bedeutet Globalisierung?“ oder „Warum ist der Blutzucker nach dem Essen höher?“.
03
Die Ergebnisse
Ohne Änderung entfielen auf die ausgewählte Quelle im Mittel 19,3 Prozent des Antworttexts; bei fünf Quellen wären 20 Prozent der Gleichstand. Die Tabelle zeigt, was die neun Methoden daran änderten.
| Änderung am Text der Quelle | Anteil an der Antwort | Veränderung |
|---|---|---|
| Zitate aus glaubwürdigen Quellen einfügen | 27,2 % | +41 % |
| Zahlen statt allgemeiner Aussagen | 25,2 % | +31 % |
| Flüssiger formulieren | 24,7 % | +28 % |
| Quellen für Aussagen nennen | 24,6 % | +27 % |
| Fachbegriffe ergänzen | 22,7 % | +18 % |
| Einfacher formulieren | 22,0 % | +14 % |
| Überzeugender, bestimmter Ton | 21,3 % | +10 % |
| Ungewöhnliche Wörter ergänzen | 20,5 % | +6 % |
| Suchbegriffe häufen (Keyword-Stuffing) | 17,7 % | −8 % |
Werte aus Tabelle 1 der Arbeit (positionsgewichteter Wortanteil, Mittel aus fünf Durchgängen). Die Spalte „Veränderung“ haben wir aus diesen Werten gegen den Ausgangswert 19,3 berechnet.
Drei weitere Befunde:
- Hintere Treffer gewinnen, der erste verliert. Wurden alle fünf Quellen zugleich mit Quellenangaben versehen, stieg der Anteil der Quelle auf Platz fünf der Google-Suche um 115 Prozent, der Anteil der Quelle auf Platz eins sank um 30 Prozent.
- Die Wirkung hängt vom Thema ab. Zahlen halfen am meisten bei Fragen zu Recht und Politik, Zitate bei Gesellschaft und Geschichte.
- Kombinationen bringen etwas mehr. Flüssiger Text plus Zahlen war das beste Paar, geprüft an 200 Fragen.
04
Der Test bei Perplexity
Die Arbeit prüft die Methoden auch an einem echten Dienst, an Perplexity. Dort ließen sich die Quellen aber nicht vorgeben. Die Autoren luden die fünf Texte deshalb als Dateien hoch und ließen Perplexity nur daraus antworten, bei 200 Fragen. Zitate brachten dabei nach Angabe der Arbeit 22 Prozent mehr Wortanteil, Zahlen 37 Prozent mehr in der Einschätzung durch das Sprachmodell.
Zwei Zeilen dieser Tabelle passen nicht zur Zusammenfassung im Text der Arbeit. Bei „Quellen nennen“ stieg der Wortanteil von 24,1 auf 26,8, die Einschätzung durch das Sprachmodell fiel aber von 24,7 auf 19,0. Und das Häufen von Suchbegriffen schnitt beim Wortanteil schlechter ab (21,9), in der Einschätzung aber besser als der Ausgangswert (28,1). Die Arbeit erwähnt beides nicht.
05
Grenzen
Einige nennen die Autoren selbst, andere ergeben sich aus dem Aufbau.
Die Quelle ist schon ausgewählt. Die Studie beginnt an dem Punkt, an dem eine Seite bereits unter den fünf Quellen ist. Ob eine Seite überhaupt gefunden wird, hat sie nicht untersucht.
Kein echter Betrieb des Dienstes. Das Hauptergebnis stammt aus einem Nachbau mit GPT-3.5, einem Modell von 2023. Bei Perplexity wurden Dateien hochgeladen, keine Webseiten durchsucht.
„40 Prozent“ ist ein Verhältnis. Gemeint ist der Sprung von 19 auf 27 Prozent des Antworttexts, also acht Prozentpunkte mehr Raum in einer Antwort, in der die Seite ohnehin vorkommt.
Wissensfragen, keine Empfehlungsfragen. „Welcher Elektriker in Köln ist empfehlenswert?“ kommt in den Beispielen nicht vor. Die Fragen sind englisch.
Ob die eingefügten Zahlen stimmen, war nicht Thema. Ein Sprachmodell hat Zahlen, Zitate und Quellenangaben in die Texte geschrieben. Die Arbeit sagt nicht, dass sie geprüft wurden.
Das zweite Maß bewertet sich selbst. Die „subjektive“ Sichtbarkeit schätzte dasselbe Sprachmodell, das auch die Antworten schrieb.
Die Autoren schreiben selbst, dass die Methoden sich mit den Diensten ändern können und dass sie nicht geprüft haben, wie sich die Textänderungen auf die Platzierung in der Suche auswirken.
06
Abgleich mit unserer Messung
Unsere Breitenmessung vom 29.09.2026 hat eine andere Frage gestellt: Welche Betriebe und welche Quellen kommen in 4.000 Antworten von ChatGPT, Gemini und Perplexity überhaupt vor? Die Princeton-Arbeit fragt, wie viel Raum eine Quelle bekommt, die schon ausgewählt ist. Unsere Daten können ihr Hauptergebnis deshalb weder bestätigen noch widerlegen. Sie zeigen aber, wie groß der Teil ist, den die Studie ausklammert.
Die Auswahl der Quellen wechselt stark
gemessen Wir haben jede Frage je Dienst mehrfach gestellt und verglichen, welche Websites die Antworten zitieren.
| Dienst | Websites je Antwort | Gemeinsam bei Wiederholung |
|---|---|---|
| ChatGPT | 5 | 29 % |
| Gemini | 8 | 45 % |
| Perplexity | 3 | 78 % |
Breitenmessung vom 29.09.2026, 4.000 Antworten über die Programmierschnittstellen mit Websuche, ausgewertet am 08.10.2026. „Websites je Antwort“: zitierte Websites, Median. „Gemeinsam bei Wiederholung“: Für je zwei Antworten desselben Dienstes auf dieselbe Frage der Anteil der Websites, die in beiden zitiert werden, an allen Websites der beiden Antworten; Mittel über alle Paare.
Die Annahme der Studie, dass fünf Quellen in eine Antwort eingehen, passt zur Größenordnung bei ChatGPT. Der Schritt davor ist aber alles andere als fest: Fragt man ChatGPT zweimal dasselbe, stimmen im Mittel nur 29 Prozent der zitierten Websites überein. Ein besserer Text nützt nur in den Antworten, für die die Seite ausgewählt wurde.
Suchbegriffe wirken an anderer Stelle
gemessen Die Studie findet, dass gehäufte Suchbegriffe beim Schreiben der Antwort nicht helfen. Das widerspricht unseren Daten nicht, denn wir sehen die Wirkung der Wortwahl einen Schritt früher: Gemini sucht bei Empfehlungsfragen mit eigenen Begriffen wie „beste … Bewertungen“ und zitiert dann Portale, deren Seitentitel genau so lautet (siehe KI-Sichtbarkeit und Portale). Diesen Suchschritt hat die Studie nicht geprüft.
Passender Inhalt wird zitiert
gemessen Bei Fragen nach einer bestimmten Leistung zitierten die Dienste in 94 Prozent der Antworten die Website eines genannten Betriebs, bei allgemeinen Empfehlungsfragen in 64 Prozent. Das passt zur Richtung der Studie, dass der Inhalt der Seite zählt. Es ist aber kein Beleg für ihre Methoden: Wir haben nicht untersucht, ob die zitierten Seiten Zahlen, Zitate oder Quellenangaben enthalten.
07
Was Betriebe daraus mitnehmen können
Einschätzung
- Konkrete Angaben schaden nicht und sind nach dieser Studie im Vorteil: Zahlen, überprüfbare Aussagen, klare Sprache. Das gilt nur für wahre Angaben. Erfundene Zahlen oder Zitate wären Täuschung der Kunden.
- Suchbegriffe im Text zu häufen bringt beim Schreiben der Antwort nichts.
- Für einen lokalen Betrieb liegt die größere Hürde davor: unter die zitierten Quellen zu kommen. Dazu sagt diese Studie nichts. Was unsere Messungen dazu zeigen, steht in den Grundlagen.
- Wer mit „40 Prozent mehr Sichtbarkeit“ wirbt, zitiert einen Laborwert für Wissensfragen aus dem Jahr 2023. Eine Zusage für die Nennung eines Betriebs lässt sich daraus nicht ableiten.
Zu dieser Seite: Die Auswertung der Studie ist mit Hilfe eines KI-Assistenten entstanden, der den Volltext gelesen hat. Die Angaben wurden von Robert Fischer gegen die Arbeit geprüft. Weitere Studien: Übersicht.