Was die Studie zu ChatGPT-Zitationsfehlern zeigt
Fabrication and errors in the bibliographic citations im Überblick: Einordnung für Studium und Schreiben
William H. Walters und Esther Isabelle Wilder haben 2023 in Scientific Reports untersucht, wie häufig ChatGPT bei Literaturübersichten Quellenangaben erfindet oder fehlerhaft wiedergibt. Der Abstract des Papers Fabrication and errors in the bibliographic citations nennt die Fragestellung, das untersuchte Material und die Anteile erfundener sowie fehlerhafter Zitate.
Worum geht es in der Studie
Der Ausgangspunkt der Studie Fabrication and errors in the bibliographic citations ist eine einfache Beobachtung: Chatbots wie ChatGPT können Texte kostengünstig erzeugen und bearbeiten, doch inhaltlich falsche Antworten schränken ihren Nutzen ein. Walters und Wilder konzentrieren sich in ihrer 2023 in Scientific Reports veröffentlichten Arbeit auf eine bestimmte Art dieser Fehler, nämlich auf erfundene Literaturangaben, die keine real existierenden wissenschaftlichen Arbeiten wiedergeben. Solche Zitate stehen für Werke, die es so nicht gibt.
Für die Untersuchung ließen die Autoren ChatGPT kurze Literaturübersichten zu 42 fachübergreifenden Themen erstellen und werteten anschließend die darin enthaltenen bibliografischen Angaben aus. Im Zentrum steht damit die Frage, wie zuverlässig von einem Sprachmodell erzeugte Quellenangaben tatsächlich sind. Diese Fragestellung führt unmittelbar zu dem, was im Sprachgebrauch als erfundene ChatGPT-Quellen bezeichnet wird: Quellenangaben, die keinem realen Text entsprechen. Weil ein Teil der Zitate erfunden ist, ist die Unterscheidung zwischen echten und erfundenen Angaben für Studierende und Schreibende eine praktische Herausforderung, die unmittelbar mit dem Thema dieser Studie zusammenhängt.
Autoren sind William H. Walters und Esther Isabelle Wilder; wie die Autorenreihenfolge im Paper in einer Quellenangabe wiedergegeben wird, erklärt ein eigener Beitrag. Inhaltlich zählen im Abstract vor allem die genannten Werte zu erfundenen und fehlerhaften Zitaten.
Die im Abstract beschriebenen Anteile erfundener und fehlerhafter Zitate beziehen sich ausschließlich auf die 636 untersuchten Zitationen aus 84 von ChatGPT erzeugten Texten.

Mit welcher Methode und welchem Material die Studie arbeitet
Laut Abstract nutzten Walters und Wilder sowohl ChatGPT-3.5 als auch ChatGPT-4, um kurze Literaturübersichten zu 42 verschiedenen, fachübergreifenden Themen erstellen zu lassen. Ausgewertet wurden die 636 bibliografischen Zitationen aus den dabei entstandenen 84 Texten. Damit ist der Umfang des untersuchten Materials beschrieben.
Um die Qualität der erzeugten Zitate zu beurteilen, durchsuchten die Autoren mehrere Datenbanken und Webseiten. Auf dieser Grundlage ermittelten sie, wie verbreitet erfundene Zitate in den erzeugten Texten sind, welche Fehler bei den tatsächlich existierenden, also nicht erfundenen Arbeiten auftreten, und inwieweit die Zitate dem APA-Zitierstil entsprechen. Dieses dreiteilige Vorgehen zeigt, worauf eine Prüfung KI-generierter Quellenangaben achten kann: Existenz der Werke, Fehler in den Angaben und Zitierformat.
Weitere Angaben zur genauen Auswahl der 42 Themen oder zur Vorgehensweise bei der Datenbankrecherche finden sich im vollständigen Text des Papers in Scientific Reports, der für eine vertiefte Methodendiskussion herangezogen werden kann.
Welche Ergebnisse der Abstract nennt
Der Abstract der Studie Fabrication and errors in the bibliographic citations benennt mehrere konkrete Werte zum Anteil erfundener und fehlerhafter Zitate. Diese Angaben lassen sich wie folgt zusammenfassen:
- 55 Prozent der von ChatGPT-3.5 erzeugten Zitate sind laut Abstract erfunden.
- Bei ChatGPT-4 liegt dieser Anteil bei 18 Prozent der Zitate.
- Von den echten, also nicht erfundenen Zitaten aus ChatGPT-3.5 enthalten 43 Prozent inhaltliche Zitationsfehler.
- Bei den echten Zitaten aus ChatGPT-4 betrifft das 24 Prozent.
- Der Abstract hält fest, dass ChatGPT-4 gegenüber ChatGPT-3.5 eine deutliche Verbesserung darstellt, zugleich aber weiterhin Probleme bestehen bleiben.
Alle Prozentwerte beziehen sich auf die Auswertung der 636 Zitationen aus 84 Texten. Wie ein Abstract Fragestellung, Methode und Ergebnis knapp zusammenfasst, erklärt der Text zum Aufbau eines Abstracts. Weitergehende Angaben, etwa zu einzelnen Fachgebieten der 42 Themen oder zu spezifischen Fehlerarten, finden sich im vollständigen Artikeltext in Scientific Reports.
Was daraus für Studium und Schreiben folgen kann
Für Studierende, Promovierende und andere Schreibende, die ChatGPT bei der Recherche oder beim Formulieren von Literaturübersichten einsetzen, liefert der Abstract der Studie von Walters und Wilder einen konkreten Anknüpfungspunkt. Die genannten Anteile erfundener und fehlerhafter Zitate bei ChatGPT-3.5 und ChatGPT-4 legen nahe, jede von einem Sprachmodell erzeugte Quellenangabe vor der Übernahme in eine eigene Arbeit eigenständig zu überprüfen.
Ein praktischer Ansatzpunkt liegt dabei in der Kontrolle des Zitierformats: Da die Studie ausdrücklich die Einhaltung des APA-Formats prüft, liegt es nahe, bei eigenen Arbeiten die verwendete APA-Zitierweise konsequent mit den Original-Veröffentlichungen abzugleichen, statt sich allein auf eine automatisch erzeugte Formatierung zu verlassen. Gerade weil ein Teil der Zitate erfunden ist, lohnt sich ein Blick in die tatsächliche Fachzeitschrift oder Datenbank, bevor eine Angabe in das eigene Literaturverzeichnis übernommen wird.
Praktisch heißt das: Von einem Sprachmodell vorgeschlagene Quellen gelten als vorläufig, bis eine unabhängige Prüfung stattgefunden hat. Die im Abstract berichteten Anteile fehlerhafter Zitate machen das nachvollziehbar.

Für wen sich das Lesen lohnt und wie man zitiert
Das Paper richtet sich inhaltlich an alle, die sich mit der Zuverlässigkeit KI-generierter Texte und insbesondere mit bibliografischen Angaben befassen, etwa im Rahmen einer Abschlussarbeit oder eines Forschungsprojekts, das ChatGPT zur Literaturrecherche einsetzt. Da der Abstract nur die Fragestellung, das Vorgehen und die zentralen Anteile erfundener und fehlerhafter Zitate zusammenfasst, empfiehlt es sich, den vollständigen Artikel in Scientific Reports selbst zu lesen, bevor einzelne Aussagen daraus in einer eigenen Arbeit zitiert werden.
Für die Aufnahme in ein eigenes Literaturverzeichnis lässt sich die Studie nach APA wie folgt angeben: Walters, W. H., & Wilder, E. I. (2023). Fabrication and errors in the bibliographic citations generated by ChatGPT. Scientific Reports. https://doi.org/10.1038/s41598-023-41032-5. Sie enthält Autoren, Jahr, Titel, Zeitschrift und DOI.
Eine Anleitung zum Literaturverzeichnis Schritt für Schritt bietet Orientierung dafür, wie Angaben wie Autor, Jahr, Titel und DOI in der richtigen Reihenfolge zusammengeführt werden. Für das hier besprochene Paper bedeutet das konkret, die oben genannte APA-Angabe vollständig zu übernehmen und bei Unsicherheiten zusätzlich die DOI direkt auf der Verlagsseite von Springer Nature aufzurufen, um Titel, Autorennamen und Erscheinungsjahr vor dem eigenen Zitat noch einmal zu bestätigen.
Quellen und Stand
- Crossref-Abstract: Fabrication and errors in the bibliographic citations: doi.org (geprüft am 2026-10-02)
- Bibliografische Angaben: Fabrication and errors in the bibliographic citations: doi.org (geprüft am 2026-10-02)
- Einordnung: Fabrication and errors in the bibliographic citations: api.crossref.org (geprüft am 2026-10-02)
Der vollständige Titel zu „Was die Studie zu ChatGPT-Zitationsfehlern zeigt“ lautet „Erfundene ChatGPT-Zitate: Studie von Walters und Wilder“.