Blog

Halluzinationen in GPT-5: Wie groß ist das Problem noch?

Das neue GPT-5 wirbt damit, „80% weniger Fehler“ zu machen als sein Vorgänger GPT-4o. Trotzdem melden erste Tests: Auch die fünfte Generation kann Tatsachen erfinden, Quellen verdrehen oder Zitate frei erfinden. In diesem Beitrag erläutere ich,

1 Warum halluzinieren Sprachmodelle?

LLMs entstehen durch das Wahrscheinlichkeits­training: Das Modell lernt aus riesigen Textkorpora, welches Wort statistisch am besten auf ein anderes folgt. Faktenkenntnis ist dabei Nebenprodukt, nicht Ziel. Wenn der Trainingsbestand unscharf oder widersprüchlich ist, füllt das Modell Lücken mit „plausiblen“ Phrasen – es halluziniert.

Typische Auslöser:

2 Wie viel besser ist GPT-5?

OpenAI nennt drei Kernmaßnahmen:

  1. Mehrschichtige Verifikationsschleife im Thinking-Modus: Der Entwurf wird intern gegen Fakten geprüft, bevor er den Chat verlässt.
  2. Größeres Kontextfenster: Bis zu 400,000 Tokens erlauben, Primärquellen direkt in den Prompt zu legen, statt sie grob zusammenzufassen.
  3. Safe-completions-Framework: Vor Veröffentlichung checkt ein Begleitmodell die Ausgabe auf Irrtümer und Richtlinienverstöße.

Interne Benchmarks berichten von rund 65% weniger Halluzinationen; externe Early-Access-Tests bestätigen eine deutliche Abnahme grober Fehler, finden aber weiterhin fiktive DOI-Nummern, falsch datierte Studien und ungenaue Statistiken.

3 Was heißt das für Forschende?

3.1 Erkennbare Verbesserungen

3.2 Bleibende Stolpersteine

4 Praxisleitfaden gegen Halluzinationen

SchrittZweckEmpfehlung
Primärtexte anfütternKontextlücken schließenRelevante Paper, Datentabellen oder Gesetzestexte direkt in den Prompt laden (Dank 400 k Tokens).
Rollen-PromptingStringenz steigern„Agiere als Peer-Reviewer. Verwerfe Antwort, wenn du <2 Primärquellen> findest.“
Chain-of-Thought offenlegen lassenZwischenlogik prüfen„Zeige deine Beweiskette Schritt für Schritt, bevor du die Schlussfolgerung ziehst.“
Fakten-Ping-PongSelbstkorrektur erzwingen„Nenne drei Studien, dann verifiziere jede Quelle mit DOI und Journal-Jahrgang.“
Temperatur ≤0.3Kreativität drosselnNiedrige Sampling-Werte reduzieren Wortfantasie.
Menschliche Reviewletzte InstanzZitate, Zahlen, Code immer gegen Originale prüfen – keine Abkürzungen.

5 Ausblick

GPT-5 beweist, dass systematische Reduktion von Halluzinationen möglich ist – ein echter Fortschritt für wissenschaftliche Anwendungen. Doch solange Statistik statt Semantik regiert, bleiben Phantome Teil des Spiels. Der kluge Umgang besteht darin, das Modell als Beschleuniger zu nutzen, nicht als Wahrheits­maschine:

So wird GPT-5 vom Risiko zum Research-Booster – mit klarer Verantwortung auf menschlicher Seite.

Dazu passend

4. August 2026

Wer nicht nachfragt, nickt

Führungskräfte müssen KI nicht bedienen können. Verantworten müssen sie sie trotzdem. Über die Fragen, die ein Anbieterpitch aushalten muss — und warum…

Weiterlesen