Blog

World Models

World Models (deutsch Welt-Modelle) bezeichnen jene Klasse von KI-Systemen, die internes Wissen über die Dynamik einer Umwelt erlernen – typisch physikalische Gesetze, Ursachen-Wirkungs-Verhältnisse und zukünftige Zustände. Dieses Wissen wird in einer Form erworben, die zur Vorhersage künftiger Beobachtungen und zur Planung von Aktionen verwendet werden kann.

Zentral ist die Differenz zu rein reaktiven Modellen: Ein World Model simuliert intern mögliche Zukünfte, statt nur auf gegebene Beobachtungen zu reagieren.

Der Begriff wurde durch Jürgen Schmidhuber bereits 1990 (Making the World Differentiable, TU München Technical Report FKI-126-90) etabliert; David Ha und Schmidhuber publizierten 2018 die wirkungsmächtige NeurIPS-Originalarbeit World Models (arXiv 1803.10122), die die zeitgenössische Renaissance des Begriffs auslöste.

Stand 2025/2026 sind World Models eines der intensiv diskutierten Forschungs- und Investments-Themen der zeitgenössischen KI. Substantielle Programmatiken gibt es bei NVIDIA (Cosmos, Januar 2025), Google DeepMind (Genie 2 Dezember 2024, Genie 3 August 2025) und Meta (V-JEPA 2). Hinzu kommen Fei-Fei Lis World Labs und Yann LeCuns AMI Labs (1,03 Mrd. USD Seed-Runde März 2026).

Es konkurrieren zwei Hauptansätze: generative World Models (zukünftige Beobachtungen pixelweise vorhersagen) und Joint Embedding Predictive Architectures (JEPAs, Vorhersage in abstrakten Latent-Räumen).

Zusammenfassung

World Models entstanden aus drei verbundenen Linien: erstens Model-Based Reinforcement Learning (Sutton Dyna 1990); zweitens Predictive Coding in der theoretischen Neurowissenschaft (Friston, Rao/Ballard); drittens die zeitgenössische Deep-Learning-Skalierungs-Praxis.

Schlüsselarbeiten umfassen Ha/Schmidhuber NeurIPS 2018, die Dreamer-Familie (Hafner u. a., Dreamer ICLR 2020 bis DreamerV3 Nature 2025) und MuZero (Schrittwieser u. a. Nature 2020).

Hinzu kommen Yann LeCuns programmatischer Aufsatz A Path Towards Autonomous Machine Intelligence (Juni 2022) und die JEPA-Familie (I-JEPA 2023, V-JEPA 2024, V-JEPA 2 Mai 2025).

Auf der industriellen Seite stehen OpenAIs Sora (Februar 2024) und Sora 2 (September 2025), NVIDIA Cosmos (Januar 2025) sowie DeepMind Genie 2/3 und Wayve GAIA-2 (März 2025).

Die Auseinandersetzung zwischen generativer und JEPA-Schule ist eines der prägenden theoretischen Diskussionsfelder.

Begriffsgeschichte

Vorgeschichte: Dyna und Schmidhuber (1990)

Jürgen Schmidhuber publizierte 1990 als Doktorand an der TU München den Technical Report Making the World Differentiable – eine der ersten expliziten Formulierungen der World-Models-Idee. Darin lernt ein neuronales Netz, die Dynamik einer Umwelt vorherzusagen, während der Agent sein Verhalten in dieser internen Simulation trainiert.

Im selben Jahr publizierte Richard Sutton die Dyna-Architektur (ICML 1990): integrierter Lern-Mechanismus, in dem der Agent gleichzeitig aus realer Erfahrung lernt, ein Modell aufbaut und imaginierte Erfahrungen für zusätzliches Training nutzt.

Ha/Schmidhuber 2018 und die Renaissance

Die wirkungsmächtigste Wiederbelebung erfolgte durch David Ha und Jürgen Schmidhuber.

Recurrent World Models Facilitate Policy Evolution (NeurIPS 2018, arXiv 1803.10122) kombinierte drei Komponenten: VAE-Kompression visueller Beobachtungen in Latent-Vektoren, rekurrentes Modell für zeitliche Dynamiken, kleiner Controller, der vollständig im Traum lernt. Agenten lernten erfolgreich, virtuelle Autos zu fahren (CarRacing) und Video-Spiele (VizDoom) zu meistern.

Dreamer-Familie und MuZero (2019–2025)

Danijar Hafner und Mitautor:innen etablierten PlaNet (ICML 2019, arXiv 1811.04551) mit dem Recurrent State Space Model (RSSM) als Standard-Architektur. DreamerV3 (Hafner u. a. Nature 2025, DOI 10.1038/s41586-025-08744-2) zeigte substantielle Generalisierung. MuZero (Schrittwieser u. a. Nature 2020, DOI 10.1038/s41586-020-03051-4) erreichte State-of-the-Art in Schach, Shogi, Go und Atari mit einer einzigen Architektur und impliziter Welt-Modell-Lernung.

LeCun JEPA-Programmatik (2022)

Im Juni 2022 publizierte Yann LeCun das Manifest A Path Towards Autonomous Machine Intelligence. Die Joint Embedding Predictive Architecture (JEPA) versucht nicht, zukünftige Beobachtungen pixelweise vorherzusagen, sondern in einem abstrakten Latent-Raum.

LeCuns Hauptkritik an generativen Modellen: „Die Welt ist unvorhersagbar. Wenn man versucht, ein generatives Modell zu bauen, das jedes Detail der Zukunft vorhersagt, wird es scheitern. JEPA ist keine generative KI.” Die JEPA-Familie umfasst I-JEPA (April 2023, arXiv 2301.08243), V-JEPA (Februar 2024, arXiv 2404.08471) und V-JEPA 2 (Mai 2025).

Industrielle Skalierung (2024–2025)

Sora (OpenAI, Februar 2024) – Text-to-Video-Modell, von OpenAI als „foundation model of the physical world” positioniert. Der deutlich leistungsfähigere Nachfolger Sora 2 erschien am 30. September 2025 – inklusive einer eigenständigen Social-App zum Teilen KI-generierter Videos. Genie (Bruce u. a. DeepMind ICML 2024, arXiv 2402.15391), Genie 2 (Dezember 2024) und Genie 3 (August 2025) – generative World Models, die interaktive 3D-Umgebungen erzeugen.

Im Januar 2026 wurde die Technologie unter dem Namen Project Genie für Abonnent:innen von Google AI Ultra öffentlich zugänglich gemacht – eine Ausweitung über die reine Forschungsankündigung hinaus. NVIDIA Cosmos (Januar 2025, arXiv 2501.03575) – zentrale industrielle Foundation-World-Model-Plattform, integriert mit der Physical AI-Programmatik. Wayve GAIA-2 (März 2025) – World Model für autonomes Fahren.

World Labs und AMI Labs (2024–2026)

Zwei substantielle Unternehmens-Gründungen mit World-Models-Programmatik: World Labs. Am 12. November 2025 veröffentlichte World Labs mit Marble sein erstes kommerzielles Produkt – öffentlich verfügbar inklusive einer World API und des Editierwerkzeugs Chisel. AMI Labs (Yann LeCun, Dezember 2025 gegründet, Seed-Runde März 2026 über 1,03 Mrd. USD bei 3,5 Mrd. USD Bewertung – eine der größten Seed-Runden der KI-Geschichte).

Methodische Grundlagen

Generative vs. JEPA-Ansatz: Die zentrale Auseinandersetzung. Generative World Models (Ha/Schmidhuber-Tradition, Dreamer, Sora, Cosmos, Genie) sagen zukünftige Beobachtungen pixelweise vorher.

JEPA-Ansatz (LeCun) verzichtet auf pixel-genaue Vorhersage und arbeitet in abstrakten Latent-Räumen. Generative Ansätze bieten direkte Interpretierbarkeit und etablierte Trainings-Pipelines; JEPA bietet Effizienz und potentiell besseres abstraktes Reasoning. Welcher Ansatz langfristig dominiert, ist Stand 2025/2026 unklar.

Recurrent State Space Models: Die von PlaNet und Dreamer etablierte Standard-Architektur – Kombination deterministischer und stochastischer Komponenten in rekurrenter Architektur.

Self-Supervised Learning: World Models werden typisch durch Self-Supervised Learning aus großen unannotierten Video-Datensätzen trainiert.

Physical Consistency: Schlüsselfrage – wie können physikalisch konsistente Vorhersagen gewährleistet werden? NVIDIA Cosmos-Reason1 adressiert die Frage explizit.

Verbindung zu Reasoning Models: World Models können als interne Simulationsumgebung für Reasoning-Modelle dienen – eine Architektur, die in Cosmos-Reason1 und vergleichbaren Systemen umgesetzt wird.

Anwendungsfelder

Kontroversen und Kritik

Definition-Inflation: Der Begriff World Model wird Stand 2025/2026 für eine sehr breite Klasse von Systemen verwendet. Eine sprachliche Klärung ist Gegenstand laufender Auseinandersetzung.

Sind LLMs World Models?: Befürworter (Karpathy, einige OpenAI-Forschende) argumentieren, dass LLMs implizit Welt-Wissen kodieren. Kritiker (LeCun, Marcus, Schmidhuber) argumentieren, dass LLMs keine echten Welt-Modelle haben, sondern statistische Muster-Manipulation.

Generative vs. JEPA-Auseinandersetzung: Empirisch hat die generative Schule substantiell mehr produktive Implementierungen (Sora, Cosmos, Genie); JEPA argumentiert, dies sei primär historischer Vorsprung, nicht methodischer.

Datenmenge und Compute: Generative World Models erfordern substantielle Trainings-Daten und -Compute. Folgen für Klima, Wettbewerbsdynamik und Marktkonzentration sind Gegenstand laufender Diskussion.

Sicherheit und Alignment: World Models als interne Simulations-Komponente von Reasoning-Modellen erzeugen Alignment-Fragen – wie kann sichergestellt werden, dass ein planender Agent nicht problematische Strategien entwickelt?

Stand 2025/2026

World Models ist Stand Mai 2026 eines der intensiv diskutierten Forschungs- und Investments-Themen. Die Auseinandersetzung zwischen generativer Schule (NVIDIA, OpenAI, DeepMind, Wayve, World Labs) und JEPA-Schule (AMI Labs, Meta) prägt die theoretische Debatte. Investitionsvolumen ist substantiell – World Labs (über 1 Mrd. USD September 2024) und AMI Labs (1,03 Mrd. USD Seed März 2026) repräsentieren erhebliche Konzentration.

NVIDIA Cosmos, DeepMind Genie 3, Meta V-JEPA 2 und Wayve GAIA-2 sind die wichtigsten industriellen Implementierungen. Offene Fragen umfassen die langfristige Wettbewerbsdynamik zwischen Ansätzen, regulatorische und ethische Klärung in autonomen Systemen, Verbindung zu Embodied AI und Physical AI, und die Frage, ob LLMs echte Welt-Modelle besitzen.

Verwandte Begriffe

Quellenangaben

  1. Assran, Mahmoud u. a. (Meta AI), 2023. Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture. CVPR 2023. arXiv: 2301.08243.
  2. Bardes, Adrien u. a. (Meta AI), 2024. Revisiting Feature Prediction for Learning Visual Representations from Video. (V-JEPA) arXiv: 2404.08471.
  3. Bruce, Jake u. a., 2024. Genie: Generative Interactive Environments. ICML 2024. arXiv: 2402.15391.
  4. Fortune Magazine, 2026. Why the AI Field’s Biggest Names Are Betting Billions on World Models. fortune.com, 20. Mai 2026.
  5. Friston, Karl, 2010. The Free-Energy Principle. In: Nature Reviews Neuroscience 11 (2), S. 127–138. DOI: 10.1038/nrn2787.
  6. Ha, David / Schmidhuber, Jürgen, 2018. World Models. arXiv: 1803.10122. (Die NeurIPS-Fassung erschien unter dem Titel Recurrent World Models Facilitate Policy Evolution.)
  7. Hafner, Danijar u. a., 2019. Learning Latent Dynamics for Planning from Pixels. ICML 2019. arXiv: 1811.04551. (PlaNet).
  8. Hafner, Danijar u. a., 2020. Dream to Control. ICLR 2020. arXiv: 1912.01603. (Dreamer).
  9. Hafner, Danijar u. a., 2025. Mastering Diverse Domains through World Models. In: Nature 640, S. 647–653. DOI: 10.1038/s41586-025-08744-2. (DreamerV3).
  10. LeCun, Yann, 2022. A Path Towards Autonomous Machine Intelligence. Meta AI. OpenReview.
  11. NVIDIA, 2025. Cosmos World Foundation Model Platform for Physical AI. arXiv: 2501.03575.
  12. OpenAI, 2024. Video Generation Models as World Simulators. openai.com, Februar 2024.
  13. OpenAI, 2025. Sora 2. openai.com/index/sora-2/, 30. September 2025.
  14. Schmidhuber, Jürgen, 1990. Making the World Differentiable: On Using Self-Supervised Fully Recurrent Neural Networks for Dynamic Reinforcement Learning and Planning in Non-Stationary Environments. Technical Report FKI-126-90, TU München.
  15. Schrittwieser, Julian u. a., 2020. Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model. In: Nature 588, S. 604–609. DOI: 10.1038/s41586-020-03051-4. (MuZero).
  16. Sutton, Richard S., 1990. Integrated Architectures for Learning, Planning, and Reacting. ICML 1990. DOI: 10.1016/B978-1-55860-141-3.50030-4.
  17. TechCrunch, 2025. Fei-Fei Li’s World Labs speeds up the world model race with Marble, its first commercial product. techcrunch.com, 12. November 2025.
  18. TechCrunch, 2026. I built marshmallow castles in Google’s new AI world generator Project Genie. techcrunch.com, 29. Januar 2026.
  19. Wu, Philipp u. a., 2023. DayDreamer. CoRL 2022. arXiv: 2206.14176.

← Zurück zur Lexikon-Übersicht