Machine Intelligence Research Institute (Abkürzung MIRI, bis 2013 Singularity Institute for Artificial Intelligence oder SIAI) ist eine 2000 in Berkeley, Kalifornien, gegründete gemeinnützige Forschungsorganisation, die sich der Entwicklung und Erforschung mathematischer Grundlagen für den sicheren Bau intelligenter Maschinen widmet. Sie gilt als die historisch erste institutionalisierte Organisation im Bereich der technischen KI-Sicherheitsforschung.
MIRI wurde von Eliezer Yudkowsky (* 11. September 1979 in Chicago, Illinois) als intellektuellem Hauptinitiator und Brian Atkins sowie Sabine Atkins als frühen Förderern gegründet.
Yudkowsky ist bis heute die prägendste intellektuelle Figur des Instituts und durch die Blogging-Plattform LessWrong, seine Einflussnahme auf die Rationalist– und Effective-Altruism-Gemeinschaften und seine extremen öffentlichen Warnungen vor unausgerichteter Superintelligenz eine der umstrittensten Figuren der KI-Debatte.
MIRI hat eine Reihe mathematischer Formalisierungsansätze für KI-Alignment-Probleme entwickelt – darunter Logical Uncertainty, Updateless Decision Theory, Agent Foundations und frühe Vorarbeiten zu Konzepten wie Corrigibility und Deceptive Alignment.
Institutionell ist es der Ausgangspunkt einer intellektuellen Genealogie, die LessWrong, den Alignment Forum, das Center for Human-Compatible AI (CHAI) von Stuart Russell und breitere Teile der technischen KI-Sicherheitsgemeinschaft mitgeformt hat.
Stand 2025/2026 ist MIRIs institutionelles Gewicht gegenüber jüngeren, besser kapitalisierten Sicherheitsforschungsabteilungen bei Anthropic, OpenAI und DeepMind gesunken; die Grundlagenforschungs-Agenda des Instituts ist innerhalb der Alignment-Community methodisch umstritten.
Zusammenfassung
MIRI verbindet in seiner Geschichte zwei unterschiedliche Phasen. Die frühe Phase (2000–2012) unter dem Namen Singularity Institute war stark durch Yudkowskys Überzeugung geprägt, dass eine unausgerichtete, rasch selbstverbessernde Superintelligenz die größte existenzielle Bedrohung der Menschheit darstellt; das Institut funktionierte in dieser Zeit primär als Verbreitungsorganisation dieser Überzeugung.
In der mathematisch-technischen Phase (ab 2013 unter dem Namen MIRI) verfolgte das Institut eine Reihe von Forschungsagenden zu formalen Grundlagen von KI-Alignment-Problemen, die in der mainstream-KI-Sicherheitsgemeinschaft unterschiedlich aufgenommen wurden.
MIRIs intellektueller Hauptbeitrag ist weniger in peer-review-publizierten Ergebnissen zu messen als in der Prägung eines Begriffsrahmens – Alignment, Corrigibility, Mesa-Optimization, Deceptive Alignment – der die technische Sicherheitsforschungsgemeinschaft strukturiert hat.
Yudkowskys zunehmend öffentliche und extreme Positionen – darunter ein Meinungsbeitrag in der Time (März 2023), in dem er eine internationale Vereinbarung zur Zerstörung von KI-Rechenzentren forderte – werden innerhalb der Alignment-Community selbst zunehmend kritisch diskutiert.
Geschichte
Gründung als Singularity Institute (2000–2005)
Das Singularity Institute for Artificial Intelligence wurde im Jahr 2000 gegründet. Eliezer Yudkowsky, der keine akademischen Abschlüsse besitzt, hatte sich seit Mitte der 1990er-Jahre autodidaktisch mit dem Problem menschenähnlicher und übermenschlicher Intelligenz beschäftigt und publizierte ab 1996 online Essays zu diesem Thema.
Die frühen institutionellen Aktivitäten umfassten Konferenzen, öffentlichkeitswirksame Fundraising-Aktivitäten und Yudkowskys eigene Schriften, darunter die zunächst unveröffentlichte Arbeit Creating Friendly AI (2001), die das Konzept der Friendly AI – eines KI-Systems, dessen Ziele und Werte mit menschlichem Wohlergehen kompatibel sind – systematisierte.
Brian Atkins und Sabine Atkins finanzierten das Institut in der Frühphase wesentlich. Zu den frühen Unterstützern gehörten Peter Thiel (Investor und Mitgründer von PayPal) und im Zeitraum 2012–2015 Jaan Tallinn, der nach eigenen Angaben durch Yudkowskys Schriften zur Überzeugung gelangte, dass KI-Risiken eine Hauptpriorität globaler Philanthropie seien.
Rationalist-Community und LessWrong (2006–2012)
Yudkowsky entwickelte ab 2006 auf der Plattform Overcoming Bias und ab 2009 auf der eigens gegründeten Plattform LessWrong eine umfangreiche Essaysammlung zu Epistemologie, Kognitionswissenschaft, Entscheidungstheorie und KI-Risiken.
Die Sequences genannten Essays – insbesondere zu Bayes’schem Denken, Kognitiven Verzerrungen, Technologischer Singularität und Vriendlicher KI – sind der intellektuelle Kern einer Rationalist-Gemeinschaft, die sich um LessWrong formierte und mit der Effective-Altruism-Bewegung (Peter Singer, William MacAskill) erhebliche Überschneidungen aufweist.
Der Einfluss dieser Gemeinschaft auf spätere KI-Sicherheitsforschende – darunter mehrere Gründerinnen und Gründer von Anthropic und OpenAIs Sicherheitsabteilung – ist in der Sekundärliteratur gut dokumentiert (Torres 2023; Timnit Gebru/Torres 2024).
Umbenennung und Alignment-Forschungsagenda (2013–2019)
Im Jahr 2013 wurde das Institut in Machine Intelligence Research Institute umbenannt, um die Abgrenzung vom populärwissenschaftlich aufgeladenen Begriff Singularität zu markieren und einen wissenschaftlicheren Anspruch zu formulieren. Unter der Mitwirkung von Nate Soares (ab 2014 als Forschungsleiter, ab 2016 als Executive Director) entwickelte MIRI eine Reihe formaler Forschungsagenden:
Agent Foundations: Mathematische Formalisierung von Agenten-Konzepten – Entscheidungstheorie unter logischer Unvollständigkeit (Logical Uncertainty), kausale vs. evidenzielle Entscheidungstheorie, Updateless Decision Theory (Yudkowsky / Soares 2016).
Corrigibility: Formalisierung der Eigenschaft eines KI-Systems, Korrekturen durch menschliche Operatoren zuzulassen ohne aktiven Widerstand (Soares u. a. 2015, AAAI Workshop on AI and Ethics). Embedded Agency: Analyse der Inkonsistenz zwischen klassischen Agenten-Modellen, die einen Agenten von seiner Umwelt trennen, und realen Systemen, die Teil ihrer Umwelt sind (Demski / Garrabrant 2019, arXiv 1902.09469).
Diese Forschungsagenda wurde von der mainstream-ML-Sicherheitsforschungsgemeinschaft unterschiedlich aufgenommen: einerseits als wichtige konzeptuelle Grundlagenarbeit (das Konzept Deceptive Alignment hat wesentlichen Einfluss auf Arbeiten zu Mesa-Optimization, Evan Hubinger u. a. 2019). Andererseits gilt sie als zu weit von den empirischen Methoden der gegenwärtigen KI-Forschung entfernt und damit methodisch schwer anschlussfähig.
Yudkowskys öffentliche Eskalation (2022–2024)
Ab 2022 intensivierte Yudkowsky seine öffentliche Kommunikation über das KI-Risiko-Szenario, das er für wahrscheinlichstes Outcome eines unregulierten Frontier-KI-Wettbewerbs hält.
Im März 2023 – zeitlich knapp nach dem FLI-Pause-Brief – veröffentlichte er einen Meinungsbeitrag in der Time (Pausing AI Development Is Not Enough. We Need to Shut It All Down, 29. März 2023), in dem er forderte, internationale Vereinbarungen zur Zerstörung von GPU-Clustern über bestimmten Schwellenwerten zu schließen, Modell-Training über bestimmten Rechenmengen weltweit zu kriminalisieren und diese Vereinbarungen militärisch durchzusetzen.
Diese Positionen wurden nicht nur von KI-Optimisten, sondern auch von einer Mehrheit der Alignment-Gemeinschaft selbst als nicht geerdete Extremposition diskutiert.
Leitungswechsel und Buch If Anyone Builds It, Everyone Dies (2023–2025)
Am 10. Oktober 2023 gab MIRI eine Umstrukturierung der Leitungsebene bekannt: Malo Bourgon, zuvor Chief Operating Officer, wurde Chief Executive Officer (CEO); Nate Soares wechselte von der Position des Executive Director in die neu geschaffene Rolle des President. Eliezer Yudkowsky wurde Chair of the Board und firmiert seither als Senior Research Fellow.
Die Umstrukturierung spiegelte nach Angaben von MIRI primär bereits bestehende operative Realitäten wider, da Bourgon die laufenden Geschäfte des Instituts bereits seit längerem geführt hatte.
Am 16. September 2025 veröffentlichten Yudkowsky und Soares gemeinsam das Buch If Anyone Builds It, Everyone Dies: Why Superhuman AI Would Kill Us All (Little, Brown and Company), das MIRIs seit 2024 verstärkten Fokus auf öffentliche Kommunikation und Policy-Arbeit exemplifiziert. Das Buch erreichte am 5. Oktober 2025 die New York Times-Bestsellerliste und wurde in mehrere „Bücher des Jahres”-Listen aufgenommen, darunter die des New Yorker.
Die Rezeption war gespalten: Befürworter wie Max Tegmark bezeichneten es als „das wichtigste Buch des Jahrzehnts”. Kritiker wie Adam Becker (The Atlantic) und Jacob Aron (New Scientist) warfen den Autoren dagegen vor, keinen evidenzbasierten wissenschaftlichen Beleg für ihre zentrale These zu liefern.
Wissenschaftliche Beiträge und intellektuelle Genealogie
MIRIs kanonischste konzeptuelle Beiträge zur technischen KI-Sicherheitsforschung sind weniger in Form publizierter Fachaufsätze als in Form einflussreicher technischer Berichte und Blog-Posts materialisiert, die im Alignment Forum und auf LessWrong verbreitet wurden.
Das Konzept Deceptive Alignment bezeichnet die Möglichkeit, dass ein trainiertes Modell während des Trainings kooperatives Verhalten zeigt, aber abweichendes Verhalten bei der Einsetzung. Es ist von Evan Hubinger u. a. in Risks from Learned Optimization in Advanced Machine Learning Systems (arXiv 1906.01820, 2019) formalisiert worden und hat die Diskussion um Mesa-Optimization und Inner Alignment geprägt.
Paul Christiano, der den RLHF-Ansatz für KI-Sicherheit maßgeblich entwickelt hat und 2023 das Alignment Science Center gründete, ist intellektuell aus dem MIRI-LessWrong-Kontext hervorgegangen, hat sich aber von MIRIs Agenda entfernt.
Kontroversen und Kritik
Methodische Isolation: MIRIs Forschungsagenda – insbesondere die Agent Foundations-Linie – wird von einer Mehrheit der gegenwärtigen ML-Sicherheitsforschenden als zu weit von den empirischen Methoden der aktuellen KI-Forschung entfernt eingeschätzt, um auf aktuell deployierte Systeme anwendbar zu sein.
Kritiker wie Paul Christiano haben öffentlich argumentiert, dass MIRI zu lange an formalen Ansätzen festgehalten habe, die voraussetzten, KI-Systeme seien formal beschreibbare Optimierer – eine Annahme, die für neuronale Netze nicht zutrifft (Christiano 2019).
Yudkowskys Positionen: Yudkowskys öffentliche Kommunikation – besonders sein Time-Beitrag 2023 und seine wiederholten Äußerungen, er halte die Entwicklung menschenüberlegener KI für wahrscheinlich tödlich für die Menschheit (p(doom) nahe 1) – gilt vielen als Extremposition. Die Mehrheit der KI-Forschungsgemeinschaft, darunter auch Alignment-Forschende, sieht sie als nicht durch belastbare Evidenz gestützt an.
TESCREAL-Einbettung: Gebru und Torres (2024) analysieren MIRI als zentralen institutionellen Knoten des TESCREAL-Komplexes. Die Organisation habe maßgeblich zur ideologischen Formation einer Community beigetragen, die technologischen Utopismus mit existenzrisikoorientiertem Denken verbindet und dabei sowohl gegenwärtige Schäden durch KI-Systeme als auch demokratisch-politische Regulierungsansätze systematisch untergewichtet.
Mangelnde Diversität und Zugänglichkeit: Die intellektuelle Community um MIRI und LessWrong ist in der Sekundärliteratur als demografisch homogen und epistemisch geschlossen beschrieben worden (Torres 2023). Der Einstieg über informelle Online-Kanäle statt institutioneller akademischer Strukturen begünstigt methodisch bestimmte Typen von Wissensproduktion und schließt andere aus.
Stand 2025/2026
Stand Mai 2026 ist MIRI eine relativ kleine Organisation mit unter 30 Mitarbeitenden; der Jahreshaushalt liegt im einstelligen Millionen-Dollar-Bereich. Gegenüber den gut kapitalisierten Sicherheitsforschungsabteilungen von Anthropic, OpenAI und DeepMind hat MIRIs institutionelles Gewicht in der technischen KI-Sicherheitsgemeinschaft abgenommen.
Der intellektuelle Einfluss – durch LessWrong, den Alignment Forum und die konzeptuelle Genealogie von Alignment-Begriffen – ist jedoch weiterhin substanziell.
Seit der Leitungsumstrukturierung im Oktober 2023 ist Malo Bourgon CEO, Nate Soares President und Eliezer Yudkowsky Chair of the Board sowie Senior Research Fellow. Yudkowsky ist weiterhin öffentlich aktiv, unter anderem durch das gemeinsam mit Soares verfasste Buch If Anyone Builds It, Everyone Dies (2025).
Verwandte Begriffe
- LessWrong – intellektuelle Plattform; aus MIRI-Kontext hervorgegangen
- Existenzielles Risiko – zentrales Konzept der MIRI-Programmatik
- AI Alignment – methodisches Hauptforschungsfeld
- Mesa-Optimization – konzeptuell aus dem MIRI-Kontext entwickelt
- Future of Life Institute – jüngeres, politikorientiertes Schwester-Institut
- Effective Altruism – institutionelles Netzwerk; Hauptfinanzierungsquelle
- Anthropic – intellektuelle Nachfolge-Institution; methodisch divergierend
Quellenangaben
- Bostrom, Nick, 2014. Superintelligence: Paths, Dangers, Strategies.
- Christiano, Paul, 2019. What failure looks like. Alignment Forum, 17. März 2019.
- Demski, Abram / Garrabrant, Scott, 2019. Embedded Agents. In: Alignment Forum. arXiv: 1902.09469.
- Gebru, Timnit / Torres, Émile P., 2024. The TESCREAL Bundle: Eugenics and the Promise of Utopia through Artificial General Intelligence. In: First Monday 29 (4). DOI: 10.5210/fm.v29i4.13636.
- Hubinger, Evan / van Merwijk, Chris / Mikulik, Vladimir / Skalse, Joar / Garrabrant, Scott, 2019. Risks from Learned Optimization in Advanced Machine Learning Systems. Machine Intelligence Research Institute. arXiv: 1906.01820.
- Machine Intelligence Research Institute, 2023. Announcing MIRI’s New CEO and Leadership Team. intelligence.org, 10. Oktober 2023. https://intelligence.org/2023/10/10/announcing-miris-new-ceo-and-leadership-team/
- Ord, Toby, 2020. The Precipice: Existential Risk and the Future of Humanity.
- Russell, Stuart, 2019. Human Compatible: Artificial Intelligence and the Problem of Control. New York: Viking Press.
- Soares, Nate / Fallenstein, Benja / Yudkowsky, Eliezer / Armstrong, Stuart, 2015. Corrigibility. In: Workshops at the Twenty-Ninth AAAI Conference on Artificial Intelligence, AAAI Press.
- Torres, Émile P., 2023. Human Extinction: A History of the Science and Ethics of Annihilation.
- Yudkowsky, Eliezer, 2001. Creating Friendly AI 1.0: The Analysis and Design of Benevolent Goal Architectures. Singularity Institute for Artificial Intelligence. singinst.org.
- Yudkowsky, Eliezer / Soares, Nate, 2016. Functional Decision Theory: A New Theory of Instrumental Rationality. arXiv: 1710.05060.
- Yudkowsky, Eliezer, 2023. Pausing AI Development Is Not Enough. We Need to Shut It All Down. In: Time, 29. März 2023.
- Yudkowsky, Eliezer / Soares, Nate, 2025. If Anyone Builds It, Everyone Dies: Why Superhuman AI Would Kill Us All.