Blog

Eliezer Yudkowsky

Eliezer Shlomo Yudkowsky (* 11. September 1979 in Chicago) ist ein US-amerikanischer Autodidakt, KI-Theoretiker, Essayist und Romancier. Er ist Mitbegründer und Research Fellow des Machine Intelligence Research Institute (MIRI, bis 2013 Singularity Institute for Artificial Intelligence) in Berkeley, Kalifornien, sowie Gründer der Plattform LessWrong.

Yudkowsky prägte oder popularisierte mehrere Schlüsselbegriffe der gegenwärtigen Debatte um Superintelligenz und existenzielles KI-Risiko, darunter Friendly AI, Coherent Extrapolated Volition (CEV), die Orthogonality Thesis (gemeinsam mit Nick Bostrom) und die Intelligence Explosion.

Er gilt zugleich als zentrale intellektuelle und institutionelle Figur des in den 2000er Jahren entstandenen Singularitarianismus und der Rationalisten-Community und ist heute eine der prominentesten Stimmen der internationalen Diskussion um existenzielle Risiken aus fortgeschrittener KI.

Yudkowsky hat keine formale weiterführende Schulbildung oder akademische Qualifikation; diese Tatsache spielt sowohl für sein Selbstverständnis als auch für seine Rezeption eine erhebliche Rolle.

Zusammenfassung

Yudkowsky verfasste zwischen 2001 und 2017 die ideengeschichtliche Grundlage dessen, was heute überwiegend als AI Alignment diskutiert wird. Mit LessWrong (gegründet 2009), den Sequences (2006–2009) und der Fanfiction Harry Potter and the Methods of Rationality (HPMOR, 2010–2015) schuf er die diskursive Infrastruktur einer eigenständigen internationalen Subkultur.

Inhaltlich vertritt er eine pessimistische Variante des Singularitarianismus, die er seit etwa 2017 öffentlich vertritt. Verschärft hat er sie 2022 mit dem Essay AGI Ruin: A List of Lethalities und der MIRI-Strategieänderung Death with Dignity sowie 2025 mit dem zusammen mit Nate Soares verfassten Bestseller If Anyone Builds It, Everyone Dies.

Yudkowsky gehört seit 2023 – nach seinem im TIME Magazine publizierten Aufruf zu einem internationalen KI-Moratorium und dem TED-Hauptvortrag – zu den international meistdiskutierten Stimmen der KI-Sicherheitsdebatte; seine Positionen sind innerhalb wie außerhalb der Branche kontrovers.

Biografie

Frühe Jahre und intellektuelle Sozialisation

Eliezer Yudkowsky wuchs in einem Modern Orthodox-jüdischen Haushalt in Chicago auf, von dem er sich in seiner Jugend distanzierte.

Nach eigenen Angaben besuchte er weder die Highschool noch ein College und ist vollständig autodidaktisch sozialisiert. Seine intellektuellen Bezugsfiguren der frühen Jahre – Hans Moravec, Eric Drexler, Vernor Vinge, Douglas Hofstadter, später Daniel Dennett, Judea Pearl, E. T. Jaynes, Kahneman/Tversky – markieren das Profil eines autodidaktischen Lesers an der Schnittstelle von KI, Bayesianismus, Kognitionspsychologie und Sciencefiction.

Ab Mitte der 1990er Jahre veröffentlichte Yudkowsky im Internet – auf der Mailingliste Extropians und in eigenen Essays – Beiträge zur Singularität und zur Konstruktion „Friendly AI”.

Gründung und Konsolidierung des Singularity Institute (2000–2008)

Im Juli 2000 gründete Yudkowsky gemeinsam mit den Internet-Unternehmern Brian und Sabine Atkins (mit zusätzlicher früher Förderung u. a. durch Peter Thiel) das Singularity Institute for Artificial Intelligence (SIAI).

Ursprüngliches Ziel war die direkte Konstruktion einer Friendly AI; in den folgenden Jahren verlagerte sich der Schwerpunkt zunehmend auf die theoretischen und mathematischen Grundlagen der Wertespezifikation und Entscheidungstheorie. Wichtige Veröffentlichungen dieser Phase:

Overcoming Bias, LessWrong und die Sequences (2006–2009)

Ab April 2006 verfasste Yudkowsky – zunächst auf dem mit dem Ökonomen Robin Hanson gemeinsam betriebenen Gruppenblog Overcoming Bias – über drei Jahre lang nahezu täglich Essays zu Rationalität, Kognitionspsychologie, Entscheidungstheorie, Metaethik, Reduktionismus und KI-Risiko.

Diese als Sequences zusammengefassten Texte (zentral: Map and Territory, How to Actually Change Your Mind, Reductionism, Mysterious Answers to Mysterious Questions, Metaethics, Fun Theory) bilden den inoffiziellen Kanon der späteren Rationalisten-Community.

Im Februar 2009 wurden die Texte als Grundstock eines neuen, eigenständigen Forums ausgegliedert: LessWrong. 2015 erschienen sie als überarbeitetes Buch Rationality: From AI to Zombies bei MIRI.

Harry Potter and the Methods of Rationality (2010–2015)

Parallel verfasste Yudkowsky zwischen 2010 und 2015 die Fanfiction Harry Potter and the Methods of Rationality (HPMOR; etwa 660.000 Wörter). Darin tritt die Hauptfigur Harry James Potter-Evans-Verres als von einem rationalistischen Stiefvater erzogenes „Wunderkind” auf und interpretiert die Welt von Rowling unter den methodologischen Prämissen der Sequences neu. HPMOR gilt als zentraler Rekrutierungstext der Community.

MIRI, Inadequate Equilibria und Verschärfung (2013–2022)

2012 gründete Yudkowsky gemeinsam mit Anna Salamon, Julia Galef und anderen das Center for Applied Rationality (CFAR). 2013 wurde das SIAI in Machine Intelligence Research Institute (MIRI) umbenannt, um sich von der inzwischen kommerzialisierten Singularity University abzugrenzen.

2017 publizierte Yudkowsky Inadequate Equilibria: Where and How Civilizations Get Stuck, eine spieltheoretisch-epistemische Untersuchung der Bedingungen, unter denen rationale individuelle Abweichung von kollektiven Konsensen möglich und gerechtfertigt sei.

Mit AGI Ruin: A List of Lethalities (Juni 2022) und der gleichzeitig publizierten MIRI-Strategieänderung Death with Dignity signalisierte Yudkowsky eine deutliche Verschiebung in Richtung pessimistischer Erwartungen über die Lösbarkeit des Alignment-Problems.

Öffentliche Phase ab 2023

Mit dem im TIME Magazine am 29. März 2023 veröffentlichten Op-Ed Pausing AI Developments Isn’t Enough. We Need to Shut It All Down erlangte Yudkowsky breite öffentliche Aufmerksamkeit.

Im Aufsatz fordert er ein international vertraglich gesichertes Moratorium auf das Training großer KI-Modelle, das nötigenfalls auch durch konventionelle militärische Mittel – Cyberangriffe, Sabotage, gezielte Luftschläge gegen Rechenzentren in nicht-kooperierenden Staaten – durchzusetzen sei.

Die Position ist von Befürwortern wie Kritikern gleichermaßen als ungewöhnliche Radikalisierung des öffentlichen Diskurses wahrgenommen worden. Yudkowsky war außerdem Unterzeichner der vom Future of Life Institute initiierten Open-Letter-Forderung nach einer Trainingspause (März 2023) sowie des Statement on AI Risk des Center for AI Safety (Mai 2023).

Im April 2023 sprach er als Hauptredner auf der TED-Konferenz in Vancouver. Das TIME Magazine nahm ihn 2023 in seine Liste der 100 einflussreichsten Personen in der KI auf; die New York Times führte ihn unter den zwölf prägenden Figuren der KI-Bewegung.

Im September 2025 erschien das von Yudkowsky und Nate Soares (Präsident von MIRI) gemeinsam verfasste Buch If Anyone Builds It, Everyone Dies: Why Superhuman AI Would Kill Us All bei Little, Brown and Company (UK-Untertitel: The Case Against Superintelligent AI). Das Buch erreichte die New York Times-Bestsellerliste und wurde unter anderem vom New Yorker und vom Guardian unter die wichtigsten Bücher des Jahres 2025 aufgenommen.

Theoretisches Werk

Friendly AI und AI Alignment

Yudkowskys zentraler Beitrag besteht in der Formulierung und Konsolidierung des Programms Friendly AI (ab 2001), das heute weitgehend unter dem Begriff AI Alignment fortgeführt wird. Mehrere Kernpositionen – Intelligence Explosion Thesis, Orthogonality Thesis, Convergent Instrumental Goals, Complexity of Value, Fragility of Value – bilden bis heute die argumentative Grundlage des Diskurses.

Coherent Extrapolated Volition

Mit Coherent Extrapolated Volition (2004) formulierte Yudkowsky den bislang einflussreichsten metaethischen Designvorschlag der Alignment-Diskussion. Eine künftige Superintelligenz solle demnach ihre Ziele aus einer Aggregation dessen ableiten, was Menschen wollen würden, „wenn wir mehr wüssten, schneller dächten, mehr die Menschen wären, die wir sein wollten, gemeinsam weiter gereift wären”.

Yudkowsky selbst hat das Konzept bald nach Publikation als operational unzureichend bezeichnet, aber kein vollständig ausgearbeitetes Nachfolgekonzept publiziert.

Timeless Decision Theory

In Timeless Decision Theory (TDT, 2010) und nachfolgenden Arbeiten an der Functional Decision Theory (FDT, gemeinsam mit Nate Soares u. a.) entwickelte Yudkowsky alternative Ansätze zur klassischen kausalen Entscheidungstheorie, die das Newcomb-Paradoxon und einseitige Gefangenendilemmata konsistent zu lösen versuchen.

TDT bildet eine entscheidungstheoretische Hintergrundvoraussetzung für Roko’s Basilisk und für die singularitaristische Diskussion über acausal trade.

Inadequate Equilibria

In Inadequate Equilibria (2017) untersucht Yudkowsky die Bedingungen, unter denen funktionale Märkte und Institutionen versagen, sodass es für individuelle Akteure rational sein kann, von kollektiven Konsensen abzuweichen. Die Schrift ist sowohl methodologisches Instrumentarium als auch implizite Verteidigung der eigenen Außenseiterposition.

Stilistik und Form

Yudkowskys Schreibstil ist erkennbar geprägt von einer Mischung aus mathematisch-formalem Anspruch, hochpersönlichem Ton, didaktischer Geduld und kontroverser Schärfe.

Charakteristisch sind seine Vorliebe für ungewöhnliche Gedankenexperimente, die Kombination von Bayesianismus und literarischen Mitteln, das Zitieren der eigenen Sequences als Bezugsrahmen, eine ausgeprägte Selbstreflexivität (oft mit ironischer Distanz zur eigenen Person) und eine wachsende Neigung zu apokalyptischer Diktion ab 2022.

Sein literarisches Werk – neben HPMOR die Erzählungen Three Worlds Collide (2009) und Project Lawful (2021ff.) – ist Bestandteil eines eigenständigen subkulturellen Kanons.

Rezeption

Innerhalb der KI-Sicherheitsforschung

Innerhalb der Alignment- und Safety-Community gilt Yudkowsky als Pionierfigur, deren begriffliche und konzeptionelle Arbeit die heutige Diskussion erst ermöglicht habe.

Stuart Russell, Nick Bostrom, Paul Christiano, Dario Amodei und andere Forschende referieren sein Werk auch dann positiv, wenn sie inhaltlich von ihm abweichen. Stuart Russell verweist im KI-Standardlehrbuch Artificial Intelligence: A Modern Approach (Russell/Norvig) auf Yudkowskys Position.

Externe Kritik und Kontroverse

Substantielle Kritik kommt aus mehreren Richtungen:

TIME-Op-Ed-Kontroverse (2023)

Yudkowskys Forderung nach militärisch durchsetzbaren Trainingsverboten – bis hin zu Luftschlägen gegen Rechenzentren in nicht-kooperierenden Staaten – wurde von einigen Beobachtern als notwendige Konsequenz aus seinen vorangegangenen Argumenten gelesen, von anderen als unverhältnismäßige Eskalation.

Yudkowsky selbst hat die Position in Folgeauftritten bekräftigt, sie aber im Kontext eines internationalen Vertragsregimes nach Vorbild der Nichtverbreitung von Kernwaffen verortet.

Status ohne formale akademische Qualifikation

Yudkowskys autodidaktischer Hintergrund ist Gegenstand wiederholter Diskussion.

Befürworter verweisen darauf, dass sein Werk sich in begutachteten Bänden (Oxford University Press, Springer) und in der akademischen KI-Standardliteratur niedergeschlagen habe. Kritiker sehen dagegen in der Abwesenheit klassischer fachlicher Sozialisation eine Quelle von Eigenwilligkeiten – etwa in der starken Stützung auf eigene Argumentationen und der eingeschränkten Anschlussfähigkeit an etablierte philosophische Diskurse.

Verwandte Begriffe

Quellenangaben

  1. Statement on AI Risk (2023). Center for AI Safety, 30. Mai 2023.
  2. TIME 100 Most Influential People in AI (2023). In: TIME, September 2023.
  3. Aaronson, Scott (2025): ”If Anyone Builds It, Everyone Dies”. In: Shtetl-Optimized, 30. Mai 2025.
  4. Auerbach, David (2014): The Most Terrifying Thought Experiment of All Time. In: Slate, 17. Juli 2014.
  5. Bostrom, Nick, 2014. Superintelligence: Paths, Dangers, Strategies.
  6. Chivers, Tom, 2019. The AI Does Not Hate You: Superintelligence, Rationality and the Race to Save the World. Weidenfeld & Nicolson.
  7. Gebru, Timnit / Torres, Émile P., 2024. The TESCREAL Bundle: Eugenics and the Promise of Utopia through Artificial General Intelligence. In: First Monday 29 (4). DOI: 10.5210/fm.v29i4.13636.
  8. Russell, Stuart / Norvig, Peter, 2021. Artificial Intelligence: A Modern Approach. 4. Auflage. Hoboken: Pearson, Kapitel 27: Philosophy, Ethics, and Safety of AI.
  9. Yudkowsky, Eliezer, 2001. Creating Friendly AI 1.0: The Analysis and Design of Benevolent Goal Architectures. Singularity Institute for Artificial Intelligence. singinst.org.
  10. Yudkowsky, Eliezer, 2004. Coherent Extrapolated Volition. Singularity Institute for Artificial Intelligence.
  11. Yudkowsky, Eliezer, 2008. Artificial Intelligence as a Positive and Negative Factor in Global Risk.
  12. Yudkowsky, Eliezer (2010): Timeless Decision Theory. The Singularity Institute, San Francisco.
  13. Yudkowsky, Eliezer (2010–2015): Harry Potter and the Methods of Rationality. hpmor.com.
  14. Yudkowsky, Eliezer (2015): Rationality: From AI to Zombies.
  15. Yudkowsky, Eliezer (2017): Inadequate Equilibria: Where and How Civilizations Get Stuck.
  16. Yudkowsky, Eliezer (2022): AGI Ruin: A List of Lethalities.
  17. Yudkowsky, Eliezer, 2023. Pausing AI Development Is Not Enough. We Need to Shut It All Down. In: Time, 29. März 2023.
  18. Yudkowsky, Eliezer / Soares, Nate, 2025. If Anyone Builds It, Everyone Dies: Why Superhuman AI Would Kill Us All.

← Zurück zur Lexikon-Übersicht