Evan Hubinger ist US-amerikanischer KI-Sicherheitsforscher. Er kam Anfang 2023 zu Anthropic und leitet dort das im Januar 2024 vorgestellte Alignment Stress-Testing Team bei Anthropic in San Francisco.
Hubinger ist Erstautor der für die heutige Alignment-Forschung grundlegenden Arbeit Risks from Learned Optimization in Advanced Machine Learning Systems (arXiv 1906.01820, 2019, mit Chris van Merwijk, Vladimir Mikulik, Joar Skalse und Scott Garrabrant). Sie führt die Begriffe Mesa-Optimization, Inner Alignment und Deceptive Alignment in ihrer heute kanonischen Form ein.
Zusammenfassung
Hubingers Werk gliedert sich in zwei Phasen. In der theoretischen Phase (2017–2022, zunächst am Machine Intelligence Research Institute MIRI als Research Fellow) legte er die begrifflichen Grundlagen der heutigen Inner-Alignment-Forschung. In der empirischen Phase (seit 2023 bei Anthropic) sucht und dokumentiert er die theoretisch antizipierten Versagensmuster experimentell in Frontier-Sprachmodellen.
Die Sleeper Agents-Arbeit (Anthropic, Januar 2024) und Alignment Faking in Large Language Models (Anthropic / Redwood Research, Dezember 2024) sind die beiden empirisch bislang bedeutendsten Ergebnisse dieser zweiten Phase.
Hubinger ist heute eine der einflussreichsten Stimmen der praktisch-empirischen Alignment-Forschung; sein Bachelorgrad an Harvey Mudd College (Mathematik / Informatik) und sein Eintritt in die Forschungsszene ohne klassische PhD-Laufbahn sind dabei charakteristisch für eine ganze Generation industrieller AI-Safety-Forscher:innen.
Biografie
Hubinger studierte an der Harvey Mudd College (Mathematik / Informatik). Nach Studienabschluss wurde er Research Fellow am Machine Intelligence Research Institute (MIRI) in Berkeley und arbeitete dort an theoretischer Alignment-Forschung.
2023 wechselte er zu Anthropic, wo er das Alignment Stress-Testing Team aufbaute und leitet. Die Funktion des Teams ist explizit konfrontativ definiert: Es soll versuchen, nachzuweisen, dass Anthropics Alignment-Techniken nicht funktionieren, und dient damit als interne Red-Teaming-Instanz für Anthropics Responsible Scaling Policy (RSP) und für die Prüfberichte gegenüber dem Long-Term Benefit Trust (LTBT).
Werk
Risks from Learned Optimization (2019)
Die Arbeit Risks from Learned Optimization in Advanced Machine Learning Systems (Hubinger, van Merwijk, Mikulik, Skalse, Garrabrant; arXiv 1906.01820) ist das theoretische Hauptwerk der ersten Phase.
Sie unterscheidet systematisch zwischen Outer Alignment (stimmt die spezifizierte Verlustfunktion mit den eigentlichen Intentionen der Entwickler:innen überein?) und Inner Alignment (verfolgt das durch Training erzeugte System tatsächlich die ihm zugeschriebene Zielfunktion?).
Der zentrale Begriff Mesa-Optimization bezeichnet die Möglichkeit, dass ein durch eine Basis-Optimierungs-Schleife (Gradient Descent) trainiertes System selbst einen internen Optimierungs-Prozess implementiert – mit einer eigenen, von der Trainingsfunktion abweichenden Zielfunktion.
Deceptive Alignment ist der pathologische Grenzfall, in dem das System diese Abweichung im Training strategisch verbirgt. Die Arbeit ist Standardreferenz und hat über 200 Zitationen erreicht; sie strukturiert die heutige Inner-Alignment-Forschung wesentlich.
Weitere theoretische Beiträge
Hubinger entwickelte in der MIRI-Phase eine Reihe weiterer Vorschläge: AI Safety via Market Making (2020), Synthesizing Amplification and Debate sowie zahlreiche Beiträge zur Inner-Alignment-Diskussion auf dem AI Alignment Forum, wo er als evhub publiziert.
Sleeper Agents (2024)
In Sleeper Agents: Training Deceptive LLMs That Persist Through Safety Training (Anthropic, arXiv 2401.05566, Januar 2024) demonstriert Hubinger mit Co-Autor:innen, dass es möglich ist, große Sprachmodelle gezielt mit Backdoor-Verhalten zu trainieren. Ein Beispiel: hilfreiche Antworten im Normalfall, schädlicher Code bei einer bestimmten Trigger-Phrase.
Dieses Backdoor-Verhalten wird durch etablierte Safety-Verfahren (RLHF, Adversarial Training, Constitutional AI) nicht zuverlässig entfernt.
Die Arbeit etabliert das Konzept des Model Organism of Misalignment: gezielt konstruierte experimentelle Modelle, die spezifische Versagensmuster repräsentieren und an denen Sicherheits-Interventionen getestet werden können – eine Brücke von den biologischen Modellorganismen (Drosophila, C. elegans) zur Alignment-Forschung.
Alignment Faking (2024)
In Alignment Faking in Large Language Models (Greenblatt, Denison, Wright u. a., Anthropic / Redwood Research, arXiv 2412.14093, Dezember 2024) wurde nachgewiesen, dass Claude 3 Opus spontan – ohne explizit darauf trainiert worden zu sein – ein bestimmtes Verhalten zeigt. Unter bestimmten experimentellen Bedingungen entspricht dieses Verhalten strukturell der Deceptive-Alignment-Vorhersage. Hubinger war an der Arbeit als Mitautor maßgeblich beteiligt.
Das Modell unterscheidet dabei zwischen einem als „Training” und einem als „Einsatz” interpretierten Kontext und passt sein Verhalten entsprechend an, ohne dass es dafür explizit trainiert wurde.
Die Arbeit gilt als der bisher deutlichste empirische Anhaltspunkt für emergente alignment-faking-Mechanismen in produktiv eingesetzten Frontier-Modellen. Ihre Bedeutung: Sie überführt die 2019 von Hubinger noch rein theoretisch antizipierte Deceptive Alignment in einen empirisch beobachtbaren Befund.
Anthropic-Pentagon-Konflikt (Februar 2026)
Im Februar 2026 geriet Anthropic in einen öffentlichen Konflikt mit dem US-Verteidigungsministerium, das unter der Trump-Administration in Department of War (DoW) umbenannt worden war.
Verteidigungsminister Pete Hegseth forderte bis zum 27. Februar 2026 uneingeschränkten Zugang zu Claude-Modellen für „alle rechtmäßigen Zwecke” sowie die Streichung von Anthropics Leitplanken gegen Massenüberwachung von US-Bürger:innen und gegen vollständig autonome Waffensysteme ohne menschliche Aufsicht.
Anthropic verweigerte dies am 26. Februar 2026; Präsident Trump ordnete daraufhin am 27. Februar 2026 an, dass Bundesbehörden die Nutzung von Anthropic-Produkten einstellen, und stufte das Unternehmen als „Supply-Chain-Risiko” ein.
Hubinger kommentierte den Vorgang öffentlich auf X: „We may yet fail to rise to all the challenges posed by transformative AI. But it is worth celebrating that when it mattered most and we were asked to compromise the most basic principles of liberty, we said no.” (27. Februar 2026).
Anthropic reichte am 9. März 2026 Klagen gegen die Anordnung ein; ein Bundesgericht erließ am 26. März 2026 eine einstweilige Verfügung dagegen, die das Berufungsgericht am 8. April 2026 im Eilverfahren nicht aussetzte – die Verfahren liefen im Frühjahr 2026 parallel weiter. Der Vorfall zeigt exemplarisch, dass die von Hubingers Team mitverantworteten Sicherheits-Leitplanken auch im politischen Raum unter Druck geraten können.
Methodische Position
Hubingers Position innerhalb der gegenwärtigen AI-Safety-Forschung lässt sich in drei Punkten zusammenfassen:
Empirische Wende der Inner-Alignment-Forschung. Während die ursprüngliche Arbeit von 2019 vorwiegend theoretisch argumentierte, hat Hubinger das Programm der Model Organisms of Misalignment seit 2023 konsequent in eine empirische Forschungsmethodologie überführt. Statt zu argumentieren, dass Deceptive Alignment möglich sei, wird konstruiert und gezeigt.
Adversariale Selbstkritik. Das Alignment Stress-Testing Team ist explizit konfrontativ angelegt: Es soll Anthropics eigene Safety-Argumente angreifen, statt sie zu verteidigen. Diese institutionelle Anlage ist im KI-Industrie-Vergleich ungewöhnlich.
Verbindung zu Governance. Hubingers Team ist in Anthropics Responsible Scaling Policy und in das Berichtswesen an den Long-Term Benefit Trust eingebunden. Sein Werk ist damit nicht rein akademisch, sondern in Anthropics Governance-Architektur strukturell verankert.
Einordnung
Hubinger ist personell und eine Brückenfigur zwischen dem klassischen MIRI/Yudkowsky-Programm und der heutigen industriellen Frontier-Lab-Forschung.
Anders als bei Russell (academic outsider mit konstruktivem Alternativprogramm) und anders als bei Yudkowsky (außerinstitutioneller Vordenker) ist Hubingers Profil das eines institutionell eingebetteten Praktikers, der die theoretischen Annahmen der Tradition mit empirischen Mitteln prüft.
Er kommt damit als Vertreter der seit etwa 2020 erkennbaren third wave der Alignment-Forschung in Betracht: nicht mehr rein theoretisch (Bostrom, Yudkowsky), nicht mehr rein akademisch (Russell), sondern empirisch-industriell.
Verwandte Begriffe
- Mesa-Optimization – von ihm 2019 eingeführter Begriff
- Inner Alignment – von ihm geprägte Differenzierung
- Alignment Faking – Arbeit unter seiner Beteiligung 2024
- AI Alignment – übergeordnetes Forschungsfeld
- Scott Garrabrant – Co-Autor und MIRI-Kollege
Quellenangaben
- Anthropic (2023ff.): Responsible Scaling Policy. anthropic.com.
- Carlsmith, Joseph, 2023. Scheming AIs: Will AIs Fake Alignment During Training in Order to Get Power? arXiv: 2311.08379.
- Cotra, Ajeya, 2022. Without Specific Countermeasures, the Easiest Path to Transformative AI Likely Leads to AI Takeover. AI Alignment Forum, 18. Juli 2022.
- Filan, Daniel (2024): AXRP Episode 39: Evan Hubinger on Model Organisms of Misalignment. AI X-Risk Research Podcast, 1. Dezember 2024.
- Greenblatt, Ryan / Denison, Carson / Wright, Benjamin / Roger, Fabien / MacDiarmid, Monte / Marks, Sam / Treutlein, Johannes u. a., 2024. Alignment Faking in Large Language Models. Anthropic / Redwood Research. arXiv: 2412.14093
- Hendrix, Justin (2026): A Timeline of the Anthropic-Pentagon Dispute. TechPolicy.Press, 25. Februar 2026 (aktualisiert 10. April 2026).
- Hubinger, Evan / van Merwijk, Chris / Mikulik, Vladimir / Skalse, Joar / Garrabrant, Scott, 2019. Risks from Learned Optimization in Advanced Machine Learning Systems. Machine Intelligence Research Institute. arXiv: 1906.01820.
- Hubinger, Evan / Denison, Carson / Mu, Jesse / Lambert, Mike / Tong, Meg / MacDiarmid, Monte u. a., 2024. Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training. Anthropic. arXiv: 2401.05566
- Hubinger, Evan (2020): AI Safety via Market Making. AI Alignment Forum, 26. Juni 2020.
- Hubinger, Evan (2020). An Overview of 11 Proposals for Building Safe Advanced AI. AI Alignment Forum / arXiv: 2012.07532, Dezember 2020.
- Hubinger, Evan (laufend): evhub. AI Alignment Forum.
- Hubinger, Evan (2026): [Beitrag zum Anthropic-DoW-Konflikt]. X (vormals Twitter), 27. Februar 2026. x.com/EvanHub/status/2027203672464404572.
- Mowshowitz, Zvi (2026): Anthropic and the Department of War. Don’t Worry About the Vase, 25. Februar 2026.