Das Preparedness Framework ist ein von OpenAI am 18. Dezember 2023 als Beta veröffentlichtes internes Rahmenwerk, das festlegt, wie das Unternehmen katastrophale Risiken seiner leistungsfähigsten Modelle misst und vor deren Freigabe eindämmt.
Der Kerngedanke ähnelt dem von Anthropics Responsible Scaling Policy: Statt Sicherheitsauflagen an Modellgrößen zu koppeln, richten sie sich nach gemessenen Fähigkeiten in klar benannten Risikokategorien. Ein internes Gremium bewertet die Ergebnisse und empfiehlt, ob eine Freigabe verantwortbar ist.
Federführend leitete zunächst Aleksander Madry das zuständige Preparedness-Team. Im April 2025 erschien eine grundlegend überarbeitete Version 2, im Juli 2026 wurde das eigenständige Team im Zuge einer Umstrukturierung aufgelöst.
Zusammenfassung
Die Beta-Fassung von Dezember 2023 unterschied vier Risikostufen – low, medium, high, critical – in vier Tracked Categories: Cybersicherheit, chemische/biologische/radiologische/nukleare Bedrohungen (CBRN), Persuasion sowie Modellautonomie. Erreichte ein Modell in einer Kategorie die Stufe high, durfte es erst nach zusätzlichen Schutzmaßnahmen ausgeliefert werden; critical sollte die Weiterentwicklung selbst stoppen.
Die Version 2 vom 15. April 2025 straffte das Modell auf zwei Schwellen – High und Critical – und beschränkte die Tracked Categories auf biologische/chemische Fähigkeiten, Cybersicherheit und KI-Selbstverbesserung. Persuasion wurde aus dem Rahmenwerk entfernt und in andere Richtlinien verlagert; Forschungskategorien für noch nicht ausreichend verstandene Risiken kamen hinzu.
Governance-technisch tragen drei Instanzen das Verfahren: die Safety Advisory Group (SAG) als internes Expertengremium, das Empfehlungen ausspricht; die Unternehmensleitung, die die eigentliche Freigabeentscheidung trifft; und der Safety and Security Committee-Ausschuss des Board of Directors als Aufsichtsinstanz.
Im Juli 2026 löste OpenAI das eigenständige Preparedness-Team auf und verteilte dessen Zuständigkeiten auf andere Sicherheitsteams unter der Leitung von Saachi Jain – nach dem Superalignment-Team (Mai 2024) und dem AGI-Readiness-Team (2024) die dritte aufgelöste Sicherheitseinheit binnen zwei Jahren.
Abgrenzung
Responsible Scaling Policy – Anthropics Pendant bindet Schutzmaßnahmen an AI Safety Levels (ASL) und braucht die Zustimmung eines eigens dafür geschaffenen Long-Term Benefit Trust, um geändert zu werden. Das Preparedness Framework kennt keine vergleichbare externe Instanz; die Entscheidungsgewalt liegt bei der Unternehmensleitung selbst, die Empfehlungen der SAG ablehnen kann.
Frontier Safety Framework – Google DeepMinds im Mai 2024 vorgestelltes Rahmenwerk arbeitet mit Critical Capability Levels und betont stärker als OpenAI die Absicherung von Modellgewichten gegen Diebstahl. Alle drei Rahmenwerke teilen die Grundidee der Fähigkeitsschwelle, unterscheiden sich aber in Kategorienzuschnitt, Verbindlichkeit und der Frage, wer eine Überschreitung feststellen darf.
Begriffsgeschichte
Vorgeschichte und Gründung des Preparedness-Teams
OpenAI kündigte das Preparedness-Team im Oktober 2023 an, mit Aleksander Madry als Leiter. Aufgabe war es, Fähigkeitsbewertung, Evaluierungen und internes Red-Teaming für Frontier-Modelle zu bündeln – von aktuellen Systemen bis zu potenziellen AGI-Fähigkeiten.
Die Beta-Fassung (Dezember 2023)
Am 18. Dezember 2023 veröffentlichte OpenAI das Preparedness Framework als „lebendes Dokument”, ausdrücklich im Beta-Status. Es folgte wenige Monate auf Anthropics Responsible Scaling Policy und entstand im selben regulatorischen Klima wie die freiwilligen Selbstverpflichtungen gegenüber dem Weißen Haus.
Zugesagt wurde unter anderem, Scorecard-Bewertungen durch qualifizierte, unabhängige Dritte prüfen zu lassen und die Ergebnisse zu jedem Frontier-Modell zu veröffentlichen.
Superalignment-Auflösung und Kritik früherer Mitarbeitender (Mai 2024)
Im Mai 2024 löste OpenAI das Superalignment-Team auf, das an der langfristigen Ausrichtung übermenschlicher KI-Systeme gearbeitet hatte – organisatorisch getrennt vom Preparedness-Team, das kurzfristigere, katastrophale Risiken bereits ausgelieferter oder unmittelbar bevorstehender Modelle bewertet.
Jan Leike, Co-Leiter von Superalignment, begründete seinen Austritt öffentlich damit, Sicherheitsforschung sei gegenüber „glänzenden Produkten” ins Hintertreffen geraten; er erklärte zudem, sein Team habe trotz wiederholter Anfragen keine ausreichende Rechenkapazität erhalten. Die zeitliche Nähe beider Ereignisse verstärkte den Eindruck, OpenAIs Sicherheitsarchitektur stehe unter strukturellem Druck.
Seoul-Gipfel und Verbreitung der Gattung (Mai 2024)
Auf dem KI-Gipfel in Seoul im Mai 2024 sagten sechzehn Unternehmen zu, vergleichbare Rahmenwerke zu veröffentlichen oder zu aktualisieren. Google DeepMind folgte noch im selben Monat mit dem Frontier Safety Framework.
Version 2 (April 2025)
Am 15. April 2025 veröffentlichte OpenAI eine überarbeitete Fassung. Sie strich die frühere Zusage einer unabhängigen externen Prüfung der Scorecard-Bewertungen und lockerte die Testpflicht für nachtrainierte Modellvarianten.
Neu war eine „Wettbewerbsdynamik”-Klausel: Bringt ein anderer Anbieter ein vergleichbar risikoreiches System ohne entsprechende Schutzmaßnahmen heraus, kann OpenAI die eigenen Anforderungen anpassen. Kritiker werteten das als institutionalisierten Anreiz zum Unterbieten der Sicherheitsstandards.
Auflösung des eigenständigen Teams (Juli 2026)
Ende Juli 2026 löste OpenAI das Preparedness-Team als eigenständige Einheit auf. Das Unternehmen bestritt eine Auflösung im engeren Sinn und verwies darauf, die Forschungsverantwortung für Cybersicherheit, biologische/chemische Risiken und KI-Selbstverbesserung liege weiterhin bei benannten Teamleitungen, die an Sicherheitschefin Saachi Jain berichten.
Beobachter ordneten den Schritt als Teil einer „Streamlining”-Umstrukturierung vor dem geplanten Börsengang ein.
Methodische Grundlagen
Tracked Categories. Kernstück des Rahmenwerks sind klar benannte Risikofelder – in Version 2 biologische/chemische Fähigkeiten, Cybersicherheit und KI-Selbstverbesserung –, für die jeweils Fähigkeitsschwellen definiert sind. Research Categories erfassen zusätzlich Risiken, die noch nicht robust genug verstanden sind, um sie verbindlich zu tracken.
Zwei Schwellen statt vier Stufen. Version 2 unterscheidet nur noch High (kann bestehende Wege zu schwerem Schaden verstärken) und Critical (kann grundsätzlich neue Wege zu schwerem Schaden eröffnen). Schwerer Schaden ist als über 1.000 Tote oder über 100 Milliarden US-Dollar wirtschaftlicher Schaden definiert (OpenAI 2025).
Safety Advisory Group. Die SAG prüft Fähigkeits- und Schutzmaßnahmenberichte zu jeder erfassten Modellveröffentlichung, bewertet das verbleibende Risiko und spricht eine Empfehlung an die Unternehmensleitung aus. Diese trägt die endgültige Entscheidungsgewalt und kann auch ohne SAG-Beteiligung entscheiden; das Safety and Security Committee des Board übt Aufsicht darüber aus.
Deployment-Gates. Erreicht ein System die Schwelle High, muss es vor der Freigabe hinreichend abgesichert sein. Bei Critical gilt diese Pflicht bereits während der Entwicklung – nicht erst vor der Veröffentlichung.
Stand 2025/2026
Externe Evaluatoren wie METR führen dokumentierte Pre-Deployment-Tests für OpenAI-Modelle durch, darunter o1, o3, GPT-4.5, GPT-5 und – im Juni 2026 mit frühem Zugang zur rohen Gedankenkette – GPT-5.6 Sol.
METR selbst betont wiederholt, solche Tests allein seien keine hinreichende Risikomanagement-Strategie, und beklagte für die o3/o4-mini-Prüfung 2025 nur drei Wochen Vorlaufzeit. Eine im Preparedness Framework definierte Schwelle für vollautomatisierte KI-Selbstverbesserung galt laut METR bis Mitte 2026 weiterhin als nicht überschritten.
Erster Fall der Schwelle Critical. Am 3. September 2026 stufte OpenAI GPT-6 Astra in der Kategorie Cybersicherheit als Critical ein – die erste solche Einstufung überhaupt. Begründet wurde sie damit, dass das Modell bislang unbekannte Schwachstellen in gut geschützten Systemen ohne schrittweise Anleitung finden und ausnutzen könne.
Damit wurde erstmals ein Fall geprüft, für den das Rahmenwerk Absicherung bereits während der Entwicklung verlangt und nicht erst vor der Veröffentlichung. OpenAI verzögerte die Freigabe für zusätzliche Sicherheitstests, behielt die weitergehenden Cyberfähigkeiten einem geprüften Kreis vor und ließ das ausgelieferte Modell entsprechende Anfragen verweigern.
Eine im September 2025 auf arXiv erschienene Analyse, deren Erstautor Sam Coggins von der Australian National University stammt, untersuchte Version 2 mithilfe der sogenannten Affordance-Theorie und des MIT AI Risk Repository.
Ihr Schluss: Das Rahmenwerk verpflichte OpenAI zu keiner konkreten Risikominderungsmaßnahme, decke nur einen kleinen Teil möglicher KI-Risiken ab und erlaube der Unternehmensleitung, Systeme mit mittleren gefährlichen Fähigkeiten regulär auszuliefern.
Kontroversen und Kritik
Fehlende externe Prüfbarkeit. Die Beta-Fassung von 2023 versprach eine Prüfung der Scorecard-Bewertungen durch unabhängige Dritte. Diese Zusage fehlt in Version 2 vollständig – ein Bruch, den Kritiker als Rückschritt gegenüber dem ursprünglichen Versprechen werten.
Verzögerte Veröffentlichung. OpenAI hatte zugesagt, Preparedness-Bewertungen parallel zu jeder Frontier-Modell-Veröffentlichung offenzulegen. Die Bewertung zu GPT-4o erschien nach Berichten der OpenAI Files erst rund drei Monate nach dem Modell-Launch.
Entfernte Kategorie und gelockerte Testpflicht. Version 2 strich Persuasion als eigene Tracked Category und beschränkte die Pflicht, nachtrainierte Modellvarianten zu testen, auf Fälle mit offenen Gewichten – aus Kritikersicht eine Verengung des Anwendungsbereichs zum ungünstigen Zeitpunkt.
Wettbewerbsdynamik-Klausel. Die Möglichkeit, Sicherheitsanforderungen abzusenken, wenn ein Konkurrent ein vergleichbares Risiko ohne entsprechende Schutzmaßnahmen auf den Markt bringt, wird als Anreiz zum Unterbieten gelesen, der dem gesamten Konzept der Selbstbindung zuwiderläuft.
Konzentrierte Entscheidungsgewalt. Die Unternehmensleitung kann SAG-Empfehlungen ablehnen; das aufsichtführende Board-Gremium ist mit Personen besetzt, die auch operative Verantwortung tragen. Kritiker sehen darin einen strukturellen Interessenkonflikt, der die Kontrollfunktion schwächt.
Personelle Fluktuation im Sicherheitsbereich. Mit Superalignment (2024), dem AGI-Readiness-Team (2024) und dem eigenständigen Preparedness-Team (2026) hat OpenAI binnen zwei Jahren drei sicherheitsfokussierte Einheiten aufgelöst oder umstrukturiert. Das Unternehmen bestreitet einen Bedeutungsverlust der Sicherheitsarbeit selbst und verweist auf die fortbestehenden Fachverantwortlichkeiten unter neuer Leitung.
Verwandte Begriffe
- Frontier Models – die geregelte Modellklasse
- AI Safety Levels – verwandtes Stufenkonzept bei Anthropic
- Red-Teaming – Verfahren der Fähigkeitsprüfung
Quellenangaben
- OpenAI, 2023. Preparedness Framework (Beta). openai.com, 18. Dezember 2023.
- OpenAI, 2025. Our Updated Preparedness Framework. openai.com, 15. April 2025.
- OpenAI, 2025. Preparedness Framework Version 2. cdn.openai.com, 15. April 2025.
- UK Government / Republic of Korea, 2024. Frontier AI Safety Commitments, AI Seoul Summit 2024. gov.uk, 21. Mai 2024.
- Google DeepMind, 2024. Introducing the Frontier Safety Framework. deepmind.google, 17. Mai 2024.
- Leike, Jan, 2024. Twitter-Thread zum Austritt aus OpenAI, 17. Mai 2024.
- AI Lab Watch, 2025. OpenAI Rewrote Its Preparedness Framework. ailabwatch.substack.com, April 2025.
- Tech Oversight Project, 2025. The OpenAI Files: Broken Promises, Safety Compromises, Conflicts of Interest, and Leadership Concerns. openaifiles.org, 18. Juni 2025.
- Axios, 2025. OpenAI Updates Its System for Evaluating AI Risks. axios.com, 15. April 2025.
- METR, 2025. Preliminary Evaluation of OpenAI’s o3 and o4-mini. metr.org, April 2025.
- METR, 2026. Summary of METR’s Predeployment Evaluation of GPT-5.6 Sol. metr.org, 26. Juni 2026.
- Engadget, 2026. OpenAI Reportedly Disbanded Its Preparedness Team As Part Of A „Streamlining” Process. engadget.com, August 2026.
- arXiv, 2026. The 2025 OpenAI Preparedness Framework Does Not Guarantee Any AI Risk Mitigation Practices. arXiv: 2509.24394.