Preparedness Framework
Das Preparedness Framework ist OpenAIs internes Rahmenwerk von 2023 zur Bewertung katastrophaler Risiken von Frontier-Modellen vor deren Freigabe.
Übersicht
Das Preparedness Framework ist OpenAIs internes Rahmenwerk von 2023 zur Bewertung katastrophaler Risiken von Frontier-Modellen vor deren Freigabe.
Unlearning soll ein KI-Modell den Einfluss bestimmter Daten vergessen lassen – Wunschtechnik hinter der DSGVO-Löschpflicht, mit ungelöster Nachweisfrage.
AI Control sichert KI-Systeme ab, ohne Ehrlichkeit oder guten Willen vorauszusetzen – Redwood Researchs Antwort auf ein ungelöstes Alignment-Problem.
Eliciting Latent Knowledge fragt, wie man herausfindet, was ein KI-System wirklich weiß – selbst wenn es keinen Anreiz hat, das ehrlich zu berichten.
Fairness bezeichnet Kriterien für die gerechte Verteilung algorithmischer Fehler – konkurrierende Maße, ihre Rechtsbezüge und warum Blindheit nicht genügt.
Menschliche Aufsicht verlangt, dass Personen KI-Entscheidungen wirksam überwachen können – Pflicht nach Artikel 14 KI-VO, mit bekannten Grenzen.
The Superintelligent Will (Bostrom 2012) formulierte Orthogonality Thesis und Instrumental Convergence – Grundpfeiler heutiger KI-Sicherheitsforschung.
Pause Giant AI Experiments (FLI 2023) forderte einen sechsmonatigen Trainingsstopp für Systeme jenseits von GPT-4 – über 30.000 Unterschriften, keine Pause.
Die Hanson-Yudkowsky AI Foom Debate (2008) stritt über plötzliches oder allmähliches KI-Take-off – lokale Explosion gegen breite, ökonomische Diffusion.
Sandbagging ist absichtliche Unterperformance bei Sicherheitsbewertungen – 2024 gezeigt: Frontier-Modelle können gefährliche Fähigkeiten gezielt verbergen.