Übersicht

Lexikon-Thema: Alignment & Sicherheit

Preparedness Framework

Das Preparedness Framework ist OpenAIs internes Rahmenwerk von 2023 zur Bewertung katastrophaler Risiken von Frontier-Modellen vor deren Freigabe.

Weiterlesen

Unlearning

Unlearning soll ein KI-Modell den Einfluss bestimmter Daten vergessen lassen – Wunschtechnik hinter der DSGVO-Löschpflicht, mit ungelöster Nachweisfrage.

Weiterlesen

AI Control

AI Control sichert KI-Systeme ab, ohne Ehrlichkeit oder guten Willen vorauszusetzen – Redwood Researchs Antwort auf ein ungelöstes Alignment-Problem.

Weiterlesen

Eliciting Latent Knowledge

Eliciting Latent Knowledge fragt, wie man herausfindet, was ein KI-System wirklich weiß – selbst wenn es keinen Anreiz hat, das ehrlich zu berichten.

Weiterlesen

Fairness

Fairness bezeichnet Kriterien für die gerechte Verteilung algorithmischer Fehler – konkurrierende Maße, ihre Rechtsbezüge und warum Blindheit nicht genügt.

Weiterlesen

Menschliche Aufsicht

Menschliche Aufsicht verlangt, dass Personen KI-Entscheidungen wirksam überwachen können – Pflicht nach Artikel 14 KI-VO, mit bekannten Grenzen.

Weiterlesen

The Superintelligent Will

The Superintelligent Will (Bostrom 2012) formulierte Orthogonality Thesis und Instrumental Convergence – Grundpfeiler heutiger KI-Sicherheitsforschung.

Weiterlesen

Pause Giant AI Experiments

Pause Giant AI Experiments (FLI 2023) forderte einen sechsmonatigen Trainingsstopp für Systeme jenseits von GPT-4 – über 30.000 Unterschriften, keine Pause.

Weiterlesen

Hanson-Yudkowsky AI Foom Debate

Die Hanson-Yudkowsky AI Foom Debate (2008) stritt über plötzliches oder allmähliches KI-Take-off – lokale Explosion gegen breite, ökonomische Diffusion.

Weiterlesen

Sandbagging

Sandbagging ist absichtliche Unterperformance bei Sicherheitsbewertungen – 2024 gezeigt: Frontier-Modelle können gefährliche Fähigkeiten gezielt verbergen.

Weiterlesen