Übersicht

Lexikon-Thema: Alignment & Sicherheit

Fairness

Fairness bezeichnet Kriterien für die gerechte Verteilung algorithmischer Fehler – konkurrierende Maße, ihre Rechtsbezüge und warum Blindheit nicht genügt.

Weiterlesen

Menschliche Aufsicht

Menschliche Aufsicht verlangt, dass Personen KI-Entscheidungen wirksam überwachen können – Pflicht nach Artikel 14 KI-VO, mit bekannten Grenzen.

Weiterlesen

The Superintelligent Will

The Superintelligent Will (Bostrom 2012) formulierte Orthogonality Thesis und Instrumental Convergence – Grundpfeiler heutiger KI-Sicherheitsforschung.

Weiterlesen

Pause Giant AI Experiments

Pause Giant AI Experiments (FLI 2023) forderte einen sechsmonatigen Trainingsstopp für Systeme jenseits von GPT-4 – über 30.000 Unterschriften, keine Pause.

Weiterlesen

Hanson-Yudkowsky AI Foom Debate

Die Hanson-Yudkowsky AI Foom Debate (2008) stritt über plötzliches oder allmähliches KI-Take-off – lokale Explosion gegen breite, ökonomische Diffusion.

Weiterlesen

Sandbagging

Sandbagging ist absichtliche Unterperformance bei Sicherheitsbewertungen – 2024 gezeigt: Frontier-Modelle können gefährliche Fähigkeiten gezielt verbergen.

Weiterlesen

Robustheit

Robustheit bezeichnet, ob ein KI-System unter manipulierten Bedingungen verlässlich bleibt – adversariale Beispiele sind der Standardbeleg für ihr Fehlen.

Weiterlesen

Reward Model

Ein Reward Model ist ein aus menschlichen Präferenzurteilen trainiertes Bewertungsmodell, das im RLHF-Verfahren die Belohnung für ein Sprachmodell ersetzt.

Weiterlesen

Scaling Monosemanticity

Scaling Monosemanticity (2024) skaliert Sparse Autoencoders erstmals auf ein produktives Sprachmodell – Millionen interpretierbare Merkmale in Claude 3 Sonnet.

Weiterlesen

Nachvollziehbarkeit

Nachvollziehbarkeit bezeichnet die Möglichkeit, KI-Entscheidungen im Nachhinein zu prüfen und zu begründen – mehr als reine Interpretierbarkeit.

Weiterlesen