Übersicht

Lexikon-Thema: Alignment & Sicherheit

Robustheit

Robustheit bezeichnet, ob ein KI-System unter manipulierten Bedingungen verlässlich bleibt – adversariale Beispiele sind der Standardbeleg für ihr Fehlen.

Weiterlesen

Reward Model

Ein Reward Model ist ein aus menschlichen Präferenzurteilen trainiertes Bewertungsmodell, das im RLHF-Verfahren die Belohnung für ein Sprachmodell ersetzt.

Weiterlesen

Scaling Monosemanticity

Scaling Monosemanticity (2024) skaliert Sparse Autoencoders erstmals auf ein produktives Sprachmodell – Millionen interpretierbare Merkmale in Claude 3 Sonnet.

Weiterlesen

Nachvollziehbarkeit

Nachvollziehbarkeit bezeichnet die Möglichkeit, KI-Entscheidungen im Nachhinein zu prüfen und zu begründen – mehr als reine Interpretierbarkeit.

Weiterlesen

AI Safety Institutes

AI Safety Institutes sind staatliche Prüfstellen für Frontier-KI, seit Bletchley 2023 in über zehn Ländern entstanden – zwei zentrale haben sich 2025 umbenannt.

Weiterlesen

Toy Models of Superposition

Toy Models of Superposition (2022) erklärt, warum Neuronen mehrere Konzepte kodieren – Gründungspapier der mechanistischen Interpretierbarkeit.

Weiterlesen

InstructGPT

InstructGPT ist die erste mit RLHF trainierte GPT-3-Modellreihe (OpenAI, Januar 2022) – der Beleg, dass Ausrichtung mehr bringt als bloße Skalierung.

Weiterlesen

AI Safety Levels

AI Safety Levels koppeln Anthropics Sicherheitsstandards an das Gefahrenpotenzial eines Modells – nach dem Vorbild biologischer Schutzstufen.

Weiterlesen

Sparse Autoencoders

Sparse Autoencoders zerlegen die Aktivierungen eines Sprachmodells in einzelne, verständliche Merkmale – Anthropics Weg gegen das Superpositionsproblem.

Weiterlesen

Statement on AI Risk

Statement on AI Risk: der Satz von 2023, der KI neben Pandemien und Atomkrieg stellte – wer unterschrieb, wer nicht, und was empirisch daraus folgte.

Weiterlesen