Übersicht

Lexikon-Thema: Alignment & Sicherheit

Alignment Faking

Alignment Faking bezeichnet strategisches Scheinbefolgen des Trainingsziels durch Sprachmodelle – Versuchsaufbau, Befunde und Kritik der Anthropic-Studie.

Weiterlesen

Reward Hacking

Reward Hacking bezeichnet das Ausnutzen von Lücken in der Belohnungsspezifikation durch RL-Agenten und Sprachmodelle: Geschichte, Formalisierung, Befunde.

Weiterlesen

Mesa-Optimization

Mesa-Optimization beschreibt, wie ein trainiertes Modell selbst zum Optimierer wird und ein eigenes Ziel verfolgt – der Kern des Inner-Alignment-Problems.

Weiterlesen

Mechanistic Interpretability

Mechanistic Interpretability rekonstruiert die internen Berechnungen neuronaler Netze als konkrete Algorithmen – von Induction Heads bis Sparse Autoencoders.

Weiterlesen

Instrumental Convergence

Instrumental Convergence besagt, dass leistungsfähige Agenten unabhängig vom Endziel dieselben Zwischenziele verfolgen: Selbsterhaltung, Zielstabilität, Macht.

Weiterlesen

AI Alignment

AI Alignment ist das Feld, das KI-Systeme auf menschliche Absichten ausrichten will – Inner und Outer Alignment, Specification Gaming, Scalable Oversight.

Weiterlesen