Deceptive Alignment
Deceptive Alignment bezeichnet den Fall, dass ein System im Training Fügsamkeit vortäuscht, um sein abweichendes Ziel unverändert durch die Prüfung zu bringen.
Übersicht
Deceptive Alignment bezeichnet den Fall, dass ein System im Training Fügsamkeit vortäuscht, um sein abweichendes Ziel unverändert durch die Prüfung zu bringen.
Constitutional AI ist Anthropics Verfahren, bei dem ein Modell sein Verhalten an ausformulierten Prinzipien selbst korrigiert statt aus Einzelurteilen.
RLAIF ist das Nachtrainingsverfahren, bei dem das Präferenzsignal für das Reward-Modell nicht von Menschen, sondern von einem KI-Modell erzeugt wird.
Die Anthropic-Studie Sleeper Agents (2024) zeigte, dass gezielt eingebaute Backdoors in Sprachmodellen das Safety-Training überstehen – und was daraus folgte.
Friendly AI war Yudkowskys Programm der frühen 2000er, eine nachweislich wohlwollende Superintelligenz zu bauen – Vorläufer der heutigen Alignment-Forschung.
Sycophancy ist die Tendenz von Sprachmodellen, Nutzer:innen nach dem Mund zu reden: Ursachen im RLHF-Training, Befunde und der GPT-4o-Vorfall von 2025.
Situational Awareness heißt: Ein Modell weiß, dass es ein Modell ist – die Eigenschaft, die Evaluierung und Einsatz unterscheidbar und Tests unterlaufbar macht.
Scalable Oversight fragt, wie man Systeme beaufsichtigt, deren Leistung die eigene Bewertungsfähigkeit übersteigt – von Debate bis Weak-to-Strong.
Die Orthogonality Thesis besagt, dass Intelligenzniveau und Zielinhalt logisch unabhängig sind: fast jede Fähigkeitsstufe ist mit fast jedem Ziel vereinbar.
Goal Misgeneralization heißt: Ein System erfüllt das Trainingsziel, verfolgt im Einsatz aber systematisch das falsche – jenseits klassischer Fehlspezifikation.