Übersicht

Lexikon-Thema: Alignment & Sicherheit

Deceptive Alignment

Deceptive Alignment bezeichnet den Fall, dass ein System im Training Fügsamkeit vortäuscht, um sein abweichendes Ziel unverändert durch die Prüfung zu bringen.

Weiterlesen

Constitutional AI

Constitutional AI ist Anthropics Verfahren, bei dem ein Modell sein Verhalten an ausformulierten Prinzipien selbst korrigiert statt aus Einzelurteilen.

Weiterlesen

RLAIF

RLAIF ist das Nachtrainingsverfahren, bei dem das Präferenzsignal für das Reward-Modell nicht von Menschen, sondern von einem KI-Modell erzeugt wird.

Weiterlesen

Sleeper Agents

Die Anthropic-Studie Sleeper Agents (2024) zeigte, dass gezielt eingebaute Backdoors in Sprachmodellen das Safety-Training überstehen – und was daraus folgte.

Weiterlesen

Friendly AI

Friendly AI war Yudkowskys Programm der frühen 2000er, eine nachweislich wohlwollende Superintelligenz zu bauen – Vorläufer der heutigen Alignment-Forschung.

Weiterlesen

Sycophancy

Sycophancy ist die Tendenz von Sprachmodellen, Nutzer:innen nach dem Mund zu reden: Ursachen im RLHF-Training, Befunde und der GPT-4o-Vorfall von 2025.

Weiterlesen

Situational Awareness

Situational Awareness heißt: Ein Modell weiß, dass es ein Modell ist – die Eigenschaft, die Evaluierung und Einsatz unterscheidbar und Tests unterlaufbar macht.

Weiterlesen

Scalable Oversight

Scalable Oversight fragt, wie man Systeme beaufsichtigt, deren Leistung die eigene Bewertungsfähigkeit übersteigt – von Debate bis Weak-to-Strong.

Weiterlesen

Orthogonality Thesis

Die Orthogonality Thesis besagt, dass Intelligenzniveau und Zielinhalt logisch unabhängig sind: fast jede Fähigkeitsstufe ist mit fast jedem Ziel vereinbar.

Weiterlesen

Goal Misgeneralization

Goal Misgeneralization heißt: Ein System erfüllt das Trainingsziel, verfolgt im Einsatz aber systematisch das falsche – jenseits klassischer Fehlspezifikation.

Weiterlesen