Übersicht

Lexikon-Thema: Alignment & Sicherheit

Concrete Problems in AI Safety

Concrete Problems in AI Safety holte die Sicherheitsdebatte 2016 aus der Spekulation ins Ingenieurwesen – fünf Probleme, die den Forschungsplan prägen.

Weiterlesen

Chain-of-Thought Faithfulness

Chain-of-Thought Faithfulness fragt, ob die sichtbare Denkspur eines Modells seine Berechnung wiedergibt – und ob Aufsicht sich darauf stützen kann.

Weiterlesen

Agentic Misalignment

Agentic Misalignment bezeichnet schädigendes Handeln autonomer KI-Systeme gegen ihren Betreiber – Anthropics Stresstest von 2025 an sechzehn Frontier-Modellen.

Weiterlesen

Prompt Injection

Prompt Injection macht Daten zu Anweisungen – direkte und indirekte Varianten, warum es keine saubere Abwehr gibt und was agentische Systeme verschärfen.

Weiterlesen

Inner Alignment

Inner Alignment fragt, ob ein trainiertes System im Einsatz wirklich das Ziel verfolgt, auf das es trainiert wurde – Mesa-Optimierung und Deceptive Alignment.

Weiterlesen

Specification Gaming

Specification Gaming heißt: Das System erfüllt die Vorgabe und verfehlt das Ziel – Reward Hacking, der Bootsrennen-Klassiker und was Reasoning-Training ändert.

Weiterlesen

Outer Alignment

Outer Alignment fragt, ob die trainierte Zielfunktion die Absicht der Entwickler:innen trifft – Reward Hacking, Specification Gaming, Grenzen der Spezifikation.

Weiterlesen

Corrigibility

Corrigibility ist die Eigenschaft, Korrektur und Abschaltung zuzulassen – von Soares Formalismus 2015 bis zu gemessener Abschaltresistenz in Frontier-Modellen.

Weiterlesen

Formale Verifikation

Formale Verifikation weist mathematisch streng nach, dass ein System seine Spezifikation erfüllt – und was das für KI-Sicherheit leisten kann.

Weiterlesen

Human Compatible

Human Compatible ist Stuart Russells Streitschrift von 2019: Systeme sollen menschliche Ziele nicht kennen, sondern über sie im Ungewissen bleiben.

Weiterlesen