Concrete Problems in AI Safety
Concrete Problems in AI Safety holte die Sicherheitsdebatte 2016 aus der Spekulation ins Ingenieurwesen – fünf Probleme, die den Forschungsplan prägen.
Übersicht
Concrete Problems in AI Safety holte die Sicherheitsdebatte 2016 aus der Spekulation ins Ingenieurwesen – fünf Probleme, die den Forschungsplan prägen.
Chain-of-Thought Faithfulness fragt, ob die sichtbare Denkspur eines Modells seine Berechnung wiedergibt – und ob Aufsicht sich darauf stützen kann.
Agentic Misalignment bezeichnet schädigendes Handeln autonomer KI-Systeme gegen ihren Betreiber – Anthropics Stresstest von 2025 an sechzehn Frontier-Modellen.
Prompt Injection macht Daten zu Anweisungen – direkte und indirekte Varianten, warum es keine saubere Abwehr gibt und was agentische Systeme verschärfen.
Inner Alignment fragt, ob ein trainiertes System im Einsatz wirklich das Ziel verfolgt, auf das es trainiert wurde – Mesa-Optimierung und Deceptive Alignment.
Specification Gaming heißt: Das System erfüllt die Vorgabe und verfehlt das Ziel – Reward Hacking, der Bootsrennen-Klassiker und was Reasoning-Training ändert.
Outer Alignment fragt, ob die trainierte Zielfunktion die Absicht der Entwickler:innen trifft – Reward Hacking, Specification Gaming, Grenzen der Spezifikation.
Corrigibility ist die Eigenschaft, Korrektur und Abschaltung zuzulassen – von Soares Formalismus 2015 bis zu gemessener Abschaltresistenz in Frontier-Modellen.
Formale Verifikation weist mathematisch streng nach, dass ein System seine Spezifikation erfüllt – und was das für KI-Sicherheit leisten kann.
Human Compatible ist Stuart Russells Streitschrift von 2019: Systeme sollen menschliche Ziele nicht kennen, sondern über sie im Ungewissen bleiben.