Cooperative Inverse Reinforcement Learning (CIRL)
Cooperative Inverse Reinforcement Learning ist ein Zwei-Personen-Spiel (Hadfield-Menell u. a. 2016), in dem ein Roboter die Ziele des Menschen erst lernen muss.
Übersicht
Cooperative Inverse Reinforcement Learning ist ein Zwei-Personen-Spiel (Hadfield-Menell u. a. 2016), in dem ein Roboter die Ziele des Menschen erst lernen muss.
Coherent Extrapolated Volition ist Yudkowskys Vorschlag von 2004: KI soll nicht geäußerten Wünschen folgen, sondern dem, was wir klüger wollen würden.
Alignment Faking bezeichnet strategisches Scheinbefolgen des Trainingsziels durch Sprachmodelle – Versuchsaufbau, Befunde und Kritik der Anthropic-Studie.
Reward Hacking bezeichnet das Ausnutzen von Lücken in der Belohnungsspezifikation durch RL-Agenten und Sprachmodelle: Geschichte, Formalisierung, Befunde.
Mesa-Optimization beschreibt, wie ein trainiertes Modell selbst zum Optimierer wird und ein eigenes Ziel verfolgt – der Kern des Inner-Alignment-Problems.
Mechanistic Interpretability rekonstruiert die internen Berechnungen neuronaler Netze als konkrete Algorithmen – von Induction Heads bis Sparse Autoencoders.
Instrumental Convergence besagt, dass leistungsfähige Agenten unabhängig vom Endziel dieselben Zwischenziele verfolgen: Selbsterhaltung, Zielstabilität, Macht.
AI Alignment ist das Feld, das KI-Systeme auf menschliche Absichten ausrichten will – Inner und Outer Alignment, Specification Gaming, Scalable Oversight.