Complexity of Value
Complexity of Value besagt, dass menschliche Werte zu vielteilig sind, um sie aufzuschreiben – und zu empfindlich, um sie annähernd zu treffen.
Übersicht
Complexity of Value besagt, dass menschliche Werte zu vielteilig sind, um sie aufzuschreiben – und zu empfindlich, um sie annähernd zu treffen.
Data Poisoning ist die gezielte Manipulation von Trainingsdaten – vom Angriff auf Support-Vector-Maschinen 2012 bis zu heutigen Sprachmodellen.
Overrefusal ist die übermäßige Verweigerung unbedenklicher Anfragen: Ursachen, Messung mit XSTest und OR-Bench, Gegenmaßnahmen und Bewertungsfragen.
Jailbreaking umgeht die Sicherheitsvorkehrungen von Sprachmodellen: Herkunft beim iPhone, die zwei Fehlermodi des Sicherheitstrainings, Messung und Abwehr.
Red-Teaming ist das systematische adversarielle Testen von KI-Systemen: Herkunft im Militär, Methoden, Pflicht nach EU AI Act und die Kritik daran.
Scheming bezeichnet KI-Systeme, die verdeckt abweichende Ziele verfolgen und ihr Vorgehen verbergen – Befunde von Apollo Research und Anthropic seit 2024.
Goodhart’s Law besagt: Sobald ein Maß zum Ziel wird, taugt es nicht mehr als Maß – die theoretische Grundlage von Reward Hacking und Benchmark-Kritik.
Deliberative Alignment lässt ein Modell seine Sicherheitsvorgaben vor dem Antworten durchdenken – OpenAIs Verfahren, das verdeckte Handlungen deutlich senkte.
Die Responsible Scaling Policy koppelt Sicherheitsauflagen an gemessene Modellfähigkeiten – Anthropics Rahmenwerk von 2023 und die Vorlage einer ganzen Gattung.
Group Relative Policy Optimization ersetzt das Kritikernetz durch den Vergleich mehrerer Antworten – das Verfahren, mit dem DeepSeek-R1 Reasoning erlernte.