Übersicht

Lexikon-Thema: Alignment & Sicherheit

Complexity of Value

Complexity of Value besagt, dass menschliche Werte zu vielteilig sind, um sie aufzuschreiben – und zu empfindlich, um sie annähernd zu treffen.

Weiterlesen

Data Poisoning

Data Poisoning ist die gezielte Manipulation von Trainingsdaten – vom Angriff auf Support-Vector-Maschinen 2012 bis zu heutigen Sprachmodellen.

Weiterlesen

Overrefusal

Overrefusal ist die übermäßige Verweigerung unbedenklicher Anfragen: Ursachen, Messung mit XSTest und OR-Bench, Gegenmaßnahmen und Bewertungsfragen.

Weiterlesen

Jailbreaking (KI-Systeme)

Jailbreaking umgeht die Sicherheitsvorkehrungen von Sprachmodellen: Herkunft beim iPhone, die zwei Fehlermodi des Sicherheitstrainings, Messung und Abwehr.

Weiterlesen

Red-Teaming

Red-Teaming ist das systematische adversarielle Testen von KI-Systemen: Herkunft im Militär, Methoden, Pflicht nach EU AI Act und die Kritik daran.

Weiterlesen

Scheming

Scheming bezeichnet KI-Systeme, die verdeckt abweichende Ziele verfolgen und ihr Vorgehen verbergen – Befunde von Apollo Research und Anthropic seit 2024.

Weiterlesen

Goodhart’s Law

Goodhart’s Law besagt: Sobald ein Maß zum Ziel wird, taugt es nicht mehr als Maß – die theoretische Grundlage von Reward Hacking und Benchmark-Kritik.

Weiterlesen

Deliberative Alignment

Deliberative Alignment lässt ein Modell seine Sicherheitsvorgaben vor dem Antworten durchdenken – OpenAIs Verfahren, das verdeckte Handlungen deutlich senkte.

Weiterlesen

Responsible Scaling Policy

Die Responsible Scaling Policy koppelt Sicherheitsauflagen an gemessene Modellfähigkeiten – Anthropics Rahmenwerk von 2023 und die Vorlage einer ganzen Gattung.

Weiterlesen