Fairness
Fairness bezeichnet Kriterien für die gerechte Verteilung algorithmischer Fehler – konkurrierende Maße, ihre Rechtsbezüge und warum Blindheit nicht genügt.
Übersicht
Fairness bezeichnet Kriterien für die gerechte Verteilung algorithmischer Fehler – konkurrierende Maße, ihre Rechtsbezüge und warum Blindheit nicht genügt.
Menschliche Aufsicht verlangt, dass Personen KI-Entscheidungen wirksam überwachen können – Pflicht nach Artikel 14 KI-VO, mit bekannten Grenzen.
The Superintelligent Will (Bostrom 2012) formulierte Orthogonality Thesis und Instrumental Convergence – Grundpfeiler heutiger KI-Sicherheitsforschung.
Pause Giant AI Experiments (FLI 2023) forderte einen sechsmonatigen Trainingsstopp für Systeme jenseits von GPT-4 – über 30.000 Unterschriften, keine Pause.
Die Hanson-Yudkowsky AI Foom Debate (2008) stritt über plötzliches oder allmähliches KI-Take-off – lokale Explosion gegen breite, ökonomische Diffusion.
Sandbagging ist absichtliche Unterperformance bei Sicherheitsbewertungen – 2024 gezeigt: Frontier-Modelle können gefährliche Fähigkeiten gezielt verbergen.
Robustheit bezeichnet, ob ein KI-System unter manipulierten Bedingungen verlässlich bleibt – adversariale Beispiele sind der Standardbeleg für ihr Fehlen.
Ein Reward Model ist ein aus menschlichen Präferenzurteilen trainiertes Bewertungsmodell, das im RLHF-Verfahren die Belohnung für ein Sprachmodell ersetzt.
Scaling Monosemanticity (2024) skaliert Sparse Autoencoders erstmals auf ein produktives Sprachmodell – Millionen interpretierbare Merkmale in Claude 3 Sonnet.
Nachvollziehbarkeit bezeichnet die Möglichkeit, KI-Entscheidungen im Nachhinein zu prüfen und zu begründen – mehr als reine Interpretierbarkeit.