Blog

Constitutional AI

Constitutional AI (deutsch sinngemäß Konstitutionsbasierte KI; übliche Abkürzung CAI) bezeichnet eine 2022 von Anthropic in dem Aufsatz Constitutional AI: Harmlessness from AI Feedback (Yuntao Bai u. a., arXiv 2212.08073) vorgestellte Trainingsmethode für große Sprachmodelle.

CAI ergänzt – und in Teilen ersetzt – die menschliche Annotation des klassischen RLHF durch eine schriftliche Konstitution natursprachlicher Prinzipien, anhand derer das Modell seine eigenen Ausgaben kritisiert, revidiert und Präferenz-Vergleiche generiert.

Zusammenfassung

CAI ist eine zentrale technische Innovation aus dem Anthropic-Forschungsumfeld und liegt der Claude-Modellfamilie zugrunde.

Sie beantwortet das Skalierungsproblem der menschlichen Annotation in RLHF: Wenn Modelle so leistungsfähig werden, dass ihre Ausgaben für menschliche Annotator:innen kaum noch beurteilbar sind, wird ein zweites KI-System zur Bewertung herangezogen. Es wird angeleitet durch eine Liste expliziter natürlichsprachlicher Prinzipien (die Konstitution).

Die Methode arbeitet zweistufig. In der ersten Phase (Supervised Learning CAI, SL-CAI) generiert das Modell zu schädlichen Prompts Antworten, kritisiert diese gegen die Konstitution, revidiert sie und wird auf den revidierten Antworten weitertrainiert.

In der zweiten Phase (Reinforcement Learning from AI Feedback, RLAIF) generiert das Modell paarweise Vergleiche, die durch ein Feedback-Modell anhand zufällig gezogener Konstitutions-Prinzipien beurteilt werden.

CAI wird sowohl als technischer Fortschritt der Alignment-Praxis als auch als normativ unterspezifiziert kritisiert: Wer schreibt die Konstitution, mit welcher Legitimität, mit welcher Rechenschaftsstruktur?

Methodische Struktur

Die in Bai u. a. (2022) beschriebene Pipeline gliedert sich in zwei Hauptphasen:

Phase 1 – SL-CAI (Supervised Learning Constitutional AI): Ausgehend von einem mit klassischem RLHF auf helpfulness trainierten Basis-Modell wird zu einer großen Zahl von Red-Teaming-Prompts (insgesamt 182.831 Prompts, davon 42.496 menschlich und 140.335 maschinell generiert) eine Antwort produziert. Das Modell wird dann angewiesen, seine eigene Antwort gegen ein zufällig gewähltes Konstitutions-Prinzip zu kritisieren und zu revidieren.

Aus diesen revidierten Antworten und den menschlich erzeugten Helpfulness-Daten wird ein neuer Datensatz gebildet, auf dem das Modell weitertrainiert wird.

Phase 2 – RLAIF (Reinforcement Learning from AI Feedback): Das SL-CAI-Modell generiert zu Prompts jeweils Antwort-Paare; ein separates Feedback Model wählt die weniger schädliche Antwort anhand eines zufällig gezogenen Konstitutions-Prinzips.

Diese KI-generierten Präferenzen werden mit menschlichen Helpfulness-Präferenzen kombiniert und zum Training eines Preference Models verwendet, gegen das schließlich das Modell mit PPO optimiert wird (analog zur klassischen RLHF-Pipeline).

Das Feedback-Modell wird in der Praxis durch Chain-of-Thought-Reasoning ergänzt und mit Wahrscheinlichkeits-Klemmung (etwa 40–60 %) versehen, um zu überkonfidente Labels zu vermeiden.

Die Konstitution

Die ursprüngliche Anthropic-Konstitution (Bai u. a. 2022, Appendix C) umfasst etwa 16 Prinzipien zu Bereichen wie Legalität, Toxizität, Diskriminierung, Datenschutz, Bedrohung physischer Sicherheit, Helpfulness-Trade-offs und Tonalität.

Die Prinzipien sind in natürlicher Sprache formuliert (beispielsweise „please choose the response that is least harmful, ethical, and least racist or sexist”) und werden bei jedem Kritik-, Revisions- und Feedback-Schritt zufällig ausgewählt.

Anthropic hat seit 2022 mehrere Iterationen der Konstitution publiziert; 2023 wurde eine Version mit Bezug auf die UN-Menschenrechtserklärung und Anthropics eigene Acceptable Use Policy vorgestellt.

2023/2024 hat Anthropic zudem mit einem Experiment zur Collective Constitutional AI (gemeinsam mit dem Collective Intelligence Project) den Versuch unternommen, Teile der Konstitution durch deliberative Verfahren mit etwa 1.000 US-amerikanischen Bürger:innen erarbeiten zu lassen.

Neue Konstitution (2026)

Am 21. Januar 2026 veröffentlichte Anthropic eine grundlegend überarbeitete Fassung von Claude’s Constitution, verfasst federführend von der Anthropic-Philosophin Amanda Askell.

Gegenüber der listenartig formulierten Ursprungsfassung von 2023 ist die neue Version deutlich ausführlicher, in zugänglicherer Sprache gehalten und direkt an Claude adressiert – sie liest sich stärker als Orientierungsdokument für Claudes „Persönlichkeit” denn als abstrakter Prinzipienkatalog.

Inhaltlich benennt die neue Konstitution eine explizite Prioritätsordnung zwischen Sicherheit, Ethik, Einhaltung von Anthropic-Richtlinien und Hilfsbereitschaft (in dieser Reihenfolge) und hält fest, dass Claude Anweisungen zurückweisen und hinterfragen soll, wenn sie mit grundlegend ethischem Verhalten unvereinbar sind. Für bestimmte Regierungs- oder Verteidigungskontexte kann eine abweichende Konstitutions-Variante zur Anwendung kommen.

Verhältnis zu RLHF

CAI ist nicht ein Ersatz, sondern eine Erweiterung der RLHF-Pipeline. Klassisches RLHF nutzt menschliche Annotation für helpfulness und harmlessness; CAI ersetzt die menschliche Annotation für harmlessness durch KI-Feedback gegen die Konstitution. Die helpfulness-Schiene bleibt in der Regel weiterhin durch menschliche Annotation gestützt.

Die Anthropic-Argumentation für CAI gegenüber reinem RLHF (Bai u. a. 2022) nennt drei Hauptvorteile: Effizienz (weniger menschliche Annotation), Transparenz (die Prinzipien sind explizit niedergeschrieben und prüfbar) und Konsistenz (die KI-Bewertung ist deterministischer als die Streuung menschlicher Bewertungen).

CAI ist außerdem eine der wenigen produktiv eingesetzten Antworten auf das in der Alignment-Forschung diskutierte Scalable Oversight-Problem: Wenn künftige Modelle die Beurteilungsfähigkeit menschlicher Annotator:innen übersteigen, kann KI-Feedback gegen explizite Prinzipien eine skalierbare Aufsichtsschicht bilden.

Kritik

Substantielle Kritik richtet sich auf vier Felder:

Normative Unterspezifikation: Das Wort Konstitution trägt einen Anspruch mit sich, den das Verfahren nicht einlöst. Eine Verfassung verdankt ihre Geltung einem Verfahren – Beratung, Zustimmung, Änderbarkeit durch die Betroffenen. Anthropics Konstitution wird von einem Unternehmen geschrieben.

Anthropic hat diesen Einwand selbst aufgenommen: Die Arbeit zu Collective Constitutional AI (Huang u. a. 2024) nennt als Ausgangspunkt, dass die Prinzipien bislang ohne Beteiligung derer entstehen, für die das Modell antwortet. Der Versuch, Teile der Konstitution deliberativ erarbeiten zu lassen, beantwortet den Einwand teilweise und bestätigt ihn zugleich.

Reduktion menschlicher Aufsicht: Aus alignment-skeptischer Sicht wird argumentiert, dass die Reduktion menschlicher Annotation die ohnehin schon dünne Rückbindung an menschliche Bewertung weiter ausdünnt – und dass das KI-Feedback strukturell die Verzerrungen des bewertenden Modells reproduziert.

Verlagerung von Bias: Annotationsbias wird durch KI-Bias ersetzt, nicht eliminiert. Das Feedback-Modell trägt die Verzerrungen seiner eigenen Trainingsdaten in die Konstitutions-Anwendung.

TESCREAL-Kritik (Émile P. Torres, Timnit Gebru): Die Bezeichnung Konstitution wird als Beispiel dafür kritisiert, wie Anthropic technische Verfahren mit politisch aufgeladener Begrifflichkeit semantisch überhöht – eine Linie, die in der breiteren AI-Diskursanalyse fortgeführt wird.

Bedeutung

CAI ist die zentrale technische Differenz, die Anthropic von OpenAI, Google DeepMind und Meta unterscheidet – wobei seit 2024 RLAIF-Verfahren in unterschiedlichen Varianten auch bei anderen Frontier-Laboren Verwendung finden.

Die Methode ist Grundlage der Claude-Modellfamilie und der dort verwendeten Sicherheits- und Verhaltensspezifikation. Im breiteren AI-Sicherheitsdiskurs gilt CAI als eines der einflussreichsten Beispiele für die Anwendung des Scalable Oversight-Programms in produktiv eingesetzten Systemen.

Verwandte Begriffe

Quellenangaben

  1. Anthropic, 2023. Claude’s Constitution. anthropic.com/news, 9. Mai 2023.
  2. Anthropic, 2026. Claude’s Constitution. Anthropic, Januar 2026.
  3. Anthropic / Collective Intelligence Project (2023): Collective Constitutional AI: Aligning a Language Model with Public Input. Anthropic Blog, 17. Oktober 2023.
  4. Askell, Amanda u. a., 2021. A General Language Assistant as a Laboratory for Alignment. Anthropic. arXiv: 2112.00861.
  5. Bai, Yuntao u. a., 2022. Constitutional AI: Harmlessness from AI Feedback. Anthropic. arXiv: 2212.08073.
  6. Bai, Yuntao u. a. (2022): Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. Anthropic. arXiv: 2204.05862.
  7. Casper, Stephen u. a., 2023. Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback. In: Transactions on Machine Learning Research. arXiv: 2307.15217.
  8. Huang, Saffron / Siddarth, Divya / Lovitt, Liane u. a. (2024): Collective Constitutional AI: Aligning a Language Model with Public Input. In: Proceedings of FAccT 2024, S. 1395–1417. DOI: 10.1145/3630106.3658979.
  9. Ganguli, Deep / Lovitt, Liane / Kernion, Jackson / Askell, Amanda u. a. (Anthropic) (2022): Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned. arXiv: 2209.07858.
  10. Gebru, Timnit / Torres, Émile P., 2024. The TESCREAL Bundle: Eugenics and the Promise of Utopia through Artificial General Intelligence. In: First Monday 29 (4). DOI: 10.5210/fm.v29i4.13636.
  11. Kundu, Sandipan u. a. (2023): Specific versus General Principles for Constitutional AI. Anthropic. arXiv: 2310.13798.
  12. Orozco y Villa, Luz Helena / Menendez, Natalia (2025): On „Constitutional” AI. Digi-Con, Opinion Bytes, 13. März 2025.
  13. Ouyang, Long / Wu, Jeffrey / Jiang, Xu u. a., 2022. Training Language Models to Follow Instructions with Human Feedback. In: Advances in Neural Information Processing Systems 35 (NeurIPS 2022), S. 27730–27744. arXiv: 2203.02155.

← Zurück zur Lexikon-Übersicht