Constitutional AI (CAI, „verfassungsgemäße KI“) ist ein von Anthropic entwickeltes Verfahren, KI-Modelle anhand einer schriftlichen Liste von Prinzipien — der „Constitution“ — auszurichten. Statt tausender menschlicher Sicherheitsbewertungen geben meist wenige Grundsätze die Richtung vor; das Modell bewertet und verbessert seine eigenen Antworten gegen diesen Katalog. Eingeführt wurde CAI im Dezember 2022 im Paper „Constitutional AI: Harmlessness from AI Feedback“ (Bai et al., arXiv 2212.08073) und kam erstmals in Claude zum Einsatz.

Wie Constitutional AI funktioniert

Der Prozess läuft in zwei Phasen ab:

  1. Überwachte Phase (SL-CAI): Das Modell bekommt schädliche Anfragen, formuliert nach einem Prinzip eine Kritik an seiner eigenen Antwort, überarbeitet diese daraufhin und erzeugt so ein neues, harmloseres Antwortpaar. Mit diesen Daten wird das Modell per Supervised Learning nachtrainiert.
  2. RL-Phase (RLAIF): Statt menschlicher Präferenzvergleiche bewertet das KI-Modell selbst Antwortpaare anhand der Constitution. Über Reinforcement Learning from AI Feedback wird das Verhalten weiter optimiert.

Vorteile und Grenzen

Der größte Vorteil ist die Skalierbarkeit: Menschliche Bewertungen schädlicher Ausgaben sinken auf ein Minimum, und die Prinzipien sind explizit dokumentiert und überprüfbar. Die Constitution von Claude umfasst rund 75 Prinzipien aus Quellen wie der UN-Menschenrechtscharta. Die Grenzen: Die Prinzipienliste muss selbst sorgfältig entworfen werden, und die KI-Feedback-Schleife kann Fehler des Bewertungsmodells verstärken — die Methode ersetzt menschliche Aufsicht nicht vollständig, sondern verlagert sie.

Verwandte Grundlagen: AI-Alignment, Instruction Tuning, RLHF, Reward Modeling, Fine-Tuning, Reinforcement Learning.