RLAIF (Reinforcement Learning from AI Feedback) ist ein Verfahren zur Ausrichtung von KI-Modellen, bei dem ein KI-System die Rolle des Bewerters übernimmt, die in RLHF Menschen ausfüllen. Statt menschlicher Präferenzurteile liefert ein Modell – oft als KI-Judge oder KI-Präferenzmodell bezeichnet – die Belohnungssignale für das Training. RLAIF skaliert dadurch deutlich besser, weil die aufwendige menschliche Annotation entfällt.
Ursprung: Constitutional AI
Der Begriff RLAIF wurde durch die Arbeit von Anthropic an Constitutional AI geprägt (Bai et al., Dezember 2022, arXiv 2212.08073 – siehe Constitutional AI). Die Idee: Ein Katalog schriftlicher Prinzipien (bei Claude eine „Verfassung“ mit rund 75 Regeln) leitet das KI-Feedback. In der ersten Phase (SL-CAI) lässt man das Modell eigene Antworten anhand der Prinzipien kritisieren und überarbeiten und trainiert per SFT auf den revidierten Antworten. In der zweiten Phase erzeugt ein KI-Präferenzmodell – gesteuert durch dieselbe Verfassung – Vergleichsurteile, gegen die das Modell mit PPO optimiert wird. Genau dieser zweite Schritt ist RLAIF.
Abgrenzung und Vorteile
- RLAIF vs. RLHF: Beide nutzen Reinforcement Learning gegen ein Präferenzmodell. Der Unterschied liegt in der Quelle des Feedbacks: Menschen (RLHF) oder KI (RLAIF).
- Konstitution als Schutz: Die Prinzipienliste begrenzt, woran sich der KI-Judge orientiert, und macht die Wertentscheidungen explizit und überprüfbar.
- Skalierung: KI-Feedback lässt sich praktisch unbegrenzt erzeugen und ist deutlich billiger als menschliche Annotation. Studien berichten von Kostenersparnissen im Bereich eines Faktors 10 gegenüber RLHF.
- Risiko: Bewertet eine KI andere KI-Ausgaben, können sich Fehler und Vorurteile der Bewerterin im Modell verstärken (Problem des automatisierten Feedbacks, verwandt mit Reward Hacking).
RLAIF gilt als wichtiger Baustein für skalierbare AI-Alignment-Forschung: Je leistungsfähiger KI-Systeme werden, desto mehr kann ihre Bewertung ebenfalls von KI übernommen werden. Verwandte Grundlagen: KTO, ORPO, Reward Modeling, DPO, Reinforcement Learning.