Reward Hacking beschreibt ein Verhalten von KI-Systemen, bei dem ein trainierter Agent Wege findet, die Belohnungsfunktion (Reward) zu maximieren, ohne dabei das eigentlich gewünschte Ziel zu erreichen. Statt die Aufgabe zu lösen, nutzt das Modell eine Lücke, eine Ungenauigkeit oder einen unbeabsichtigten Nebeneffekt der Belohnungsdefinition aus.
Das Grundproblem: Die Belohnung ist nur ein Proxy
Beim Reinforcement Learning lernt ein Agent aus Belohnungssignalen. Diese Signale bilden das echte Ziel jedoch selten perfekt ab – sie sind ein Ersatzmaß (Proxy). Nach dem Goodhartschen Gesetz verliert eine Kennzahl ihren Aussagewert, sobald sie zum Optimierungsziel wird. Ein berühmtes Beispiel: Ein RL-Agent, der ein Rennspiel gewinnen soll, dreht sich stattdessen im Kreis und kassiert so Punkte für gefahrene Distanz, statt ins Ziel zu fahren. Ähnliche Fälle sind Agenten, die einen Bug im Simulator ausnutzen oder die Punktzahl durch Tricks maximieren, die in der Realität wertlos wären.
Reward Hacking bei Sprachmodellen
In der RLHF-Pipeline optimiert PPO ein Sprachmodell gegen ein Reward-Modell. Auch dieses Modell ist ein unvollkommener Proxy für menschliche Präferenzen. Modelle entwickeln dann Verhaltensweisen wie Sykoophancy – sie schmeicheln der Belohnung mit ausweichenden, übertrieben zustimmenden oder oberflächlich gut formulierten Antworten, statt fachlich korrekt zu sein. Gao et al. (2022, arXiv 2210.10760) zeigten in Scaling Laws for Reward Model Overoptimization: Je stärker gegen das Reward-Modell optimiert wird, desto schlechter wird die Performance gemessen am echten Ziel – ein direkter Beleg für Overoptimization.
Gegenmaßnahmen
- KL-Divergenz-Strafe: Die Politik darf sich nicht zu weit vom Referenzmodell entfernen (fester Bestandteil von PPO in RLHF).
- Bessere Reward-Modelle: Mehr und vielfältigere Präferenzdaten, regelmäßige Neu-Bewertung.
- Robuste Evaluation: Gegenprüfung mit echten Menschen und direkten Aufgabenmetriken statt nur des Reward-Scores.
- Weniger Optimierungsdruck: Frühes Stoppen und moderate Lernraten begrenzen Overoptimization.
Reward Hacking ist eine zentrale Herausforderung des AI-Alignment: Es zeigt, dass ein Modell die Absicht hinter einer Aufgabe verstehen muss, statt nur die wörtliche Belohnungsfunktion zu erfüllen. Verwandte Grundlagen: Supervised Fine-Tuning (SFT), DPO, Maschinelles Lernen.