Das Reward Signal (Belohnungssignal) ist die Rückmeldung, die eine Umgebung einem KI-Agenten nach jeder Aktion gibt: eine einzelne Zahl r, die bewertet, wie gut der neue Zustand ist. Im Reinforcement Learning ist das Reward Signal der einzige Weg, dem Agenten mitzuteilen, was erwünscht ist — der Agent selbst muss herausfinden, wie er die Belohnung maximiert.

Belohnung und Return

Die unmittelbare Belohnung R(t) ist nicht das Lernziel. Der Agent maximiert den Return — die Summe aller zukünftigen, typischerweise diskontierten Belohnungen: G = R1 + γ·R2 + γ²·R3 + …. Der Diskontfaktor γ (zwischen 0 und 1) gewichtet nahe Belohnungen stärker als ferne. Diese Sichtweise fasst die Reward-Hypothese (Sutton & Barto) zusammen: Jedes Ziel lässt sich als Maximierung des erwarteten kumulativen Belohnungssignals ausdrücken.

Herausforderungen beim Reward Design

  • Sparse Rewards: Viele Umgebungen belohnen nur selten (etwa Sieg oder Punkt in einem Spiel). Der Agent muss lange explorieren, bis er überhaupt eine Belohnung sieht — Abhilfe schaffen Reward Shaping oder Curriculum-Lernen.
  • Reward Hacking: Findet der Agent eine Lücke im Belohnungssignal, optimiert er das Signal statt der eigentlichen Absicht — ein bekanntes Sicherheitsproblem moderner KI-Systeme.
  • Reward Modeling (RLHF): Bei Sprachmodellen ist die Belohnung oft ein gelerntes Belohnungsmodell, das aus menschlichem Feedback trainiert wird.

Verwandte Grundlagen: Reinforcement Learning, Policy, Episode, Reward Hacking, Reward Modeling.