Policy (auch Strategie genannt) ist im Reinforcement Learning die Entscheidungsregel eines Agenten: Sie legt fest, welche Aktion der Agent in einem bestimmten Zustand wählt. Formal ist die Policy eine Abbildung von Zuständen auf Aktionen — notiert als π(a|s), also die Wahrscheinlichkeit, im Zustand s die Aktion a auszuführen.

Deterministische und stochastische Policies

  • Deterministische Policy: π(s) = a — der Agent führt im Zustand s immer dieselbe Aktion aus. Einfach und berechenbar, aber ohne Zufall.
  • Stochastische Policy: π(a|s) ist eine Wahrscheinlichkeitsverteilung über die Aktionen. Sie erlaubt Exploration (Ausprobieren) und ist für Gegnerspiele schwerer auszunutzen.

On-Policy und Off-Policy

Lernverfahren unterscheiden, welche Policy sie verbessern: On-Policy-Verfahren wie SARSA lernen die Policy, die sie gerade selbst ausführen. Off-Policy-Verfahren wie Q-Learning lernen eine optimale Ziel-Policy, während eine separate Verhaltens-Policy die Aktionen erzeugt. Diese Unterscheidung ist zentral für fast alle RL-Algorithmen.

Das Lernziel des Agenten

Ziel des Reinforcement Learning ist die optimale Policy π*, die den erwarteten kumulativen Return — also die Summe aller zukünftigen Belohnungen — maximiert. Policy-Gradient-Verfahren parametrisieren die Policy direkt als neuronales Netz und optimieren dessen Gewichte per Gradientenaufstieg. Methoden wie PPO und Actor-Critic bauen genau darauf auf.

Verwandte Grundlagen: Reinforcement Learning, Policy-Gradient-Methoden, Episode, Reward Signal, Q-Learning, SARSA.