SARSA (State-Action-Reward-State-Action) ist ein Temporal-Difference-Learning-Verfahren zur Steuerung (Control): Ein Agent lernt die Aktionsbewertung Q(s,a) für die Politik, die er tatsächlich ausführt. Der Name beschreibt die Update-Reihenfolge – aktueller Zustand, gewählte Aktion, erhaltene Belohnung, Folgezustand, nächste Aktion – und macht zugleich den zentralen Unterschied zu Q-Learning deutlich.
Der SARSA-Update
Nach jedem Schritt wird der Q-Wert des aktuellen Paares (s,a) mit der Formel Q(s,a) ← Q(s,a) + α · (r + γ · Q(s′,a′) − Q(s,a)) aktualisiert. Dabei ist α die Lernrate und γ der Abdiskontierungsfaktor. Entscheidend ist der letzte Term: Bewertet wird das Paar (s′,a′), das die aktuelle, noch explorierende Politik als Nächstes wählen würde – nicht das Maximum über alle Aktionen.
On-Policy vs. Off-Policy
SARSA ist ein On-Policy-Verfahren: Es lernt die Werte genau der Politik, mit der es handelt, inklusive ihrer Explorationsschritte. Q-Learning ist dagegen Off-Policy: Es schätzt die Werte der optimalen, rein gierigen Politik, unabhängig davon, welche Aktionen während des Lernens gewählt werden. Im berühmten Cliff-Walking-Beispiel aus Sutton & Bartos Lehrbuch (Beispiel 6.6) zeigt sich die Konsequenz: Q-Learning findet den kürzesten Weg direkt an der Klippenkante, SARSA wählt einen etwas längeren, aber sichereren Pfad und sammelt während des Trainings weniger Abstürze ein.
Wann SARSA sinnvoll ist
- SARSA eignet sich, wenn Explorationsfehler während des Lernens teuer sind (zum Beispiel Roboter oder echte Systeme), weil die gelernte Politik die Explorationswahrscheinlichkeit bereits einpreist.
- Der Algorithmus wurde 1994 von Gavin Rummery und Mahesan Niranjan an der Universität Cambridge als „Modified Q-Learning“ vorgestellt und durch Sutton & Barto populär.
SARSA ist eng mit dem Q-Learning verwandt und eine Grundlage für moderne Deep-Q-Learning-Verfahren; moderne Verfahren kombinieren die Idee häufig mit Actor-Critic-Architekturen. Verwandte Grundlagen: Markov-Entscheidungsprozess, Bellman-Gleichung, Reinforcement Learning.