Eine Episode ist im Reinforcement Learning ein vollständiger Durchlauf des Agenten durch die Umgebung: eine Sequenz aus Zuständen, Aktionen und Belohnungen vom Start bis zu einem Endzustand — etwa S0, A0, R1, S1, A1, R2, …, ST. Man spricht auch von einer Trajektorie oder einem Erfahrungspfad.

Episodische und fortlaufende Aufgaben

  • Episodische Aufgaben haben einen natürlichen Endpunkt: eine Partie Schach, ein Level in einem Computerspiel oder ein Labor-Versuch. Nach dem Ende startet die nächste Episode neu.
  • Fortlaufende Aufgaben (continuing tasks) enden nicht — etwa die Regelung einer Heizung oder das Trading über Jahre. Hier wird ohne Episodengrenze gelernt.

Warum Episoden wichtig sind

Viele Lernverfahren nutzen die Episodenstruktur. Monte-Carlo-Methoden warten das Ende einer Episode ab und schätzen Werte aus dem tatsächlich erzielten Return. Temporal-Difference-Verfahren wie TD(0) lernen dagegen nach jedem einzelnen Schritt — sie brauchen kein Episodenende. In modernen Trainings-Setups (etwa bei Deep-Q-Learning) sammeln Agenten viele Episoden in einem Replay-Speicher und lernen daraus stichprobenartig weiter.

Verwandte Grundlagen: Reinforcement Learning, Policy, Reward Signal, Temporal-Difference-Learning, Deep-Q-Learning.