Supervised Fine-Tuning (SFT) ist das überwachte Nachtraining eines vortrainierten KI-Modells auf hochwertigen Beispielpaaren aus Eingabe und gewünschter Antwort. Es ist die erste Stufe der RLHF-Pipeline und die Grundlage fast aller modernen Post-Training-Verfahren für Sprachmodelle.
Wie SFT funktioniert
Ein vortrainiertes Basismodell sagt zunächst nur das nächste Token voraus. Beim SFT werden ihm Tausende bis Millionen von Demonstrationspaaren gezeigt: eine Anfrage (Prompt) und die dazu ideale, von Menschen oder Lehrsystemen verfasste Antwort. Das Modell wird mit Cross-Entropy-Loss darauf trainiert, genau diese Antworten zu reproduzieren. Auf diese Weise lernt es Dialogformate, einen gewünschten Schreibstil, den Umgang mit spezifischen Aufgaben und die Fähigkeit, überhaupt hilfreich auf Anweisungen zu reagieren.
Abgrenzung zu verwandten Verfahren
- Instruction Tuning ist ein spezieller, besonders breiter Anwendungsfall von SFT: Training auf Anweisung-Antwort-Paaren vieler verschiedener Aufgaben, wie bei FLAN (Wei et al. 2021) mit 62 Aufgaben. SFT ist der allgemeinere Oberbegriff für überwachtes Nachtraining auf gelabelten Beispielen.
- Im Gegensatz zu RLHF lernt SFT direkt aus Demonstrationen (Nachahmung), nicht aus Belohnungssignalen oder Präferenzvergleichen. Die Qualität der Ergebnisse hängt daher stark von der Qualität der Trainingsbeispiele ab.
- DPO startet typischerweise von einem SFT-Modell als Referenzpolitik und benötigt selbst keine separate RL-Phase.
- Reward Hacking entsteht bei SFT nicht, weil reine Nachahmung keine Belohnungsfunktion optimiert – die Ausbeutung unvollkommener Belohnungsmodelle beginnt erst in der anschließenden RL-Optimierung (siehe Reward Hacking).
Praxis
InstructGPT (2022) nutzte 13.000 manuell geschriebene Prompt-Antwort-Paare für die SFT-Stufe. In der RLHF-Pipeline folgen auf SFT das Reward Modeling und die Optimierung mit PPO. Mit PEFT-Methoden wie LoRA lässt sich SFT auch auf wenigen GPUs durchführen, da nur ein kleiner Teil der Parameter aktualisiert wird. Verwandte Grundlagen: Supervised Learning, Fine-Tuning, Instruction Tuning.