Prefix Tuning ist eine parameter-effiziente Methode, bei der ein kontinuierlicher Präfix aus virtuellen Tokens gelernt wird, der an die Eingabe angehängt wird. Anders als beim Prompt Tuning werden die Präfix-Parameter nicht nur an der Eingabe, sondern in jeder Transformer-Schicht eingefügt.

Funktionsweise

Vorgestellt wurde Prefix Tuning von Li und Liang (Stanford) Anfang 2021 (arXiv 2101.00190). In jeder Aufmerksamkeits-Schicht werden eigene Key- und Value-Präfixe gelernt, an denen die nachfolgenden Tokens wie an virtuellen Tokens teilnehmen können. Die ursprünglichen Modellgewichte bleiben eingefroren — trainiert wird nur ein kleiner Teil der Parameter (in den Experimenten rund 0,1 Prozent).

Anwendungen

Die Autoren wandten Prefix Tuning auf GPT-2 für Table-to-Text-Generierung und auf BART für Zusammenfassungen an. Prefix Tuning zählt wie Soft Prompting zu den PEFT-Verfahren und lässt sich mit In-Context Learning vergleichen, nutzt aber gelernte Vektoren statt Beispielen im Text.

Verwandte Grundlagen: Soft Prompting, Prompt Tuning.