ROUGE (Recall-Oriented Understudy for Gisting Evaluation) ist die Standardmetrik für automatische Textzusammenfassungen. Sie misst, wie viel vom Inhalt einer menschlichen Referenzzusammenfassung in der maschinell erzeugten Zusammenfassung vorkommt.
Die wichtigsten ROUGE-Varianten
- ROUGE-N: Überlappung von n-Wort-Folgen — ROUGE-1 (Einzelwörter) und ROUGE-2 (Wortpaare) sind am gebräuchlichsten.
- ROUGE-L: Nutzt die längste gemeinsame Teilfolge (LCS) und berücksichtigt so die Wortreihenfolge.
- ROUGE-S: Überspringt Wörter (Skip-Bigramme) und erlaubt flexible Reihenfolge.
ROUGE wurde 2004 von Chin-Yew Lin eingeführt. Im Gegensatz zu BLEU, das die Präzision betont, liegt der Fokus auf dem Recall: Wurden alle wichtigen Inhalte der Referenz aufgegriffen? In der Praxis werden Recall, Precision und F1-Score berichtet.
Grenzen
- ROUGE belohnt wörtliche Überlappung — gute, aber anders formulierte Zusammenfassungen schneiden schlecht ab.
- Zwei Zusammenfassungen mit identischem ROUGE-Wert können sehr unterschiedlich lesbar sein.
- Moderne Ansätze ergänzen ROUGE deshalb um semantische Metriken oder LLM-basierte Bewertungen.
Verwandte Grundlagen: Perplexity, BLEU-Score, Text Mining, LLM-Evaluation.