MMLU (Massive Multitask Language Understanding) ist ein Benchmark zur Messung von Allgemeinwissen und Verständnisfähigkeiten großer Sprachmodelle. Er gilt seit seiner Einführung als einer der wichtigsten Vergleichsmaßstäbe in der KI-Forschung.
Aufbau
MMLU umfasst 57 akademische und berufliche Fächer aus den Bereichen Naturwissenschaften, Geisteswissenschaften, Sozialwissenschaften und professionellen Disziplinen. Jede Aufgabe ist eine Frage mit vier Antwortmöglichkeiten, aus denen das Modell die richtige wählen muss – insgesamt rund 15.000 Fragen.
Die Fächer reichen von Mathematik und Physik über Geschichte und Recht bis zu Medizin und Informatik. Dadurch prüft MMLU nicht einzelnes Faktenwissen, sondern breites Verständnis über viele Domänen hinweg.
Geschichte
- Vorgeschlagen 2020 von Dan Hendrycks und Kollegen (arXiv 2009.03300).
- Bewertung meist im Zero-Shot- oder Few-Shot-Modus, häufig mit CoT-Prompting für schwierige Fächer.
- 2024 erschien mit MMLU-Pro eine erweiterte Version mit mehr Antwortoptionen und anspruchsvolleren Fragen.
- Hohe Punktzahlen auf MMLU gelten als Indikator für breites Weltwissen eines Modells.
Abgrenzung
Während MMLU Faktenwissen abfragt, testet GSM8K mathematisches Denken – beide ergänzen sich als Wissens- und Reasoning-Test innerhalb einer LLM-Evaluation.
Verwandte Grundlagen: LLM-Evaluation, GSM8K, Benchmark, Few-Shot-Prompting, Chain-of-Thought, Maschinelles Lernen.