GSM8K (Grade School Math 8K) ist ein Benchmark mit etwa 8.500 qualitativ hochwertigen, sprachlich vielfältigen Mathe-Textaufgaben auf Grundschulniveau. Er testet, ob große Sprachmodelle mehrschrittige Rechen- und Denkaufgaben zuverlässig lösen können.

Warum dieser Benchmark wichtig ist

Jede Aufgabe besteht aus einer Textgeschichte und einer Frage, die in zwei bis acht elementaren Rechenschritten gelöst wird. Die Aufgaben sind konzeptionell einfach, erfordern aber eine korrekte Kette von Operationen – genau daran scheitern selbst große Modelle ohne gezielte Techniken. GSM8K wurde 2021 von OpenAI-Forschern um Karl Cobbe eingeführt (arXiv 2110.14168, „Training Verifiers to Solve Math Word Problems“).

Zentrale Erkenntnisse

  • Mehrschrittiges Rechnen ist für Transformer-Modelle eine harte Herausforderung, trotz einfacher Aufgabenverteilung.
  • Das Training von Verifiern – Modellen, die Lösungswege bewerten – verbesserte die Ergebnisse stärker als weiteres Feintuning der Generatoren.
  • Chain-of-Thought-Prompting steigert die Genauigkeit auf GSM8K deutlich, weil die Zwischenschritte sichtbar gemacht werden.
  • Sampling mehrerer Lösungen mit anschließender Auswahl ist ein bewährtes Verfahren zur Fehlerreduktion.

Einordnung

GSM8K ist der Standard-Test für mathematisches Reasoning und ergänzt Wissens-Benchmarks wie MMLU im Rahmen einer LLM-Evaluation.

Verwandte Grundlagen: LLM-Evaluation, MMLU, Chain-of-Thought, Few-Shot-Prompting, Large Language Model, Maschinelles Lernen.