Ein Verifier ist in der KI ein separates Modell, das Lösungen eines Generators bewertet und die beste auswählt. Die Technik ist zentral für Test-Time Compute: Statt einer einzigen Antwort werden viele Kandidaten erzeugt (best-of-n), der Verifier sortiert sie nach Qualität.

Outcome- versus Process-Supervision

Die Grundsatzfrage: Prüft der Verifier nur das Endergebnis (Outcome Supervision) oder jeden Zwischenschritt (Process Supervision)? Die Studie „Let’s Verify Step by Step“ (Lightman et al., Mai 2023, arXiv 2305.20050) von OpenAI zeigt: Ein Process Reward Model (PRM), das jeden Schritt der Lösung bewertet, löst 78 % der Aufgaben einer repräsentativen Teilmenge des MATH-Benchmarks — deutlich mehr als das reine Ergebnis-Modell. Trainiert wurde es auf PRM800K, einem Datensatz mit 800.000 menschlichen Schritt-Bewertungen.

Einsatzfelder

  • Mathematik und Logik: fehlerhafte Zwischenschritte erkennen, bevor die Antwort „durchrutscht“.
  • Code-Generierung: generierte Programme auf Korrektheit prüfen.
  • Self-Consistency: Mehrfach-Sampling mit anschließender Abstimmung ergänzt den Verifier-Ansatz.

Gemessen wird die Qualität mit Benchmarks wie MMLU und GSM8K, die im Rahmen der LLM-Evaluation standardisiert sind.

Verwandte Grundlagen: Test-Time Compute und Program of Thoughts.