Ein Verifier ist in der KI ein separates Modell, das Lösungen eines Generators bewertet und die beste auswählt. Die Technik ist zentral für Test-Time Compute: Statt einer einzigen Antwort werden viele Kandidaten erzeugt (best-of-n), der Verifier sortiert sie nach Qualität.
Outcome- versus Process-Supervision
Die Grundsatzfrage: Prüft der Verifier nur das Endergebnis (Outcome Supervision) oder jeden Zwischenschritt (Process Supervision)? Die Studie „Let’s Verify Step by Step“ (Lightman et al., Mai 2023, arXiv 2305.20050) von OpenAI zeigt: Ein Process Reward Model (PRM), das jeden Schritt der Lösung bewertet, löst 78 % der Aufgaben einer repräsentativen Teilmenge des MATH-Benchmarks — deutlich mehr als das reine Ergebnis-Modell. Trainiert wurde es auf PRM800K, einem Datensatz mit 800.000 menschlichen Schritt-Bewertungen.
Einsatzfelder
- Mathematik und Logik: fehlerhafte Zwischenschritte erkennen, bevor die Antwort „durchrutscht“.
- Code-Generierung: generierte Programme auf Korrektheit prüfen.
- Self-Consistency: Mehrfach-Sampling mit anschließender Abstimmung ergänzt den Verifier-Ansatz.
Gemessen wird die Qualität mit Benchmarks wie MMLU und GSM8K, die im Rahmen der LLM-Evaluation standardisiert sind.
Verwandte Grundlagen: Test-Time Compute und Program of Thoughts.