Error Recognition on MMLU-Pro
69.1Acc@1CORRECT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CORRECTSynthesized by=GPT-4o-mini2025.09 | 69.1 | 88.2 | 94.1 | |
| CORRECTSynthesized by=GPT-5-Nano2025.09 | 69.1 | 88.2 | 94.1 | |
| LLM-as-a-JudgeSynthesized by=GPT-4o-mini2025.09 | 58.3 | 62.5 | 66.7 | |
| BaselineSynthesized by=GPT-5-Nano2025.09 | 50 | 64.7 | 70.59 |