Error Recognition on WikiMQA
44.1Acc@1CORRECT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CORRECTSynthesized by=GPT-4o-mini2025.09 | 44.1 | 88.2 | 94.1 | |
| CORRECTSynthesized by=GPT-5-Nano2025.09 | 16.9 | 49.9 | 69 | |
| LLM-as-a-JudgeSynthesized by=GPT-4o-mini2025.09 | 14.7 | 55.9 | 64.7 | |
| BaselineSynthesized by=GPT-5-Nano2025.09 | 6.44 | 35.6 | 56.1 |