Error Recognition on HotpotQA
60.9Top-1 AccuracyCORRECT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CORRECTSynthesized by=GPT-4o-mini2025.09 | 60.9 | 94.2 | 95.7 | |
| CORRECTSynthesized by=GPT-5-Nano2025.09 | 35.8 | 72.7 | 84.3 | |
| LLM-as-a-JudgeSynthesized by=GPT-4o-mini2025.09 | 34.8 | 59.4 | 63.8 | |
| BaselineSynthesized by=GPT-5-Nano2025.09 | 14.7 | 48.9 | 65.8 |