Error Recognition on WHO&WHEN Human-Crafted
17.2Acc@0CORRECT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CORRECTModel=GPT-52025.09 | 17.2 | 32.3 | |
| CORRECTModel=Qwen-2.5-7b2025.09 | 12.1 | 15.5 | |
| CORRECTModel=Gemini-2.5-flash2025.09 | 10.3 | 20.7 | |
| LLM-as-a-JudgeModel=GPT-52025.09 | 8.6 | 24.1 | |
| MIPROModel=Qwen-2.5-7b2025.09 | 8.6 | 12.1 | |
| LLM-as-a-JudgeModel=Qwen-3-80b2025.09 | 6.9 | 8.6 | |
| CORRECTModel=Gemini-2.5-pro2025.09 | 6.9 | 17.2 | |
| CORRECTModel=GPT-5-nano2025.09 | 6.9 | 17.2 | |
| LLM-as-a-JudgeModel=Gemini-2.5-flash2025.09 | 5.2 | 13.8 | |
| LLM-as-a-JudgeModel=Gemini-2.5-pro2025.09 | 5.2 | 12.1 | |
| Naive ICLModel=Qwen-2.5-7b2025.09 | 5.2 | 10.3 | |
| LLM-as-a-JudgeModel=Qwen-2.5-7b2025.09 | 3.5 | 8.6 | |
| LLM-as-a-JudgeModel=DeepSeek-R12025.09 | 3.5 | 17.2 | |
| LLM-as-a-JudgeModel=GPT-4o-mini2025.09 | 3.5 | 12.5 | |
| LLM-as-a-JudgeModel=GPT-4o2025.09 | 3.5 | 10.3 | |
| Fine-tuned LLMModel=Qwen-2.5-7b2025.09 | 3.5 | 11.9 | |
| LLM-as-a-JudgeModel=Qwen-3-30b2025.09 | 1.7 | 5.2 | |
| LLM-as-a-JudgeModel=Llama-8b2025.09 | 1.7 | 3.5 | |
| LLM-as-a-JudgeModel=GPT-5-nano2025.09 | 1.7 | 12.1 |