Temporal Reasoning on TimeQA Hard 1.0 (test)
82.2EMQwen3-14B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-14BStrategy=NeSTR2025.12 | 82.2 | 87.3 | |
| Qwen3-14BStrategy=TISER2025.12 | 82.1 | 87.2 | |
| GPT-4o-miniStrategy=NeSTR2025.12 | 81.7 | 85.9 | |
| Qwen3-8BStrategy=NeSTR2025.12 | 77.7 | 83.4 | |
| Qwen3-8BStrategy=TISER2025.12 | 77.1 | 82.5 | |
| GPT-4o-miniStrategy=TISER2025.12 | 74.3 | 79.9 | |
| Qwen2.5-7BStrategy=NeSTR2025.12 | 64.8 | 71.2 | |
| Qwen2.5-7BStrategy=TISER2025.12 | 64.3 | 71.5 | |
| TG-LLMStrategy=CoT2025.12 | 63.1 | 66.4 | |
| Event-ALStrategy=Vanilla2025.12 | 61.7 | 70.4 | |
| Qwen3-14BStrategy=Vanilla2025.12 | 61.5 | 72.1 | |
| REMEMO-largeStrategy=Vanilla2025.12 | 60.5 | 69.3 | |
| BigBirdStrategy=Vanilla2025.12 | 59.5 | 68.1 | |
| T5-largeStrategy=Vanilla2025.12 | 59.5 | 68.1 | |
| Qwen3-8BStrategy=Vanilla2025.12 | 57.2 | 65.3 | |
| FiDEvaluation Protocol=Fine-tune2023.05 | 46.8 | 54.6 | |
| FiDStrategy=Vanilla2025.12 | 46.8 | 54.6 | |
| GPT-4o-miniStrategy=Vanilla2025.12 | 44.7 | 58.5 | |
| QAaPStrategy=Few-shot2025.12 | 41.7 | 55.3 | |
| QAaPBackbone=gpt-3.5-turbo, Evaluation Protocol=Few-shot2023.05 | 39.6 | 49.3 | |
| ReActStrategy=Few-shot2025.12 | 28.3 | 34.4 | |
| ReActBackbone=gpt-3.5-turbo, Evaluation Protocol=Few-shot2023.05 | 25.1 | 29.4 | |
| CoTBackbone=gpt-3.5-turbo, Evaluation Protocol=Few-shot2023.05 | 21.7 | 30.4 | |
| Qwen2.5-7BStrategy=Vanilla2025.12 | 15.1 | 15.1 |