Temporal Reasoning on TempReason-L2 in-domain (test)
80.8EMGPT-4o-mini
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4o-miniStrategy=NeSTR2025.12 | 80.8 | 86.4 | |
| Qwen3-14BStrategy=NeSTR2025.12 | 79.5 | 84.6 | |
| Qwen3-8BStrategy=NeSTR2025.12 | 79.2 | 83.5 | |
| GPT-4o-miniStrategy=TISER2025.12 | 77.7 | 84.1 | |
| Qwen3-14BStrategy=TISER2025.12 | 75.5 | 80.6 | |
| Qwen3-8BStrategy=TISER2025.12 | 73.7 | 78.4 | |
| Qwen2.5-7BStrategy=NeSTR2025.12 | 61.5 | 68.6 | |
| Qwen2.5-7BStrategy=TISER2025.12 | 61.1 | 69.8 | |
| Qwen3-8BStrategy=Vanilla2025.12 | 60 | 58.5 | |
| Event-ALStrategy=Vanilla2025.12 | 55.3 | 62.8 | |
| Qwen3-14BStrategy=Vanilla2025.12 | 45.4 | 59.4 | |
| QAaPStrategy=Few-shot2025.12 | 43.7 | 50.1 | |
| TG-LLMStrategy=CoT2025.12 | 42.4 | 52.2 | |
| ReActStrategy=Few-shot2025.12 | 39.3 | 45.6 | |
| REMEMO-largeStrategy=Vanilla2025.12 | 37.4 | 54.9 | |
| GPT-4o-miniStrategy=Vanilla2025.12 | 35.7 | 58.2 | |
| BigBirdStrategy=Vanilla2025.12 | 32.7 | 50.9 | |
| T5-largeStrategy=Vanilla2025.12 | 32.7 | 50.9 | |
| Temp-T5Strategy=Vanilla2025.12 | 31.8 | 49.6 | |
| Qwen2.5-7BStrategy=Vanilla2025.12 | 0.03 | 0.03 |