Temporal Reasoning on TempReason-L3 in-domain (test)
0.851EMQwen3-14B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-14BStrategy=NeSTR2025.12 | 0.851 | 0.889 | |
| Qwen3-8BStrategy=NeSTR2025.12 | 0.849 | 0.872 | |
| GPT-4o-miniStrategy=NeSTR2025.12 | 0.846 | 0.9 | |
| Qwen3-8BStrategy=TISER2025.12 | 0.843 | 0.875 | |
| GPT-4o-miniStrategy=TISER2025.12 | 0.823 | 0.871 | |
| Qwen3-14BStrategy=TISER2025.12 | 0.816 | 0.852 | |
| Qwen2.5-7BStrategy=NeSTR2025.12 | 0.731 | 0.767 | |
| Qwen2.5-7BStrategy=TISER2025.12 | 0.726 | 0.776 | |
| Qwen3-14BStrategy=Vanilla2025.12 | 0.585 | 0.679 | |
| Event-ALStrategy=Vanilla2025.12 | 0.58 | 0.595 | |
| Qwen3-8BStrategy=Vanilla2025.12 | 0.522 | 0.61 | |
| QAaPStrategy=Few-shot2025.12 | 0.453 | 0.483 | |
| GPT-4o-miniStrategy=Vanilla2025.12 | 0.448 | 0.61 | |
| ReActStrategy=Few-shot2025.12 | 0.427 | 0.508 | |
| TG-LLMStrategy=CoT2025.12 | 0.356 | 0.469 | |
| REMEMO-largeStrategy=Vanilla2025.12 | 0.334 | 0.493 | |
| BigBirdStrategy=Vanilla2025.12 | 0.288 | 0.468 | |
| T5-largeStrategy=Vanilla2025.12 | 0.288 | 0.468 | |
| Temp-T5Strategy=Vanilla2025.12 | 0.261 | 0.43 | |
| Qwen2.5-7BStrategy=Vanilla2025.12 | 0.0007 | 0.0006 |