Temporal Question Answering on TimeQA Hard
77.7EMDeepSeek-V3-AdapTime
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DeepSeek-V3-AdapTimeBackbone=DeepSeek-V3-0324, Strategy=AdapTime2026.04 | 77.7 | — | — | 79.2 | |
| DeepSeek-V3-Step-backBackbone=DeepSeek-V3-0324, Strategy=Step-back2026.04 | 76.4 | — | — | 77.9 | |
| DeepSeek-V3-Self-refinementBackbone=DeepSeek-V3-0324, Strategy=Self-refinement2026.04 | 76.4 | — | — | 78.4 | |
| DeepSeek-V3-CoTBackbone=DeepSeek-V3-0324, Strategy=Chain-of-Thought (CoT)2026.04 | 75.6 | — | — | 77 | |
| DeepSeek-V3-ICLBackbone=DeepSeek-V3-0324, Strategy=In-context Learning (ICL)2026.04 | 68.8 | — | — | 71.6 | |
| Qwen-3-8B-AdapTimeBackbone=Qwen-3-8B, Strategy=AdapTime2026.04 | 66.5 | — | — | 68.2 | |
| TG-LLMStrategy=Temporal Reasoning2026.04 | 63.1 | — | — | 66.4 | |
| Qwen-3-8B-CoTBackbone=Qwen-3-8B, Strategy=Chain-of-Thought (CoT)2026.04 | 62.9 | — | — | 64.7 | |
| REMEMO-largeBackbone=REMEMO-large, Strategy=Supervised Fine-tuning2026.04 | 60.5 | — | — | 69.3 | |
| T5-largeBackbone=T5-large, Strategy=Supervised Fine-tuning2026.04 | 59.5 | — | — | 68.1 | |
| REMEMO-baseBackbone=REMEMO-base, Strategy=Supervised Fine-tuning2026.04 | 58.2 | — | — | 67.3 | |
| Qwen-3-8B-ICLBackbone=Qwen-3-8B, Strategy=In-context Learning (ICL)2026.04 | 56.9 | — | — | 60.1 | |
| T5-baseBackbone=T5-base, Strategy=Supervised Fine-tuning2026.04 | 55.6 | — | — | 64.1 | |
| GPT-4Backbone=GPT-4, Strategy=Vanilla2026.04 | 54.6 | — | — | 57.1 | |
| T5-L-FiD-PITBackbone=T5-Large, Framework=Fusion-in-Decoder (FiD), Strategy=PIT2023.11 | 52.7 | 47.3 | 49.8 | 61 | |
| T5-L-FiDBackbone=T5-Large, Framework=Fusion-in-Decoder (FiD), Implementation=re-implemented2023.11 | 50.5 | 45.1 | 47.6 | 59.8 | |
| T5-B-FiD-PITBackbone=T5-Base, Framework=Fusion-in-Decoder (FiD), Strategy=PIT2023.11 | 46 | 41.1 | 43.3 | 54.7 | |
| T5-B-FiDBackbone=T5-Base, Framework=Fusion-in-Decoder (FiD), Implementation=re-implemented2023.11 | 44.3 | 39.4 | 41.7 | 53.2 | |
| QAaPStrategy=Embedding-based Reasoning2026.04 | 39.6 | — | — | 49.3 | |
| T5-B-PITBackbone=T5-Base, Strategy=PIT2023.11 | 39 | 34.2 | 36.4 | 48.4 | |
| T5-BBackbone=T5-Base2023.11 | 37.3 | 32.9 | 34.9 | 46.8 | |
| LLaMA-3-8B-AdapTimeBackbone=LLaMA-3.1-8B-Instruct, Strategy=AdapTime2026.04 | 33.3 | — | — | 38.6 | |
| LLaMA-3-8B-CoTBackbone=LLaMA-3.1-8B-Instruct, Strategy=Chain-of-Thought (CoT)2026.04 | 31.6 | — | — | 33.8 | |
| T5-B-FiDBackbone=T5-Base, Framework=Fusion-in-Decoder (FiD), Source=Chen et al. (2021)2023.11 | 10.3 | — | — | 19.7 | |
| LLaMA-3-8B-ICLBackbone=LLaMA-3.1-8B-Instruct, Strategy=In-context Learning (ICL)2026.04 | 1.7 | — | — | 3.6 | |
| DYNA2026.06 | — | 63.24 | — | — | |
| DynaGen2026.06 | — | 60.56 | — | — | |
| RAG2026.06 | — | 54.12 | — | — |