Temporal Question Answering on ReasonQA Single-hop
95.1Set AccuracyT5-large PIT-SFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| T5-large PIT-SFTBackbone=T5-large, Training strategy=PIT-SFT2023.11 | 95.1 | 95.6 | |
| T5-base PIT-SFTBackbone=T5-base, Training strategy=PIT-SFT2023.11 | 91.6 | 93.8 | |
| T5-large SFTBackbone=T5-large, Training strategy=Supervised fine-tuning2023.11 | 86 | 88.1 | |
| T5-base SFTBackbone=T5-base, Training strategy=Supervised fine-tuning2023.11 | 80.4 | 83.3 | |
| GPT-4Model version=gpt4-0613, Few-shot=one-shot2023.11 | 67.1 | 80.2 | |
| FLAN-T5-XLParameters=3B, Few-shot=one-shot2023.11 | 61.5 | 64.1 | |
| GPT-3.5Model version=gpt3.5-turbo, Few-shot=one-shot2023.11 | 28 | 45.3 |