Question Answering on DBLP-QuAD temporal questions
69TempAccQwen3 1.7B DoRA (1 Epoch)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3 1.7B DoRA (1 Epoch)Backbone=Qwen3 1.7B, Training Strategy=DoRA, Epochs=12026.05 | 69 | |
| Qwen3 1.7B GRPO (without gold queries)Backbone=Qwen3 1.7B, Training Strategy=GRPO, Reward Configuration=without gold queries2026.05 | 52 | |
| Qwen3 1.7B GRPO (with gold queries)Backbone=Qwen3 1.7B, Training Strategy=GRPO, Reward Configuration=with gold queries2026.05 | 47 | |
| Qwen3 1.7B Base (with CoT)Backbone=Qwen3 1.7B, Training Strategy=Base, Reasoning Strategy=with CoT2026.05 | 10 | |
| Qwen3 1.7B BaseBackbone=Qwen3 1.7B, Training Strategy=Base2026.05 | 9 |