Long-context Temporal Reasoning on EventQA
0.856Accuracy (64K)Qwen3-4B RL finetuned on HanabiRewards
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-4B RL finetuned on HanabiRewardsBackbone=Qwen3-4B, Training=RL finetuned on HanabiRewards, Setup=BM25 RAG2026.01 | 0.856 | 0.668 | 0.436 | |
| Qwen3-4B-Instruct-2507Backbone=Qwen3-4B, Setup=BM25 RAG2026.01 | 0.84 | 0.626 | 0.372 |