Long-context Question Answering on RULER HotpotQA
82.38Accuracy @ 7K ContextMMPO-7B
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| MMPO-7BModel Parameters=7B, Memory Workflow=MemAgent, Training Supervision=Belief Entropy2026.05 | 82.38 | 82.81 | 81.03 | 82.98 | 82.81 | 79.56 | 78.12 | 79.69 | 78.91 | 75.22 | |
| MMPO-14BModel Parameters=14B, Memory Workflow=MemAgent, Training Supervision=Belief Entropy2026.05 | 82.16 | 83.38 | 84.32 | 83.75 | 82.47 | 80.59 | 80.91 | 80.69 | 79.77 | 76.47 | |
| RL-MemAgent-7BModel Parameters=7B, Memory Workflow=MemAgent, Training Supervision=RL2026.05 | 81.25 | 81.25 | 82.03 | 80.47 | 79.69 | 75.78 | 76.56 | 74.22 | 77.34 | 71.88 | |
| RL-MemAgent-14BModel Parameters=14B, Memory Workflow=MemAgent, Training Supervision=RL2026.05 | 80.47 | 82.03 | 82.03 | 83.59 | 81.25 | 77.34 | 79.69 | 75.78 | 78.91 | 71.09 | |
| QwenLong-L1-32BModel Parameters=32B, Backbone=QwenLong-L12026.05 | 72.66 | 75 | 72.66 | 60.94 | 31.25 | 17.19 | 13.28 | 11.72 | — | — | |
| DS-Qwen-32BModel Parameters=32B, Backbone=DS-Qwen2026.05 | 70.31 | 66.41 | 65.62 | 46.88 | 23.44 | 13.28 | 7.81 | 7.03 | — | — | |
| DS-Qwen-14BModel Parameters=14B, Backbone=DS-Qwen2026.05 | 64.06 | 64.84 | 57.03 | 40.62 | 14.84 | 8.59 | 3.12 | 6.25 | — | — | |
| Qwen2.5-7B-1MModel Parameters=7B, Backbone=Qwen2.5, Context Window=1M2026.05 | 61.72 | 56.25 | 53.91 | 55.47 | 51.56 | 33.59 | 12.5 | 0 | — | — | |
| Qwen2.5-14B-1MModel Parameters=14B, Backbone=Qwen2.5, Context Window=1M2026.05 | 60.16 | 60.94 | 50 | 57.03 | 50 | 37.5 | 8.59 | 0 | — | — | |
| DS-Qwen-7BModel Parameters=7B, Backbone=DS-Qwen2026.05 | 30.47 | 12.5 | 3.12 | 0 | 0 | 0.78 | 0 | 0 | — | — |