Long-horizon memory Question Answering on LongBench
73.7AccuracyGPT-4o (ceiling)
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o (ceiling)Backbone=GPT-4o, Answer Ctx=120,000∗2026.05 | 73.7 | |
| GPT-4o (matched)Backbone=GPT-4o, Answer Ctx=9,800∗2026.05 | 64.7 | |
| MemFlowBackbone=Qwen3-1.7B, Answer Ctx=2,2232026.05 | 51.1 | |
| RAGBackbone=Qwen3-1.7B, Answer Ctx=2,2662026.05 | 46.7 | |
| ReActBackbone=Qwen3-1.7B, Answer Ctx=8,7322026.05 | 41.2 | |
| MemGPTBackbone=Qwen3-1.7B, Answer Ctx=∼1,260†2026.05 | 27.8 | |
| Direct QA (full)Backbone=Qwen3-1.7B, Answer Ctx=8,6142026.05 | 19.8 | |
| Direct QA (short)Backbone=Qwen3-1.7B, Answer Ctx=2,4582026.05 | 14.6 | |
| MemobaseBackbone=Qwen3-1.7B, Answer Ctx=∼260†2026.05 | 10.7 |