Long-context Question Answering on LoCoMo (F1, B1, J)
50.6F1 ScoreMemory-R2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Memory-R2Training regime=Trained2026.05 | 50.6 | 44.01 | 80.99 | |
| Memory-R2(OSS)Training regime=Trained, Answer Agent=GPT-OSS-120B2026.05 | 49.67 | 43.77 | 87.1 | |
| Memory-R1Training regime=Trained2026.05 | 43.14 | 36.44 | 61.51 | |
| MemAgentTraining regime=Trained2026.05 | 40.72 | 33.36 | 71.52 | |
| MemoryOSTraining regime=Training-free2026.05 | 34.64 | 29.36 | 51.26 | |
| Mem0Training regime=Training-free2026.05 | 30.61 | 23.55 | 53.3 | |
| MEM1Training regime=Trained2026.05 | 26.55 | 21.38 | 50.78 | |
| A-MEMTraining regime=Training-free2026.05 | 26.08 | 21.78 | 40.78 | |
| RAGTraining regime=Training-free2026.05 | 8.97 | 7.27 | 12.17 |