Memory-Augmented Question Answering on LoCoMo Multi-hop
49.61Token F1SAGE
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SAGEModel=GPT-4o mini2026.05 | 49.61 | 40.91 | 56.07 | — | |
| Mem0Model=GPT-4o mini2026.05 | 48.75 | 41.05 | 52.34 | — | |
| Mem0gModel=Qwen2.5 3B2026.05 | 32.28 | 28.95 | 78.82 | — | |
| Mem0Model=Qwen2.5 3B2026.05 | 31.63 | 27.88 | 77.57 | — | |
| SAGEModel=Qwen2.5 3B2026.05 | 31 | 27.66 | 78.19 | — | |
| Mem0Count=2822026.06 | 29.51 | — | 79.43 | 3.9 | |
| SAGEModel=Qwen2.5 7B2026.05 | 28.36 | 24.22 | 73.52 | — | |
| DMFCount=2822026.06 | 27.29 | — | 79.43 | 3.55 | |
| Mem0Model=Qwen2.5 7B2026.05 | 25.52 | 21.44 | 65.11 | — | |
| SAGEModel=Qwen2.5 1.5B2026.05 | 25.3 | 22.89 | 57.94 | — | |
| Mem0gModel=Qwen2.5 1.5B2026.05 | 25.21 | 21.88 | 62.93 | — | |
| Mem0Model=Qwen2.5 1.5B2026.05 | 24.55 | 21.08 | 65.73 | — | |
| Mem0gModel=Qwen2.5 7B2026.05 | 23.59 | 20.35 | 62.31 | — | |
| SAGEModel=DeepSeek-R1 7B2026.05 | 14.72 | 8.8 | 88.16 | — | |
| Mem0gModel=DeepSeek-R1 7B2026.05 | 13.73 | 8.62 | 85.36 | — | |
| Mem0Model=DeepSeek-R1 7B2026.05 | 13.54 | 8.27 | 81.62 | — | |
| SAGEModel=DeepSeek-R1 1.5B2026.05 | 8.07 | 4.91 | 87.54 | — | |
| Mem0Model=DeepSeek-R1 1.5B2026.05 | 7.36 | 4.42 | 85.36 | — | |
| Mem0gModel=DeepSeek-R1 1.5B2026.05 | 6.72 | 4.21 | 83.49 | — | |
| SAGEModel=Llama-3.2 3B2026.05 | 4.98 | 1.68 | 76.01 | — | |
| Mem0Model=Llama-3.2 3B2026.05 | 4.74 | 1.7 | 72.59 | — | |
| SAGEModel=Llama-3.2 1B2026.05 | 4.67 | 2.02 | 79.44 | — | |
| Mem0gModel=Llama-3.2 3B2026.05 | 4.63 | 1.66 | 68.54 | — | |
| Mem0Model=Llama-3.2 1B2026.05 | 2.43 | 0.87 | 57.94 | — | |
| Mem0gModel=Llama-3.2 1B2026.05 | 2.21 | 0.91 | 55.45 | — |