Memory-Augmented Question Answering on LoCoMo Single-hop
34.1Mean Token F1Mem0
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mem0Model=GPT-4o mini2026.05 | 34.1 | 20.86 | 56.03 | |
| SAGEModel=GPT-4o mini2026.05 | 32.46 | 19.81 | 53.9 | |
| SAGEModel=Qwen2.5 3B2026.05 | 28.27 | 18.63 | 82.98 | |
| Mem0gModel=Qwen2.5 7B2026.05 | 26.75 | 17.36 | 84.4 | |
| Mem0Model=Qwen2.5 3B2026.05 | 26.7 | 18.48 | 82.27 | |
| SAGEModel=Qwen2.5 7B2026.05 | 26.58 | 17.89 | 83.69 | |
| Mem0Model=Qwen2.5 7B2026.05 | 25.97 | 17.19 | 85.82 | |
| Mem0gModel=Qwen2.5 3B2026.05 | 25.94 | 17.82 | 82.98 | |
| Mem0Model=DeepSeek-R1 7B2026.05 | 15.41 | 11.57 | 96.1 | |
| SAGEModel=DeepSeek-R1 7B2026.05 | 14.98 | 11.26 | 98.58 | |
| Mem0gModel=DeepSeek-R1 7B2026.05 | 13.07 | 9.87 | 93.26 | |
| SAGEModel=DeepSeek-R1 1.5B2026.05 | 8.81 | 6.51 | 93.62 | |
| Mem0gModel=DeepSeek-R1 1.5B2026.05 | 6.64 | 5.22 | 89.72 | |
| Mem0Model=DeepSeek-R1 1.5B2026.05 | 6.31 | 4.99 | 89.72 | |
| Mem0Model=Qwen2.5 1.5B2026.05 | 6.19 | 4.68 | 68.44 | |
| SAGEModel=Qwen2.5 1.5B2026.05 | 5.88 | 4.6 | 69.5 | |
| SAGEModel=Llama-3.2 1B2026.05 | 5.64 | 3.68 | 84.75 | |
| Mem0gModel=Qwen2.5 1.5B2026.05 | 5.63 | 4.9 | 63.83 | |
| SAGEModel=Llama-3.2 3B2026.05 | 5.03 | 2.42 | 82.62 | |
| Mem0gModel=Llama-3.2 3B2026.05 | 4.74 | 2.44 | 74.47 | |
| Mem0Model=Llama-3.2 3B2026.05 | 4.53 | 2.4 | 73.05 | |
| Mem0gModel=Llama-3.2 1B2026.05 | 2.97 | 2.05 | 58.87 | |
| Mem0Model=Llama-3.2 1B2026.05 | 2.7 | 1.85 | 59.57 |