Memory-Augmented Question Answering on LoCoMo Average
36.91Mean Token-F1Mem0
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mem0Model=GPT-4o mini2026.05 | 36.91 | 28.53 | 53.5 | |
| SAGEModel=GPT-4o mini2026.05 | 36.69 | 28.02 | 52.16 | |
| SAGEModel=Qwen2.5 3B2026.05 | 26.75 | 21.62 | 79.87 | |
| SAGEModel=Qwen2.5 7B2026.05 | 25.88 | 21.04 | 81.5 | |
| Mem0Model=Qwen2.5 3B2026.05 | 25.54 | 21.12 | 78.82 | |
| Mem0gModel=Qwen2.5 3B2026.05 | 25.49 | 20.78 | 80.51 | |
| Mem0Model=Qwen2.5 7B2026.05 | 24.1 | 19.1 | 79.71 | |
| Mem0gModel=Qwen2.5 7B2026.05 | 23.52 | 18.54 | 77.1 | |
| SAGEModel=DeepSeek-R1 7B2026.05 | 13.52 | 9.01 | 92.25 | |
| Mem0Model=DeepSeek-R1 7B2026.05 | 13.18 | 9.04 | 91.15 | |
| Mem0gModel=DeepSeek-R1 7B2026.05 | 12.69 | 8.55 | 92.39 | |
| SAGEModel=Qwen2.5 1.5B2026.05 | 12.62 | 11.12 | 68.44 | |
| Mem0Model=Qwen2.5 1.5B2026.05 | 12.59 | 10.56 | 70.53 | |
| Mem0gModel=Qwen2.5 1.5B2026.05 | 12.04 | 10.6 | 66.32 | |
| SAGEModel=DeepSeek-R1 1.5B2026.05 | 9.34 | 6.14 | 90.68 | |
| Mem0gModel=DeepSeek-R1 1.5B2026.05 | 7.46 | 4.96 | 88.56 | |
| Mem0Model=DeepSeek-R1 1.5B2026.05 | 7.36 | 4.61 | 90.22 | |
| SAGEModel=Llama-3.2 1B2026.05 | 5.6 | 2.69 | 85.16 | |
| SAGEModel=Llama-3.2 3B2026.05 | 5.33 | 2.09 | 77.37 | |
| Mem0gModel=Llama-3.2 3B2026.05 | 4.97 | 2.06 | 74.23 | |
| Mem0Model=Llama-3.2 3B2026.05 | 4.91 | 2.01 | 72.68 | |
| Mem0Model=Llama-3.2 1B2026.05 | 3.19 | 1.46 | 57.98 | |
| Mem0gModel=Llama-3.2 1B2026.05 | 3.14 | 1.49 | 60.2 |