Long-term Conversational Memory Retrieval on LoCoMo 2024
75.39Single Hop AccuracyGOM
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GOMChunk Size=2492, Evaluation Protocol=LLM-as-a-Judge2026.05 | 75.39 | 59.6 | 74.96 | 70.7 | 71.56 | |
| Mem0Chunk Size=1764, Evaluation Protocol=LLM-as-a-Judge2026.05 | 67.13 | 51.15 | 72.93 | 55.51 | 66.8 | |
| Mem0gChunk Size=3616, Evaluation Protocol=LLM-as-a-Judge2026.05 | 65.71 | 47.19 | 75.71 | 58.13 | 68.44 | |
| LangMemChunk Size=127, Evaluation Protocol=LLM-as-a-Judge2026.05 | 62.23 | 47.92 | 71.12 | 23.43 | 58.1 | |
| ZepChunk Size=3911, Evaluation Protocol=LLM-as-a-Judge2026.05 | 61.7 | 41.35 | 76.6 | 49.31 | 65.99 | |
| A-MemChunk Size=2520, Evaluation Protocol=LLM-as-a-Judge2026.05 | 39.79 | 18.85 | 54.05 | 49.91 | 48.38 |