Long-horizon conversation utility evaluation on LongMemEval
77.8AccuracyMemOS
Evaluation Results
| Method | Links | |
|---|---|---|
| MemOSBase LLM=GPT-4o-mini, Judge LLM=GPT-4o-mini, # Avg. Token=15892026.05 | 77.8 | |
| MEMGUARDBase LLM=GPT-4.1-mini, Judge LLM=GPT-4.1, # Avg. Token=16052026.05 | 73.5 | |
| MemobaseBase LLM=GPT-4o-mini, Judge LLM=GPT-4o-mini, # Avg. Token=21022026.05 | 72.4 | |
| MEMGUARD (2 hop)Base LLM=GPT-4.1-mini, Judge LLM=GPT-4.1, # Avg. Token=15402026.05 | 72.25 | |
| Mem0Base LLM=GPT-4o-mini, Judge LLM=GPT-4o-mini, # Avg. Token=11722026.05 | 66.4 | |
| ZepBase LLM=GPT-4o-mini, Judge LLM=GPT-4o-mini, # Avg. Token=27012026.05 | 63.8 | |
| A-MemBase LLM=GPT-4.1-mini, Judge LLM=GPT-4.1, # Avg. Token=72442026.05 | 62.25 | |
| MEMGUARDBase LLM=GPT-4o-mini, Judge LLM=GPT-4o-mini, # Avg. Token=12972026.05 | 60 | |
| MEMGUARD (2 hop)Base LLM=GPT-4o-mini, Judge LLM=GPT-4o-mini, # Avg. Token=12502026.05 | 60 | |
| SupermemoryBase LLM=GPT-4o-mini, Judge LLM=GPT-4o-mini, # Avg. Token=5002026.05 | 58.4 | |
| A-MemBase LLM=GPT-4o-mini, Judge LLM=GPT-4o-mini, # Avg. Token=72442026.05 | 47 | |
| MIRIXBase LLM=GPT-4o-mini, Judge LLM=GPT-4o-mini2026.05 | 43.49 |