Long-context Memory Evaluation on LongMemEval v0.6.0 (strict)
92AccuracyTM Pro
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TM ProVariant=oracle, Answer model=gpt-4.1-mini2026.05 | 92 | 89.43 | 460 | |
| TM ProVariant=3-run mean, strict, Answer model=gpt-4.1-mini2026.05 | 87.8 | 84.64 | 439 | |
| RAGBackbone=ChromaDB, Answer model=gpt-4.1-mini2026.05 | 87 | 83.77 | 435 | |
| EverMemOSAnswer model=gpt-4o2026.05 | 83 | 79.4 | — | |
| EngramAnswer model=gpt-4.1-mini2026.05 | 82.2 | 78.61 | 411 | |
| BM25Answer model=gpt-4.1-mini2026.05 | 81.6 | 77.97 | 408 | |
| Mem0Answer model=gpt-4.1-mini2026.05 | 66 | 61.74 | 330 |