Long-context Memory Evaluation on LongMemEval-s
75Overall ScoreHyMem
Evaluation Results
| Method | Links | |
|---|---|---|
| HyMemBase Model=gpt-4.1-mini, Avg Tokens=1.5k2026.02 | 75 | |
| NemoriBase Model=gpt-4.1-mini, Avg Tokens=4.4k2026.02 | 74.6 | |
| Naive RAG(k=5)Base Model=gpt-4.1-mini, Avg Tokens=4.1k2026.02 | 72.8 | |
| ZepBase Model=gpt-4.1-mini, Avg Tokens=1.4k2026.02 | 71.12 | |
| LightMemBase Model=gpt-4o-mini, Avg Tokens=0.8k2026.02 | 68.64 | |
| Mem0Base Model=gpt-4.1-mini, Avg Tokens=1.0k2026.02 | 66.4 | |
| NemoriBase Model=gpt-4o-mini, Avg Tokens=4.7k2026.02 | 64.2 | |
| A-MemBase Model=gpt-4o-mini, Avg Tokens=2.7k2026.02 | 62.6 | |
| Full-ContextBase Model=gpt-4o-mini, Avg Tokens=21.4k2026.02 | 56.8 | |
| Mem0Base Model=gpt-4o-mini, Avg Tokens=1.7k2026.02 | 53.61 | |
| MemUBase Model=gpt-4.1-mini, Avg Tokens=4.0k2026.02 | 38.4 | |
| LangMemBase Model=gpt-4o-mini, Avg Tokens=-2026.02 | 37.2 |