Long-context Reasoning on LoCoMo (test)
72.3LLM ScoreFullContext
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FullContextEvaluator LLM=GPT-4o-mini2026.01 | 72.3 | — | 5,806 | |
| NemoriEvaluator LLM=GPT-4o-mini2026.01 | 72.1 | 835 | 3,448 | |
| SwiftMemEvaluator LLM=GPT-4o-mini2026.01 | 65.2 | 11 | 1,289 | |
| Mem0Evaluator LLM=GPT-4o-mini2026.01 | 61.3 | 784 | 3,539 | |
| ZepEvaluator LLM=GPT-4o-mini2026.01 | 58.5 | 522 | 3,255 | |
| LangMemEvaluator LLM=GPT-4o-mini2026.01 | 51.3 | 19,829 | 22,082 | |
| RAG-4096Evaluator LLM=GPT-4o-mini, Context Window=40962026.01 | 30.2 | 544 | 2,884 |