Temporal Reasoning on LoCoMo (test)
0.742LLM ScoreFullContext
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FullContextLLM=GPT-4.1-mini2026.01 | 0.742 | 47.5 | 40 | |
| NemoriLLM=GPT-4.1-mini2026.01 | 0.735 | 58.5 | 50.1 | |
| SwiftMemLLM=GPT-4.1-mini2026.01 | 0.685 | 50.7 | 56.9 | |
| ZepLLM=GPT-4.1-mini2026.01 | 0.602 | 23.9 | 20 | |
| Mem0LLM=GPT-4.1-mini2026.01 | 0.569 | 39.2 | 33.2 | |
| LangMemLLM=GPT-4.1-mini2026.01 | 0.508 | 48.5 | 40.9 | |
| RAGLLM=GPT-4.1-mini2026.01 | 0.274 | 22.3 | 19.1 |