Long-context Question Answering on LOCOMO Overall (LLM-Judge)
88.32LLM Judge ScoreMRAgent
Evaluation Results
| Method | Links | |
|---|---|---|
| MRAgentModel (Backbone)=Claude2026.06 | 88.32 | |
| MRAgentModel (Backbone)=Gemini2026.06 | 84.21 | |
| LangMemModel (Backbone)=Claude2026.06 | 78.61 | |
| Mem0Model (Backbone)=Claude2026.06 | 69.02 | |
| A-MemModel (Backbone)=Claude2026.06 | 68.45 | |
| Mem0Model (Backbone)=Gemini2026.06 | 68.31 | |
| MemoryOSModel (Backbone)=Gemini2026.06 | 63.35 | |
| LangMemModel (Backbone)=Gemini2026.06 | 62.86 | |
| RAGModel (Backbone)=Gemini2026.06 | 61.3 | |
| MemoryOSModel (Backbone)=Claude2026.06 | 61.18 | |
| RAGModel (Backbone)=Claude2026.06 | 61.1 | |
| A-MemModel (Backbone)=Gemini2026.06 | 55.97 |