Long-horizon Question Answering on LoCoMo Multi-Hop 1.0
426EMMemWeaver
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MemWeaverBackbone=GPT-4o-mini2026.01 | 426 | 14.2 | |
| MemWeaverBackbone=Qwen2.5-1.5B2026.01 | 284 | 11.34 | |
| A-MemBackbone=GPT-4o-mini2026.01 | 177 | 13.74 | |
| MemWeaverBackbone=Llama3.2-3B2026.01 | 106 | 6.6 | |
| LoCoMoBackbone=Llama3.2-3B2026.01 | 71 | 4.71 | |
| A-MemBackbone=Llama3.2-3B2026.01 | 71 | 5.61 | |
| LoCoMoBackbone=Llama3.2-1B2026.01 | 71 | 5.92 | |
| A-MemBackbone=Qwen2.5-1.5B2026.01 | 71 | 8.14 | |
| LoCoMoBackbone=GPT-4o-mini2026.01 | 35 | 15.56 | |
| ReadAgentBackbone=GPT-4o-mini2026.01 | 35 | 5.46 | |
| LoCoMoBackbone=Qwen2.5-1.5B2026.01 | 35 | 6.01 | |
| MemoryBankBackbone=GPT-4o-mini2026.01 | 0 | 7.57 | |
| MemoryBankBackbone=Llama3.2-3B2026.01 | 0 | 6.51 | |
| ReadAgentBackbone=Llama3.2-3B2026.01 | 0 | 1.21 | |
| MemoryBankBackbone=Llama3.2-1B2026.01 | 0 | 6.06 | |
| ReadAgentBackbone=Llama3.2-1B2026.01 | 0 | 2.97 | |
| A-MemBackbone=Llama3.2-1B2026.01 | 0 | 5.97 | |
| MemWeaverBackbone=Llama3.2-1B2026.01 | 0 | 6.11 | |
| MemoryBankBackbone=Qwen2.5-1.5B2026.01 | 0 | 7.58 | |
| ReadAgentBackbone=Qwen2.5-1.5B2026.01 | 0 | 3.67 |