Long-horizon Dialogue Memory Tracking on LongMemEval 115K-token S
12.8LLM-as-Judge AccuracyInfoMem
Evaluation Results
| Method | Links | |
|---|---|---|
| InfoMembase_model=Qwen2.5-1.5B-Instruct, beta=0.22026.06 | 12.8 | |
| Outcome-only GRPObase_model=Qwen2.5-1.5B-Instruct2026.06 | 10 | |
| ReMemR1base_model=Qwen2.5-1.5B-Instruct, retrieval=callback retrieval, framework=chunk-wise memory-agent2026.06 | 6.2 | |
| Qwen2.5-1.5B-Instructstatus=Base Model2026.06 | 5.6 |