Dialogue Memory on LongMemEval
75.2ScoreGoLongRL (w. GRPO)
Evaluation Results
| Method | Links | |
|---|---|---|
| GoLongRL (w. GRPO)Model=Qwen3-30B-A3B-Thinking-2507, Optimization Method=GRPO2026.05 | 75.2 | |
| QwenLong L1.5-30BModel=QwenLong L1.5-30B2026.05 | 72.2 | |
| Qwen3-30B-A3B-Thinking-2507 BaseModel=Qwen3-30B-A3B-Thinking-2507, Optimization Method=Base2026.05 | 61.6 | |
| GoLongRL (w. TMN-Reweight)Model=Qwen3-4B-Thinking-2507, Optimization Method=TMN-Reweight2026.05 | 61.2 | |
| Qwen3-4B-Thinking-2507 BaseModel=Qwen3-4B-Thinking-2507, Optimization Method=Base2026.05 | 47.6 |