Long-context dialogue evaluation on LoCoMo
69.26Normalized ScoreGLM-5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GLM-5formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 69.26 | 0.15 | |
| MiniMax-M2.5formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 66.04 | 0.15 | |
| Qwen3-Max-Thinkingformatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 62.11 | 0.15 | |
| DeepSeek-V3.2formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 59.25 | 0.15 | |
| Kimi-K2.5formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 42.91 | 0.15 |