Multi-turn Dialogue Evaluation on MT-Bench-101
93.62Normalized ScoreQwen3-Max-Thinking
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-Max-Thinkingformatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 93.62 | 3 | |
| DeepSeek-V3.2formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 91.17 | 3 | |
| Kimi-K2.5formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 90.77 | 3 | |
| MiniMax-M2.5formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 89.98 | 3 | |
| GLM-5formatting=multi-turn, score_aggregation=stricter, setup=normalized2026.03 | 85.47 | 3 |