Multi-turn Conversational Quality on MT-Bench (test)
8.06MT-Bench Score (1-turn)TCR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TCROptimizer=GRPO, Foundation Model=Qwen3-14B2025.10 | 8.06 | 7.54 | |
| PWOptimizer=GRPO, Foundation Model=Qwen3-14B2025.10 | 7.93 | 7.39 | |
| ELOOptimizer=GRPO, Foundation Model=Qwen3-14B2025.10 | 7.87 | 6.79 | |
| PREFOptimizer=GRPO, Foundation Model=Qwen3-14B2025.10 | 7.58 | 7.1 | |
| TCROptimizer=GSPO, Foundation Model=Qwen3-8B2025.10 | 7.46 | 6.79 | |
| LWOptimizer=GSPO, Foundation Model=Qwen3-8B2025.10 | 7.38 | 6.61 | |
| LWOptimizer=GRPO, Foundation Model=Qwen3-14B2025.10 | 7.33 | 7.44 | |
| PWOptimizer=GSPO, Foundation Model=Qwen3-8B2025.10 | 7.32 | 6.43 | |
| Base ModelOptimizer=GRPO, Foundation Model=Qwen3-14B2025.10 | 7.31 | 6.74 | |
| ELOOptimizer=GSPO, Foundation Model=Qwen3-8B2025.10 | 7.31 | 6.63 | |
| PREFOptimizer=GSPO, Foundation Model=Qwen3-8B2025.10 | 6.89 | 6.66 | |
| Base ModelOptimizer=GSPO, Foundation Model=Qwen3-8B2025.10 | 6.58 | 5.64 |