Task-Focused Dialogue on TmallBrand-A (TSE, Reward, BLEU)
85.12TSE ScoreDeepSeek
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DeepSeekModel Version=R12026.01 | 85.12 | 7.44 | 14.1 | |
| GOPOBackbone=Qwen3-14B2026.01 | 85.11 | 7.46 | 18.6 | |
| GLMModel Version=4.72026.01 | 84.87 | 7.09 | 15.3 | |
| GPTModel Version=5.22026.01 | 84.26 | 6.72 | 9.5 | |
| GOPOBackbone=Qwen-7B-Chat2026.01 | 83.93 | 6.88 | 19.2 | |
| QwenModel Version=235B2026.01 | 83.27 | 6.38 | 11.4 | |
| GeminiModel Version=2.52026.01 | 80.84 | 6.91 | 13.1 | |
| PPO2026.01 | 80.4 | 6.39 | 18.1 | |
| Memento2026.01 | 77.93 | 6.44 | 16.8 | |
| SFT2026.01 | 76.89 | 5.59 | 16.5 | |
| Untrained2026.01 | 67.91 | 5.25 | 8.3 |