Proactive Task-Oriented Dialogue on FoodDeliverService Courier Regional Bonus
45.6CSRQwen-3-8B +SI-AVPO
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen-3-8B +SI-AVPOBackbone=Qwen-3-8B, Optimization Strategy=SI-AVPO2026.05 | 45.6 | 44.3 | 3.06 | 3.66 | 2.94 | |
| Claude-Sonnet-4.5Model Type=Large Models2026.05 | 45 | 43.2 | 3.03 | 3.75 | 2.67 | |
| Qwen-3-4B +SI-AVPOBackbone=Qwen-3-4B, Optimization Strategy=SI-AVPO2026.05 | 44.6 | 42 | 2.87 | 3.52 | 2.63 | |
| Kimi-K2.5Model Type=Large Models2026.05 | 39 | 38.8 | 2.79 | 3.45 | 2.21 | |
| GLM-5.1Model Type=Large Models2026.05 | 38.7 | 38.7 | 2.86 | 3.56 | 2.12 | |
| Qwen-3-8B +SEADBackbone=Qwen-3-8B, Optimization Strategy=SEAD2026.05 | 36.7 | 33.5 | 2.75 | 3.51 | 2.45 | |
| DeepSeek-v3.2Model Type=Large Models2026.05 | 32.6 | 28 | 2.54 | 3.27 | 1.96 | |
| GPT-4.1Model Type=Large Models2026.05 | 30.7 | 22.8 | 2.66 | 2.91 | 1.79 | |
| Qwen-3-8B +DAPOBackbone=Qwen-3-8B, Optimization Strategy=DAPO2026.05 | 30.7 | 28.7 | 2.59 | 3.19 | 2.28 | |
| Qwen-3-4B +SEADBackbone=Qwen-3-4B, Optimization Strategy=SEAD2026.05 | 30.2 | 32.5 | 2.52 | 3.21 | 2.26 | |
| Qwen-3-8B +GRPOBackbone=Qwen-3-8B, Optimization Strategy=GRPO2026.05 | 29.6 | 24.7 | 2.41 | 3.03 | 2.11 | |
| Qwen-3-8B +PPOBackbone=Qwen-3-8B, Optimization Strategy=PPO2026.05 | 25.2 | 24.8 | 2.4 | 2.87 | 2.13 | |
| Qwen-3-4B +GRPOBackbone=Qwen-3-4B, Optimization Strategy=GRPO2026.05 | 24.3 | 22.3 | 2.13 | 2.55 | 1.86 | |
| Qwen-3-4B +DAPOBackbone=Qwen-3-4B, Optimization Strategy=DAPO2026.05 | 23.8 | 26.3 | 2.25 | 2.81 | 2.1 | |
| Qwen-3-8B (Base)Backbone=Qwen-3-8B, Optimization Strategy=Base2026.05 | 23.5 | 22.2 | 2.35 | 2.51 | 2 | |
| Qwen-3-4B +PPOBackbone=Qwen-3-4B, Optimization Strategy=PPO2026.05 | 22.7 | 19.8 | 2.06 | 2.44 | 1.75 | |
| Qwen-3-4B (Base)Backbone=Qwen-3-4B, Optimization Strategy=Base2026.05 | 20.8 | 18.5 | 1.96 | 2.34 | 1.76 |