Proactive Task-Oriented Dialogue on FoodDeliverService Merchant Promotion
52.6CSRQwen-3-8B +SI-AVPO
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen-3-8B +SI-AVPOBackbone=Qwen-3-8B, Optimization Strategy=SI-AVPO2026.05 | 52.6 | 48.5 | 3.61 | 3.71 | 3.18 | |
| Qwen-3-4B +SI-AVPOBackbone=Qwen-3-4B, Optimization Strategy=SI-AVPO2026.05 | 51.9 | 46.3 | 3.25 | 3.56 | 3.11 | |
| Claude-Sonnet-4.5Model Type=Large Models2026.05 | 51.1 | 50.8 | 3.56 | 3.76 | 3.09 | |
| Kimi-K2.5Model Type=Large Models2026.05 | 49 | 39.8 | 3.26 | 3.51 | 2.67 | |
| GLM-5.1Model Type=Large Models2026.05 | 46.2 | 42.3 | 3.32 | 3.44 | 2.78 | |
| DeepSeek-v3.2Model Type=Large Models2026.05 | 45.7 | 39.5 | 3.04 | 3.13 | 2.45 | |
| Qwen-3-8B +SEADBackbone=Qwen-3-8B, Optimization Strategy=SEAD2026.05 | 40.4 | 36.3 | 3.23 | 3.56 | 2.63 | |
| Qwen-3-8B +DAPOBackbone=Qwen-3-8B, Optimization Strategy=DAPO2026.05 | 36.3 | 34.3 | 2.81 | 3.37 | 2.41 | |
| GPT-4.1Model Type=Large Models2026.05 | 36.1 | 34.7 | 2.93 | 3.02 | 2.12 | |
| Qwen-3-4B +SEADBackbone=Qwen-3-4B, Optimization Strategy=SEAD2026.05 | 33.7 | 32.7 | 2.95 | 3.22 | 2.58 | |
| Qwen-3-8B +GRPOBackbone=Qwen-3-8B, Optimization Strategy=GRPO2026.05 | 33.2 | 30.5 | 2.69 | 2.88 | 2.51 | |
| Qwen-3-8B +PPOBackbone=Qwen-3-8B, Optimization Strategy=PPO2026.05 | 31.8 | 26.8 | 2.6 | 2.81 | 2.26 | |
| Qwen-3-8B (Base)Backbone=Qwen-3-8B, Optimization Strategy=Base2026.05 | 30.6 | 26.2 | 2.66 | 2.48 | 2.18 | |
| Qwen-3-4B +DAPOBackbone=Qwen-3-4B, Optimization Strategy=DAPO2026.05 | 29.7 | 29.5 | 2.6 | 2.74 | 2.33 | |
| Qwen-3-4B +GRPOBackbone=Qwen-3-4B, Optimization Strategy=GRPO2026.05 | 28.4 | 28 | 2.47 | 2.61 | 2.17 | |
| Qwen-3-4B +PPOBackbone=Qwen-3-4B, Optimization Strategy=PPO2026.05 | 26.5 | 22.3 | 2.36 | 2.59 | 2.22 | |
| Qwen-3-4B (Base)Backbone=Qwen-3-4B, Optimization Strategy=Base2026.05 | 22.5 | 20.2 | 2.23 | 2.15 | 1.9 |