Multi-party Travel Planning on MR-TravelBench Med
7.35Group UtilityDECOMPR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DECOMPRReward=DECOMPR, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 7.35 | 49.58 | 19 | |
| DirectReward=Direct, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 6.68 | 45.2 | 17 | |
| RubricReward=Rubric, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 6.3 | 44.69 | 17 | |
| ChecklistReward=Checklist, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 6.25 | 44.82 | 17 | |
| Base ModelReward=None, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=Pre-RL reference2026.05 | 6.19 | 46.52 | 18 |