Multi-party Travel Planning on MR-TravelBench (All)
7.07Group UtilityDECOMPR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DECOMPRReward=DECOMPR, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 7.07 | 49.82 | 19 | |
| DirectReward=Direct, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 6.5 | 46.42 | 18 | |
| RubricReward=Rubric, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 6.31 | 46.61 | 18 | |
| ChecklistReward=Checklist, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 6.28 | 46.23 | 17 | |
| Base ModelReward=None, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=Pre-RL reference2026.05 | 6.17 | 48.11 | 18 |