Multi-party Travel Planning on MR-TravelBench Easy
5.94Group UtilityDECOMPR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DECOMPRReward=DECOMPR, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 5.94 | 60.1 | 24 | |
| RubricReward=Rubric, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 5.49 | 59.76 | 22 | |
| DirectReward=Direct, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 5.34 | 58.52 | 22 | |
| ChecklistReward=Checklist, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 5.21 | 58.14 | 21 | |
| Base ModelReward=None, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=Pre-RL reference2026.05 | 5.11 | 60.5 | 23 |