Multi-party Travel Planning on MR-TravelBench Hard
7.85Group UtilityDECOMPR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DECOMPRReward=DECOMPR, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 7.85 | 39.84 | 15 | |
| DirectReward=Direct, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 7.42 | 35.82 | 15 | |
| ChecklistReward=Checklist, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 7.38 | 36.51 | 15 | |
| Base ModelReward=None, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=Pre-RL reference2026.05 | 7.2 | 37.69 | 14 | |
| RubricReward=Rubric, Backbone=Qwen3-30B-A3B-Thinking-2507, Training=GRPO2026.05 | 7.14 | 35.86 | 14 |