Travel planning on TravelPlanner (val)
100Delivery RateMIRROR
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| MIRRORPlanning Mode=Two-stage2026.04 | 100 | 73.2 | 13.9 | 27.6 | 13.3 | 2.2 | |
| Human-LikePlanning Mode=Two-stage2026.04 | 100 | 75.1 | 15.6 | 15.5 | 4.4 | 2.2 | |
| ToTPlanning Mode=Two-stage2026.04 | 100 | 75.8 | 16.7 | 44 | 21.1 | 3.9 | |
| LatsPlanning Mode=Two-stage2026.04 | 100 | 78.3 | 16.7 | 44.8 | 21.1 | 3.9 | |
| One-shotPlanning Mode=Two-stage2026.04 | 100 | 76.4 | 17.2 | 43.3 | 20.6 | 3.9 | |
| EvoAgent*Planning Mode=Two-stage2026.04 | 100 | 76.25 | 15.1 | 38.57 | 28.42 | 4.44 | |
| HiAR-ICLPlanning Mode=Two-stage2026.04 | 100 | 81.2 | 20.6 | 47.4 | 22.8 | 6.7 | |
| RAPPlanning Mode=Two-stage2026.04 | 100 | 81 | 20.6 | 50.5 | 25.6 | 6.7 | |
| OptimizingPlanning Mode=Two-stage2026.04 | 100 | 84.93 | 27.22 | 61.19 | 42.78 | 12.78 | |
| FAFTPlanning Mode=Two-stage2026.04 | 100 | 89.1 | 59.4 | 49.8 | 21.7 | 13.9 | |
| HTPPlanning Mode=Two-stage2026.04 | 100 | 87.2 | 37.8 | 44.3 | 32.2 | 20 | |
| LLM-ModuloPlanning Mode=Two-stage2026.04 | 100 | 89.2 | 40.6 | 62.1 | 39.4 | 20.6 | |
| Behavior ForestPlanning Mode=Two-stage2026.04 | 100 | 98.4 | 94.44 | 90 | 91.67 | 91.67 | |
| Cot*Planning Mode=Sole-planning2026.04 | 100 | 63.33 | 0 | 0 | 0 | 0 | |
| Direct*Planning Mode=Sole-planning2026.04 | 100 | 63.26 | 2.22 | 2.62 | 3.33 | 0.56 | |
| EvoAgent*Planning Mode=Sole-planning2026.04 | 100 | 84.58 | 35 | 58.81 | 62.22 | 43.33 | |
| DPPMPlanning Mode=Sole-planning2026.04 | 100 | 98.5 | 89.4 | 90.7 | 80.6 | 76.7 | |
| Behavior ForestPlanning Mode=Sole-planning2026.04 | 100 | 99.44 | 96.11 | 93.81 | 94.44 | 94.44 | |
| Greedy Search2026.06 | 100 | — | — | — | — | 0 | |
| DICEPlanning Setting=Two-stage, Backbone=GPT-42026.06 | 100 | — | — | — | — | 7.2 | |
| DICE-FTPlanning Setting=Two-stage, Backbone=Qwen3-32B2026.06 | 100 | — | — | — | — | 5.6 | |
| DirectPlanning Setting=Sole-planning, Backbone=GPT-4-Turbo2026.06 | 100 | — | — | — | — | 4.4 | |
| DirectPlanning Setting=Sole-planning, Backbone=GPT-o32026.06 | 100 | — | — | — | — | 6.1 | |
| MA-FTPlanning Setting=Sole-planning, Backbone=Qwen3-32B2026.06 | 100 | — | — | — | — | 9.1 | |
| DICE-PCPlanning Setting=Sole-planning, Backbone=GPT-42026.06 | 100 | — | — | — | — | 12.9 | |
| DICE-PCPlanning Setting=Sole-planning, Backbone=Qwen3-32B2026.06 | 100 | — | — | — | — | 8.9 | |
| DICE-FTPlanning Setting=Sole-planning, Backbone=Qwen3-32B2026.06 | 100 | — | — | — | — | 10.6 | |
| NarrativeGuidePlanning Mode=Two-stage2026.04 | 99.4 | 94.3 | 63.9 | 64 | 43.3 | 34.4 | |
| MA-DebatePlanning Setting=Sole-planning, Backbone=Qwen3-235B2026.06 | 99.4 | — | — | — | — | 10.1 | |
| DICE-PCPlanning Setting=Two-stage, Backbone=Qwen3-32B2026.06 | 98.3 | — | — | — | — | 3.9 | |
| DebatePlanning Setting=Sole-planning, Backbone=GPT-4, Rounds=32026.06 | 97.7 | — | — | — | — | 6.7 | |
| PMC*Planning Mode=Two-stage2026.04 | 97.33 | 86.11 | 49.44 | 49.76 | 50 | 30 | |
| MA-FTPlanning Setting=Two-stage, Backbone=Qwen3-32B2026.06 | 97.2 | — | — | — | — | 3.1 | |
| MA-DebatePlanning Setting=Two-stage, Backbone=Qwen3-235B2026.06 | 96.7 | — | — | — | — | 3.8 | |
| DebatePlanning Setting=Two-stage, Backbone=GPT-4, Rounds=32026.06 | 95.2 | — | — | — | — | 2.3 | |
| GPT-o3Planning Setting=Two-stage2026.06 | 92.8 | — | — | — | — | 1.4 | |
| llm-rwplanning*Planning Mode=Two-stage2026.04 | 90 | 90 | 90 | 85.95 | 85 | 85 | |
| GPT-4-TurboPlanning Setting=Two-stage2026.06 | 89.4 | — | — | — | — | 0.6 | |
| Co-GymPlanning Mode=Two-stage2026.04 | 85.3 | — | — | — | — | — | |
| ReAct*Planning Mode=Two-stage2026.04 | 85 | 53.4 | 2.78 | 2.14 | 2.78 | 1.11 | |
| ReAct*Planning Mode=Sole-planning2026.04 | 85 | 70.07 | 18.89 | 47.86 | 33.89 | 6.67 | |
| Reflection*Planning Mode=Sole-planning2026.04 | 76.11 | 63.05 | 16.11 | 32.38 | 22.22 | 5.56 | |
| RLPPlanning Mode=Two-stage2026.04 | — | 95.3 | 68.9 | 62.6 | 39.4 | 25 |