Roadmap generation on RoadMapper Combined English & Chinese
79.61Overall AverageRoadMapper
Evaluation Results
| Method | Links | |
|---|---|---|
| RoadMapperBase Model=DeepSeek-V3.2, Training=DPO training on Qwen3-32B2026.04 | 79.61 | |
| RoadMapperBase Model=Qwen3-235B-A22B, Training=DPO training on Qwen3-32B2026.04 | 78.71 | |
| DyLANBase Model=DeepSeek-V3.22026.04 | 77.36 | |
| RoadMapperBase Model=Gemini 3 Flash Preview, Training=DPO training on Qwen3-32B2026.04 | 77.29 | |
| ReConcileBase Model=DeepSeek-V3.22026.04 | 76.74 | |
| DyLANBase Model=Qwen3-235B-A22B2026.04 | 75.89 | |
| ReConcileBase Model=Qwen3-235B-A22B2026.04 | 75.85 | |
| RoadMapperBase Model=gpt-oss-20b, Training=DPO training on Qwen3-32B2026.04 | 75.26 | |
| RoadMapperBase Model=Qwen3-14B, Training=DPO training on Qwen3-32B2026.04 | 75.08 | |
| ReConcileBase Model=Gemini 3 Flash Preview2026.04 | 73.67 | |
| CoTBase Model=Qwen3-235B-A22B2026.04 | 73.47 | |
| DyLANBase Model=Gemini 3 Flash Preview2026.04 | 73.42 | |
| Best-of-NBase Model=Qwen3-235B-A22B2026.04 | 73.4 | |
| Direct PromptingBase Model=Qwen3-235B-A22B2026.04 | 72.91 | |
| CoTBase Model=DeepSeek-V3.22026.04 | 72.75 | |
| Best-of-NBase Model=DeepSeek-V3.22026.04 | 72.58 | |
| RoadMapperBase Model=Claude 3 Haiku, Training=DPO training on Qwen3-32B2026.04 | 72.55 | |
| RoadMapperBase Model=Mistral Small 3.2, Training=DPO training on Qwen3-32B2026.04 | 72.33 | |
| Direct PromptingBase Model=DeepSeek-V3.22026.04 | 72.12 | |
| RoadMapperBase Model=Llama 4 Maverick, Training=DPO training on Qwen3-32B2026.04 | 70.85 | |
| Best-of-NBase Model=Qwen3-14B2026.04 | 70.53 | |
| RoadMapperBase Model=Llama 3.3 70B, Training=DPO training on Qwen3-32B2026.04 | 70.45 | |
| Best-of-NBase Model=gpt-oss-20b2026.04 | 70.25 | |
| Direct PromptingBase Model=Qwen3-14B2026.04 | 70.21 | |
| CoTBase Model=Gemini 3 Flash Preview2026.04 | 69.87 | |
| Direct PromptingBase Model=gpt-oss-20b2026.04 | 69.8 | |
| Best-of-NBase Model=Gemini 3 Flash Preview2026.04 | 69.55 | |
| Direct PromptingBase Model=Gemini 3 Flash Preview2026.04 | 69.2 | |
| RoadMapperBase Model=Llama 3.1 8B, Training=DPO training on Qwen3-32B2026.04 | 67.82 | |
| RoadMapperBase Model=GPT-4o mini, Training=DPO training on Qwen3-32B2026.04 | 67.18 | |
| Best-of-NBase Model=Claude 3 Haiku2026.04 | 66.92 | |
| Best-of-NBase Model=Mistral Small 3.22026.04 | 66.84 | |
| Direct PromptingBase Model=Mistral Small 3.22026.04 | 66.65 | |
| DyLANBase Model=Llama 3.3 70B2026.04 | 66.46 | |
| Direct PromptingBase Model=Claude 3 Haiku2026.04 | 66.43 | |
| ReConcileBase Model=Llama 3.3 70B2026.04 | 66.25 | |
| Best-of-NBase Model=Llama 4 Maverick2026.04 | 63.51 | |
| Direct PromptingBase Model=Llama 4 Maverick2026.04 | 63.38 | |
| Best-of-NBase Model=GPT-4o mini2026.04 | 63.36 | |
| Direct PromptingBase Model=GPT-4o mini2026.04 | 62.95 | |
| CoTBase Model=Llama 3.3 70B2026.04 | 62.88 | |
| Best-of-NBase Model=Llama 3.3 70B2026.04 | 62.74 | |
| Direct PromptingBase Model=Llama 3.3 70B2026.04 | 62.1 | |
| Best-of-NBase Model=Llama 3.1 8B2026.04 | 61.36 | |
| Direct PromptingBase Model=Llama 3.1 8B2026.04 | 60.62 |