Mathematical Reasoning on DART-Math DM-1
68.4Pass@k AccuracyPOLAR
Evaluation Results
| Method | Links | |
|---|---|---|
| POLARBackbone=LLaMA-3.2-3B-Instruct, k=52026.06 | 68.4 | |
| POLARp@=5, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 62 | |
| POLARp@=4, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 60.8 | |
| FlexiDepthp@=5, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 60 | |
| POLARp@=5, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 59.8 | |
| POLARp@=3, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 58 | |
| POLARp@=4, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 57.4 | |
| FlexiDepthp@=4, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 55.4 | |
| POLARp@=3, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 54.2 | |
| DR.LLMBackbone=LLaMA-3.2-3B-Instruct, k=52026.06 | 53.6 | |
| POLARp@=2, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 53.2 | |
| POLARp@=2, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 50.6 | |
| FlexiDepthp@=3, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 49.6 | |
| DR.LLMp@=5, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 48.4 | |
| Base (sampling)Backbone=LLaMA-3.2-3B-Instruct, k=5, Strategy=Stochastic decoding2026.06 | 47.6 | |
| POLARBackbone=LLaMA-3.2-3B-Instruct, k=12026.06 | 46.2 | |
| DR.LLMp@=3, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 44.4 | |
| DR.LLMp@=4, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 44.4 | |
| POLARp@=1, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 44.4 | |
| DR.LLMp@=2, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 43.8 | |
| POLARp@=1, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 43.8 | |
| FlexiDepthp@=2, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 43.6 | |
| Base (tau=0)Backbone=LLaMA-3.2-3B-Instruct, k=1, Strategy=Greedy decoding2026.06 | 42.4 | |
| Base (sampling)p@=5, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 42.2 | |
| Base (sampling)p@=4, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 40.6 | |
| Base (sampling)Backbone=LLaMA-3.2-3B-Instruct, k=1, Strategy=Stochastic decoding2026.06 | 40.6 | |
| Base (sampling)p@=5, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 40 | |
| Base (sampling)p@=4, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 39.6 | |
| Base (sampling)p@=3, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 38.8 | |
| Base (τ=0)p@=1, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 38 | |
| DR.LLMp@=1, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 38 | |
| Base (sampling)p@=3, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 37.8 | |
| Base (sampling)p@=2, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 36.4 | |
| Base (sampling)p@=1, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 35.4 | |
| MindSkipBackbone=LLaMA-3.2-3B-Instruct, k=52026.06 | 35.2 | |
| Base (sampling)p@=2, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 32.6 | |
| FlexiDepthp@=1, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 30 | |
| FlexiDepthBackbone=LLaMA-3.2-3B-Instruct, k=52026.06 | 28.6 | |
| ShortGPTp@=5, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 27.2 | |
| ShortGPTp@=4, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 26.6 | |
| ShortGPTp@=3, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 25.6 | |
| Base (sampling)p@=1, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 24.2 | |
| ShortGPTp@=2, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 22.4 | |
| Base (τ=0)p@=1, Temperature=0, Backbone=Qwen2.5-3B-Instruct2026.06 | 22 | |
| DR.LLMp@=5, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 21.6 | |
| DR.LLMp@=4, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 20.8 | |
| ShortGPTp@=1, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 19.6 | |
| DR.LLMp@=3, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 17.4 | |
| ShortGPTBackbone=LLaMA-3.2-3B-Instruct, k=52026.06 | 16.4 | |
| DR.LLMp@=2, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 14.2 | |
| DR.LLMp@=1, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 6.8 | |
| MindSkipp@=4, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 1.8 | |
| MindSkipp@=5, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 1.8 | |
| ShortGPTp@=5, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 1.4 | |
| MindSkipp@=2, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 1.4 | |
| MindSkipp@=3, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 1.4 | |
| ShortGPTp@=4, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 1.2 | |
| ShortGPTp@=3, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 1 | |
| ShortGPTp@=2, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 0.8 | |
| MindSkipp@=1, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 0.6 | |
| FlexiDepthp@=4, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 0.4 | |
| FlexiDepthp@=5, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 0.4 | |
| ShortGPTp@=1, Temperature=sampling, Backbone=Qwen2.5-3B-Instruct2026.06 | 0.4 | |
| MindSkipp@=1, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 0 | |
| MindSkipp@=2, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 0 | |
| MindSkipp@=3, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 0 | |
| MindSkipp@=4, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 0 | |
| MindSkipp@=5, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 0 | |
| FlexiDepthp@=1, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 0 | |
| FlexiDepthp@=2, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 0 | |
| FlexiDepthp@=3, Backbone=Qwen1.5-MoE-A2.7B-Chat2026.06 | 0 |