Mathematical Reasoning on GSM8K (test) (Accuracy, Average Length, AES)
92.3AccuracyBFS-PO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BFS-POModel=Qwen2.5-7B-Instruct2026.02 | 92.3 | 234 | 0.24 | |
| DAPOModel=Qwen2.5-7B-Instruct2026.02 | 91.9 | 277 | 0.09 | |
| SFTModel=Qwen2.5-7B-Instruct2026.02 | 91.7 | 296 | 0.02 | |
| Zero-shotModel=Qwen2.5-7B-Instruct2026.02 | 91.4 | 298 | 0 | |
| BFS-POModel=Llama-3.1-8B-Instruct2026.02 | 87.9 | 189 | 0.17 | |
| TokenSkipModel=Qwen2.5-7B-Instruct2026.02 | 87.9 | 178 | 0.21 | |
| DAPOModel=Llama-3.1-8B-Instruct2026.02 | 87.6 | 209 | 0.07 | |
| SFTModel=Llama-3.1-8B-Instruct2026.02 | 86.7 | 214 | 0.01 | |
| BFS-POModel=Qwen2.5-3B-Instruct2026.02 | 86.2 | 269 | 0.24 | |
| Zero-shotModel=Llama-3.1-8B-Instruct2026.02 | 86.2 | 213 | 0 | |
| DAPOModel=Qwen2.5-3B-Instruct2026.02 | 85.6 | 290 | 0.15 | |
| Zero-shotModel=Qwen2.5-3B-Instruct2026.02 | 83.7 | 315 | 0 | |
| SFTModel=Qwen2.5-3B-Instruct2026.02 | 83.4 | 319 | -0.03 | |
| TokenSkipModel=Qwen2.5-3B-Instruct2026.02 | 83.2 | 263 | 0.14 | |
| TokenSkipModel=Llama-3.1-8B-Instruct2026.02 | 81.1 | 129 | 0.1 | |
| Tree of ThoughtsModel=Llama-3.1-8B-Instruct2026.02 | 74 | 385 | -1.51 |