Mathematical Word Problem Solving on GSM8K
94.91Pass@1Learned
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LearnedBackbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 94.91 | — | — | |
| LearnedBackbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 93.78 | — | — | |
| WaitBackbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 91.74 | — | — | |
| HmmBackbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 91.23 | — | — | |
| AlternativelyBackbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 89.27 | — | — | |
| CritiqueBackbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 88.89 | — | — | |
| Baseline (w/o BF)Backbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 88.81 | — | — | |
| HmmBackbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 85.22 | — | — | |
| WaitBackbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 84.9 | — | — | |
| LearnedBackbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 83.68 | — | — | |
| WaitBackbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 80.14 | — | — | |
| AlternativelyBackbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 79.82 | — | — | |
| HmmBackbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 79.47 | — | — | |
| AlternativelyBackbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 78.83 | — | — | |
| Baseline (w/o BF)Backbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 78.43 | — | — | |
| Baseline (w/o BF)Backbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 78.08 | — | — | |
| CritiqueBackbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 77.79 | — | — | |
| CritiqueBackbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 76.1 | — | — | |
| TSLMevaluation_protocol=pass@12026.01 | 61.6 | — | — | |
| GRPOevaluation_protocol=pass@12026.01 | 60.8 | — | — | |
| Procedure Cloningevaluation_protocol=pass@12026.01 | 55.9 | — | — | |
| SCevaluation_protocol=pass@12026.01 | 55.8 | — | — | |
| AgentModel=Qwen3-4B, Setting=Agent2026.02 | — | — | 97.31 | |
| AgentModel=Qwen3-8B, Setting=Agent2026.02 | — | — | 98.95 | |
| AgentModel=Qwen3-14B, Setting=Agent2026.02 | — | — | 98.69 | |
| BCModel=Qwen3-4B, Setting=BC2026.02 | — | — | 97.01 | |
| BCModel=Qwen3-8B, Setting=BC2026.02 | — | — | 97.99 | |
| BCModel=Qwen3-14B, Setting=BC2026.02 | — | — | 98.71 | |
| IFPOModel=Qwen3-4B, Setting=IFPO2026.02 | — | — | 97.4 | |
| IFPOModel=Qwen3-8B, Setting=IFPO2026.02 | — | — | 97.62 | |
| IFPOModel=Qwen3-14B, Setting=IFPO2026.02 | — | — | 98.27 | |
| SafeChainModel=Qwen3-4B, Setting=SafeChain2026.02 | — | — | 95.65 | |
| SafeChainModel=Qwen3-8B, Setting=SafeChain2026.02 | — | — | 96.83 | |
| SafeChainModel=Qwen3-14B, Setting=SafeChain2026.02 | — | — | 99.03 | |
| STAR-1Model=Qwen3-4B, Setting=STAR-12026.02 | — | — | 96.55 | |
| STAR-1Model=Qwen3-8B, Setting=STAR-12026.02 | — | — | 98.42 | |
| STAR-1Model=Qwen3-14B, Setting=STAR-12026.02 | — | — | 98.37 | |
| STAR-1-mixModel=Qwen3-4B, Setting=STAR-1-mix2026.02 | — | — | 96.98 | |
| STAR-1-mixModel=Qwen3-8B, Setting=STAR-1-mix2026.02 | — | — | 98.56 | |
| STAR-1-mixModel=Qwen3-14B, Setting=STAR-1-mix2026.02 | — | — | 98.49 | |
| Tree-of-Thoughtevaluation_protocol=pass@1002026.01 | — | 62.3 | — |