Mathematical Reasoning on MATH-500 (Pass@1 Accuracy, Average Token Length)
97.4Pass@1 AccuracyBCR-Qwen3-4B (Ours)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BCR-Qwen3-4B (Ours)Inference mode=N=12026.04 | 97.4 | 3,713 | |
| Qwen3-4B-Thinking-2507Inference mode=N=12026.04 | 97 | 5,136 | |
| BroRL-1.5BInference mode=N=1, Length Control=true2026.04 | 92.1 | 2,996 | |
| AutoThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 92 | 2,378.2 | |
| LaserBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 91.8 | 1,648.3 | |
| TRiMSBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 91.4 | 712.4 | |
| JustRL-deepseek-1.5BInference mode=N=12026.04 | 91.4 | 3,099 | |
| VanillaBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 91 | 3,682.5 | |
| e3-1.7BInference mode=N=1, Length Control=true2026.04 | 91 | 3,774 | |
| AdaptThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 90.4 | 1,871.4 | |
| Qwen3-1.7BInference mode=N=12026.04 | 90.2 | 4,621 | |
| JETBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 89.2 | 1,935.7 | |
| BCR-JustRL-1.5B (Ours)Inference mode=N=12026.04 | 87.6 | 1,868 | |
| CoT Cold-Start + R-ZeroBackbone=Qwen3-8B-Base, # Train=64342025.11 | 86.2 | — | |
| AutoThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 85.6 | 2,111.5 | |
| DeepSeek-R1-Distill-Qwen-1.5BInference mode=N=12026.04 | 85.4 | 5,409 | |
| STILL-3-1.5BInference mode=N=12026.04 | 84.6 | 4,280 | |
| LC-R1Base Model=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.03 | 84.4 | 1,381.7 | |
| LaserBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 84.1 | 1,974.1 | |
| CoT Cold-Start + Solver FeedbackBackbone=Qwen3-8B-Base, # Train=68012025.11 | 83.8 | — | |
| TRiMSBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 83.4 | 836.3 | |
| Seed SetBackbone=Qwen3-8B-Base, # Train=40002025.11 | 83.4 | — | |
| Self-InstructBackbone=Qwen3-8B-Base, # Train=59902025.11 | 83.4 | — | |
| Self-Instruct + R-ZeroBackbone=Qwen3-8B-Base, # Train=71422025.11 | 83.4 | — | |
| CoT Cold-Start + RLMTBackbone=Qwen3-8B-Base, # Train=63822025.11 | 83.4 | — | |
| Self-Instruct + Solver FeedbackBackbone=Qwen3-8B-Base, # Train=63332025.11 | 82.8 | — | |
| AdaptThinkBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 82.7 | 1,821.9 | |
| Self-Instruct + RLMTBackbone=Qwen3-8B-Base, # Train=71282025.11 | 82.6 | — | |
| VanillaBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 82.3 | 4,619.2 | |
| CoT Cold-Start + Solver FeedbackBackbone=Qwen3-4B-Base, # Train=67222025.11 | 82 | — | |
| CoT Cold-StartBackbone=Qwen3-8B-Base, # Train=67232025.11 | 81.8 | — | |
| Self-Instruct + Solver FeedbackBackbone=Qwen3-4B-Base, # Train=54892025.11 | 81.2 | — | |
| Self-Instruct + R-ZeroBackbone=Qwen3-4B-Base, # Train=64612025.11 | 80.8 | — | |
| CoT Cold-Start + RLMTBackbone=Qwen3-4B-Base, # Train=67032025.11 | 80.8 | — | |
| DDRLBackbone=Qwen2.5-Math-1.5B2026.04 | 80.7 | — | |
| Self-Instruct + CoT-Self-InstructBackbone=Qwen3-8B-Base, # Train=63882025.11 | 80.2 | — | |
| Seed SetBackbone=Qwen3-4B-Base, # Train=40002025.11 | 79.6 | — | |
| Self-Instruct + RLMTBackbone=Qwen3-4B-Base, # Train=68592025.11 | 79.6 | — | |
| CoT Cold-Start + R-ZeroBackbone=Qwen3-4B-Base, # Train=68652025.11 | 78.4 | — | |
| Self-Instruct + CoT-Self-InstructBackbone=Qwen3-4B-Base, # Train=70512025.11 | 78.2 | — | |
| CoT Cold-StartBackbone=Qwen3-4B-Base, # Train=66162025.11 | 77.8 | — | |
| Self-InstructBackbone=Qwen3-4B-Base, # Train=53752025.11 | 77.4 | — | |
| ETMRBackbone=Qwen2.5-Math-1.5B2026.04 | 76.9 | — | |
| TTRLBackbone=Qwen2.5-Math-1.5B2026.04 | 73 | — | |
| DDRLBackbone=Qwen2.5-Base-3B2026.04 | 72.7 | — | |
| TTRLBackbone=Qwen2.5-Base-3B2026.04 | 72.2 | — | |
| JETBase Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 72 | 1,909.6 | |
| ETMRBackbone=Qwen2.5-Base-3B2026.04 | 71.7 | — | |
| LC-R1Base Model=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.03 | 71.2 | 2,080.4 | |
| Base ModelBackbone=Qwen3-8B-Base, # Train=-2025.11 | 67.8 | — | |
| DDRLBackbone=Llama-3.1-8B-Instruct2026.04 | 67.6 | — | |
| Base ModelBackbone=Qwen3-4B-Base, # Train=-2025.11 | 66.4 | — | |
| TTRLBackbone=Llama-3.1-8B-Instruct2026.04 | 63.7 | — | |
| Thinker-Q1.5BInference mode=N=1, Adaptive Reasoning=true2026.04 | 63.4 | 760 | |
| ETMRBackbone=Llama-3.1-8B-Instruct2026.04 | 59.5 | — | |
| ARM-3BInference mode=N=1, Adaptive Reasoning=true2026.04 | 58.4 | 1,222 | |
| No AdaptationBackbone=Qwen2.5-Base-3B2026.04 | 53.2 | — | |
| No AdaptationBackbone=Llama-3.1-8B-Instruct2026.04 | 48.6 | — | |
| No AdaptationBackbone=Qwen2.5-Math-1.5B2026.04 | 32.7 | — |