Mathematical Reasoning on AMC 2023 (Accuracy and Average Tokens)
100AccuracyBCR-Qwen3-4B (Ours)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BCR-Qwen3-4B (Ours)Inference mode=N=12026.04 | 100 | 7,128 | |
| Qwen3-4B-Thinking-2507Inference mode=N=12026.04 | 97.5 | 10,457 | |
| VanillaBackbone=Qwen3-8B2026.04 | 97.5 | 8,648 | |
| GRPOBackbone=Qwen3-8B2026.04 | 97.5 | 8,204 | |
| GRPO+SOPBackbone=Qwen3-8B2026.04 | 97.5 | 5,431 | |
| VanillaBackbone=Qwen3-4B2026.04 | 97.5 | 8,801 | |
| GRPOBackbone=Qwen3-4B2026.04 | 97.5 | 7,712 | |
| GRPO-λBackbone=Qwen3-4B2026.04 | 97.5 | 4,671 | |
| Step-GRPOBackbone=Qwen3-8B2026.04 | 95 | 5,295 | |
| GRPO-8kBackbone=Qwen3-4B2026.04 | 95 | 5,506 | |
| GRPO+LPBackbone=Qwen3-4B2026.04 | 95 | 4,712 | |
| GRPO+SOPBackbone=Qwen3-4B2026.04 | 95 | 5,793 | |
| Step-GRPOBackbone=Qwen3-4B2026.04 | 95 | 5,456 | |
| GRPO+LPBackbone=Qwen3-8B2026.04 | 92.5 | 3,786 | |
| DEER+SFTBackbone=Qwen3-8B2026.04 | 90 | 6,149 | |
| GRPO-λBackbone=Qwen3-8B2026.04 | 90 | 5,432 | |
| BCR-JustRL-1.5B (Ours)Inference mode=N=12026.04 | 87.5 | 2,637 | |
| GRPO-8kBackbone=Qwen3-8B2026.04 | 87.5 | 5,933 | |
| Qwen3-1.7BInference mode=N=12026.04 | 85 | 8,157 | |
| e3-1.7BInference mode=N=1, Length Control=true2026.04 | 85 | 7,154 | |
| JustRL-deepseek-1.5BInference mode=N=12026.04 | 85 | 5,713 | |
| DEER+SFTBackbone=Qwen3-4B2026.04 | 85 | 5,002 | |
| GRPOBackbone=Qwen3-1.7B2026.04 | 85 | 9,425 | |
| GRPO+SOPBackbone=Qwen3-1.7B2026.04 | 82.5 | 7,704 | |
| Step-GRPOBackbone=Qwen3-1.7B2026.04 | 82.5 | 6,856 | |
| BroRL-1.5BInference mode=N=1, Length Control=true2026.04 | 81 | 4,120 | |
| VanillaBackbone=Qwen3-1.7B2026.04 | 80 | 10,713 | |
| GRPO-8kBackbone=Qwen3-1.7B2026.04 | 80 | 7,021 | |
| GRPO-λBackbone=Qwen3-1.7B2026.04 | 75 | 7,050 | |
| STILL-3-1.5BInference mode=N=12026.04 | 72.5 | 5,706 | |
| GRPO+LPBackbone=Qwen3-1.7B2026.04 | 72.5 | 6,605 | |
| DeepSeek-R1-Distill-Qwen-1.5BInference mode=N=12026.04 | 67.5 | 9,702 | |
| DEER+SFTBackbone=Qwen3-1.7B2026.04 | 67.5 | 5,712 | |
| ARM-3BInference mode=N=1, Adaptive Reasoning=true2026.04 | 42.5 | 703 | |
| Thinker-Q1.5BInference mode=N=1, Adaptive Reasoning=true2026.04 | 32.5 | 828 |