Mathematical Reasoning on AMC 2023 (test) (Accuracy, Length, AE)
83.8AccuracyTraining Efficient
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Training EfficientBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 83.8 | 2,077 | 0.66 | |
| Training Efficient+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 83.5 | 2,229 | 0.54 | |
| GRPO+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82.7 | 1,828 | 0.86 | |
| ThinkPrune+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82.7 | 1,817 | 0.87 | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82.6 | 1,808 | 0.88 | |
| DAPO+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82.3 | 1,526 | 1.21 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 81.9 | 2,171 | 0.55 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 80 | 1,950 | 0.68 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.05 | 76.5 | 897 | -0.1 | |
| Base model (w/o training)Backbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 75.9 | 2,751 | — | |
| DAPO+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 75.9 | 588 | 0.36 | |
| GRPO+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 73.4 | 661 | 0.17 | |
| ThinkPrune+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 72.8 | 566 | 0.36 | |
| ThinkPruneBackbone=Qwen2.5-Math-7B2026.05 | 72.1 | 767 | -0.01 | |
| Training Efficient+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 64.5 | 204 | 2.33 | |
| Training EfficientBackbone=Qwen2.5-Math-7B2026.05 | 63.8 | 372 | 0.81 | |
| DAPOBackbone=Qwen2.5-Math-7B2026.05 | 56.1 | 660 | -0.1 | |
| Base model (w/o training)Backbone=Qwen2.5-Math-7B2026.05 | 54.2 | 571 | — |