Mathematical Reasoning on AIME2025 (test)
33.7AccuracyDAPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 33.7 | 3,941 | 1.02 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 33 | 4,831 | 0.57 | |
| GRPO+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 32.1 | 4,084 | 0.81 | |
| Training Efficient+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 32 | 4,761 | 0.55 | |
| ThinkPrune+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 31.7 | 3,887 | 0.88 | |
| Training EfficientBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 31.2 | 4,459 | 0.61 | |
| DAPO+CLOREBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 30 | 3,256 | 1.12 | |
| Base model (w/o training)Backbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 29.4 | 5,740 | — | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 29 | 4,353 | 0.54 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.05 | 16.5 | 1,104 | 2.73 | |
| GRPO+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 15.2 | 637 | 4.67 | |
| ThinkPruneBackbone=Qwen2.5-Math-7B2026.05 | 10 | 873 | 1.86 | |
| ThinkPrune+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 9.8 | 556 | 3.4 | |
| DAPO+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 9.5 | 640 | 2.71 | |
| Training EfficientBackbone=Qwen2.5-Math-7B2026.05 | 9.4 | 411 | 3.5 | |
| DAPOBackbone=Qwen2.5-Math-7B2026.05 | 7 | 680 | 1.57 | |
| Training Efficient+CLOREBackbone=Qwen2.5-Math-7B2026.05 | 6.2 | 395 | 2.92 | |
| Base model (w/o training)Backbone=Qwen2.5-Math-7B2026.05 | 3.3 | 824 | — |