Mathematical Reasoning on Mathematical Reasoning Benchmarks
88.1Average ScoreSA-4B-RL-2200
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| SA-4B-RL-2200Teval=13.42026.06 | 88.1 | — | — | — | — | — | — | — | |
| SWA12k-4B-RL-2500Teval=6.32026.06 | 87.1 | — | — | — | — | — | — | -1 | |
| SA-4B-SFTTeval=19.62026.06 | 84.1 | — | — | — | — | — | — | — | |
| SWA12k-4B-SFTTeval=11.02026.06 | 80.2 | — | — | — | — | — | — | -3.9 | |
| QWEN3-4B-P2O_TEACHER-REFTraining Dataset=DeepScaler-5K, Backbone=Qwen3-4B, Optimization Method=P2O, Reflection Source=Teacher-Reflection (Kimi-K2)2026.03 | 65.2 | 59.8 | 49.4 | 92.2 | 91.4 | 36.4 | 62.2 | — | |
| QWEN3-4B-P2O_SELF-REFTraining Dataset=DeepScaler-5K, Backbone=Qwen3-4B, Optimization Method=P2O, Reflection Source=Self-Reflection (Qwen3-4B)2026.03 | 62.4 | 51.5 | 42.1 | 88.1 | 91 | 40.1 | 61.8 | — | |
| QWEN3-4B-P2O_SELF-REFTraining Dataset=DeepMath-5K, Backbone=Qwen3-4B, Optimization Method=P2O, Reflection Source=Self-Reflection (Qwen3-4B)2026.03 | 61.7 | 52.1 | 39.8 | 85.3 | 90.2 | 41.9 | 60.9 | — | |
| GRPOTraining Dataset=DeepScaler-5K, Backbone=Qwen3-4B, Optimization Method=GRPO2026.03 | 60.5 | 46.9 | 37.7 | 88.1 | 90.4 | 41.5 | 58.2 | — | |
| QWEN3-4B-P2O_TEACHER-REFTraining Dataset=DeepMath-5K, Backbone=Qwen3-4B, Optimization Method=P2O, Reflection Source=Teacher-Reflection (Kimi-K2)2026.03 | 57.9 | 44.6 | 34.4 | 81.9 | 90.2 | 36 | 60 | — | |
| GRPOTraining Dataset=DeepMath-5K, Backbone=Qwen3-4B, Optimization Method=GRPO2026.03 | 54.8 | 33.8 | 29 | 79.5 | 87.6 | 41.5 | 57.5 | — | |
| QWEN3-4BType=Base Model2026.03 | 45.9 | 23.8 | 19.4 | 68 | 82.8 | 31.6 | 49.9 | — | |
| STABLE-OPDBackbone=Qwen2.5-Math-1.5B, Teacher Model=OpenThinkerV32026.04 | 36.1 | 13.8 | 16 | 43 | 73.9 | 32.6 | 37.4 | — | |
| QWEN2.5-MATH-1.5B-INSTRUCTBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 35.7 | 12.1 | 8.9 | 48.1 | 77.4 | 28.7 | 39.1 | — | |
| QWEN3-1.7BType=Base Model2026.03 | 34.1 | 13.1 | 10.2 | 47.7 | 72.8 | 22.1 | 38.4 | — | |
| QWEN3-4B-BASEType=Base Model2026.03 | 31.9 | 9.2 | 5.8 | 37.7 | 67.4 | 32.4 | 35.6 | — | |
| SFTBackbone=Qwen2.5-Math-1.5B, Training=Supervised Fine-Tuning2026.04 | 31.9 | 11.7 | 13.2 | 37.8 | 70.6 | 26.8 | 31.3 | — | |
| GRPOBackbone=Qwen2.5-Math-1.5B, Training=Group Relative Policy Optimization2026.04 | 30.1 | 11.8 | 7.7 | 40.2 | 61.8 | 26.8 | 32 | — | |
| OPDBackbone=Qwen2.5-Math-1.5B, Teacher Model=OpenThinkerV32026.04 | 28.9 | 11.1 | 15 | 35.9 | 56.7 | 23.4 | 31 | — | |
| QWEN3-0.6BType=Base Model2026.03 | 19.6 | 2.1 | 1.9 | 30.2 | 53.8 | 12.5 | 19.4 | — | |
| QWEN2.5-MATH-1.5BBackbone=Qwen2.5-Math-1.5B2026.04 | 16 | 7.2 | 3.6 | 26.4 | 28 | 9.6 | 21.2 | — |