Mathematical Reasoning on AIME24, AIME25, HMMT25 (test)
78.33Accuracy on AIME 2024Qwen3-8B w/ GRPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen3-8B w/ GRPOBase Model=Qwen3-8B, Training Strategy=GRPO2026.06 | 78.33 | 69.44 | 44.72 | 64.16 | |
| Qwen3-8B w/ OPSD+ReNIOBase Model=Qwen3-8B, Training Strategy=OPSD+ReNIO2026.06 | 78.06 | 71.11 | 47.5 | 65.56 | |
| Qwen3-4B w/ OPSD+ReNIOBase Model=Qwen3-4B, Training Strategy=OPSD+ReNIO2026.06 | 75.83 | 69.17 | 46.67 | 63.89 | |
| Qwen3-4B w/ OPSDBase Model=Qwen3-4B, Training Strategy=OPSD2026.06 | 75.56 | 68.89 | 43.33 | 62.59 | |
| Qwen3-8B w/ OPSDBase Model=Qwen3-8B, Training Strategy=OPSD2026.06 | 75.28 | 71.39 | 45.56 | 64.08 | |
| Qwen3-4BBase Model=Qwen3-4B, Training Strategy=Base2026.06 | 74.44 | 65.28 | 42.22 | 60.65 | |
| Qwen3-8BBase Model=Qwen3-8B, Training Strategy=Base2026.06 | 74.17 | 71.67 | 44.72 | 63.52 | |
| Qwen3-4B w/ GRPOBase Model=Qwen3-4B, Training Strategy=GRPO2026.06 | 73.89 | 67.78 | 42.22 | 61.3 | |
| Qwen3-1.7B w/ OPSD+ReNIOBase Model=Qwen3-1.7B, Training Strategy=OPSD+ReNIO2026.06 | 57.78 | 42.78 | 27.78 | 42.78 | |
| R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Strategy=Base2026.06 | 56.11 | 40.83 | 25.56 | 40.83 | |
| R1-Distill-Qwen-7B w/ OPSD+ReNIOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Strategy=OPSD+ReNIO2026.06 | 55.83 | 42.78 | 26.11 | 41.57 | |
| R1-Distill-Qwen-7B w/ OPSDBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Strategy=OPSD2026.06 | 55.56 | 38.89 | 24.61 | 39.69 | |
| R1-Distill-Qwen-7B w/ GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Strategy=GRPO2026.06 | 54.17 | 40.83 | 24.17 | 39.72 | |
| Qwen3-1.7B w/ OPSDBase Model=Qwen3-1.7B, Training Strategy=OPSD2026.06 | 53.06 | 41.94 | 27.5 | 40.83 | |
| Qwen3-1.7BBase Model=Qwen3-1.7B, Training Strategy=Base2026.06 | 51.33 | 36 | 23.33 | 36.89 | |
| Qwen3-1.7B w/ GRPOBase Model=Qwen3-1.7B, Training Strategy=GRPO2026.06 | 49.44 | 38.61 | 23.61 | 37.22 | |
| R1-Distill-Qwen-1.5B w/ GRPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B, Training Strategy=GRPO2026.06 | 31.67 | 24.17 | 13.89 | 23.24 | |
| R1-Distill-Qwen-1.5B w/ OPSD+ReNIOBase Model=DeepSeek-R1-Distill-Qwen-1.5B, Training Strategy=OPSD+ReNIO2026.06 | 28.61 | 24.44 | 15.28 | 22.78 | |
| R1-Distill-Qwen-1.5BBase Model=DeepSeek-R1-Distill-Qwen-1.5B, Training Strategy=Base2026.06 | 27.78 | 22.78 | 14.44 | 21.67 | |
| R1-Distill-Qwen-1.5B w/ OPSDBase Model=DeepSeek-R1-Distill-Qwen-1.5B, Training Strategy=OPSD2026.06 | 26.66 | 23.89 | 13.06 | 21.2 |