Mathematical Reasoning on AIME 2025 (Pass@1 to Pass@5)
46.88Pass@1GRPO
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GRPOTraining Setting=Cold-start initialization, Base Model=Cold-start2026.06 | 46.88 | 57.08 | 60.42 | 63.12 | 64.79 | |
| TAPOTraining Setting=Cold-start initialization, Base Model=Cold-start2026.06 | 46.88 | 56.46 | 61.46 | 66.04 | 67.92 | |
| OPSDTraining Setting=Cold-start initialization, Base Model=Cold-start2026.06 | 43.33 | 53.75 | 59.58 | 62.29 | 64.17 | |
| OPSDTraining Setting=Direct training from Qwen3-8B-Instruct, Base Model=Qwen3-8B-Instruct2026.06 | 42.29 | 49.58 | 54.37 | 56.67 | 59.58 | |
| Qwen3-8B-Instruct w/ ThinkingTraining Setting=Direct training from Qwen3-8B-Instruct2026.06 | 42.08 | 46.67 | 49.38 | 51.46 | 53.12 | |
| GRPOTraining Setting=Direct training from Qwen3-8B-Instruct, Base Model=Qwen3-8B-Instruct2026.06 | 42.08 | 51.04 | 56.88 | 60.42 | 62.5 | |
| TAPOTraining Setting=Direct training from Qwen3-8B-Instruct, Base Model=Qwen3-8B-Instruct2026.06 | 41.25 | 49.58 | 54.37 | 57.5 | 59.17 | |
| Cold-startTraining Setting=Cold-start initialization2026.06 | 23.75 | 28.96 | 32.5 | 35.42 | 37.08 | |
| Qwen3-8B-InstructTraining Setting=Direct training from Qwen3-8B-Instruct2026.06 | 18.54 | 25.21 | 27.5 | 30 | 32.71 |