Mathematical Reasoning on AIME 2024 (Pass@1 to Pass@5)
63.12Pass@1TAPO
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| TAPOTraining Setting=Direct training from Qwen3-8B-Instruct, Base Model=Qwen3-8B-Instruct2026.06 | 63.12 | 71.25 | 74.79 | 76.46 | 77.08 | |
| TAPOTraining Setting=Cold-start initialization, Base Model=Cold-start2026.06 | 62.5 | 71.25 | 76.04 | 77.92 | 80.21 | |
| OPSDTraining Setting=Cold-start initialization, Base Model=Cold-start2026.06 | 57.71 | 65.42 | 70.21 | 75.62 | 78.12 | |
| Qwen3-8B-Instruct w/ ThinkingTraining Setting=Direct training from Qwen3-8B-Instruct2026.06 | 55.21 | 62.71 | 66.25 | 68.45 | 70.42 | |
| OPSDTraining Setting=Direct training from Qwen3-8B-Instruct, Base Model=Qwen3-8B-Instruct2026.06 | 54.58 | 63.75 | 69.58 | 72.71 | 75.83 | |
| GRPOTraining Setting=Direct training from Qwen3-8B-Instruct, Base Model=Qwen3-8B-Instruct2026.06 | 54.58 | 63.12 | 66.88 | 69.58 | 72.08 | |
| GRPOTraining Setting=Cold-start initialization, Base Model=Cold-start2026.06 | 52.92 | 62.92 | 70 | 72.5 | 74.58 | |
| Cold-startTraining Setting=Cold-start initialization2026.06 | 31.67 | 39.38 | 44.17 | 48.12 | 51.04 | |
| Qwen3-8B-InstructTraining Setting=Direct training from Qwen3-8B-Instruct2026.06 | 23.12 | 31.52 | 35 | 40 | 42.71 |