Mathematical Reasoning on AIME 2025 (Pass@1, Pass@32)
61.5Pass@1RL-D-DAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RL-D-DACModel=Qwen3-4B-Instruct-2507 (Deep), Reasoning Strategy=DAC, Training Phase=RL (Deep DAC setting)2026.02 | 61.5 | 87.6 | |
| RL-D-CoTModel=Qwen3-4B-Instruct-2507 (Deep), Reasoning Strategy=CoT, Training Phase=RL (Deep DAC setting)2026.02 | 58.8 | 87.9 | |
| RL-DACModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=DAC, Training Phase=RL2026.02 | 54.2 | 78.8 | |
| RL-CoTModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=CoT, Training Phase=RL2026.02 | 52.1 | 77.4 | |
| Init-CoTModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=CoT, Training Phase=Initial2026.02 | 45.7 | 76.7 | |
| Init-DACModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=DAC, Training Phase=Initial2026.02 | 43.2 | 73.3 | |
| RL-DACModel=Qwen2.5-7B-Instruct, Reasoning Strategy=DAC, Training Phase=RL2026.02 | 15.5 | 34.2 | |
| RL-CoTModel=Qwen2.5-7B-Instruct, Reasoning Strategy=CoT, Training Phase=RL2026.02 | 11.4 | 30.8 | |
| Init-CoTModel=Qwen2.5-7B-Instruct, Reasoning Strategy=CoT, Training Phase=Initial2026.02 | 6.8 | 36.7 | |
| Init-DACModel=Qwen2.5-7B-Instruct, Reasoning Strategy=DAC, Training Phase=Initial2026.02 | 0.2 | 6.7 |