Mathematical Reasoning on AIME 2024 (Pass@1 and Pass@32)
66.3Pass@1RL-D-DAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RL-D-DACModel=Qwen3-4B-Instruct-2507 (Deep), Reasoning Strategy=DAC, Training Phase=RL (Deep DAC setting)2026.02 | 66.3 | 91.6 | |
| RL-D-CoTModel=Qwen3-4B-Instruct-2507 (Deep), Reasoning Strategy=CoT, Training Phase=RL (Deep DAC setting)2026.02 | 64.4 | 84.8 | |
| RL-DACModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=DAC, Training Phase=RL2026.02 | 63.9 | 87.7 | |
| Init-CoTModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=CoT, Training Phase=Initial2026.02 | 62.6 | 90 | |
| Init-DACModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=DAC, Training Phase=Initial2026.02 | 59.6 | 90 | |
| RL-CoTModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=CoT, Training Phase=RL2026.02 | 45.9 | 85.8 | |
| RL-DACModel=Qwen2.5-7B-Instruct, Reasoning Strategy=DAC, Training Phase=RL2026.02 | 15.5 | 39.1 | |
| RL-CoTModel=Qwen2.5-7B-Instruct, Reasoning Strategy=CoT, Training Phase=RL2026.02 | 13.5 | 34.5 | |
| Init-CoTModel=Qwen2.5-7B-Instruct, Reasoning Strategy=CoT, Training Phase=Initial2026.02 | 9.8 | 26.7 | |
| Init-DACModel=Qwen2.5-7B-Instruct, Reasoning Strategy=DAC, Training Phase=Initial2026.02 | 0.5 | 13.3 |