Mathematical Reasoning on Beyond-AIME (Pass@1, Pass@32)
38.9Pass@1RL-D-CoT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RL-D-CoTModel=Qwen3-4B-Instruct-2507 (Deep), Reasoning Strategy=CoT, Training Phase=RL (Deep DAC setting)2026.02 | 38.9 | 69.5 | |
| RL-D-DACModel=Qwen3-4B-Instruct-2507 (Deep), Reasoning Strategy=DAC, Training Phase=RL (Deep DAC setting)2026.02 | 38.8 | 70.7 | |
| RL-DACModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=DAC, Training Phase=RL2026.02 | 34.6 | 67.9 | |
| Init-CoTModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=CoT, Training Phase=Initial2026.02 | 32.1 | 65 | |
| RL-CoTModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=CoT, Training Phase=RL2026.02 | 30.4 | 58.1 | |
| Init-DACModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=DAC, Training Phase=Initial2026.02 | 29.6 | 61 | |
| RL-DACModel=Qwen2.5-7B-Instruct, Reasoning Strategy=DAC, Training Phase=RL2026.02 | 7 | 27.4 | |
| RL-CoTModel=Qwen2.5-7B-Instruct, Reasoning Strategy=CoT, Training Phase=RL2026.02 | 5.1 | 25.5 | |
| Init-CoTModel=Qwen2.5-7B-Instruct, Reasoning Strategy=CoT, Training Phase=Initial2026.02 | 3.8 | 23 | |
| Init-DACModel=Qwen2.5-7B-Instruct, Reasoning Strategy=DAC, Training Phase=Initial2026.02 | 0.7 | 10 |