Mathematical Reasoning on Competition-level Benchmarks Average
51.3Pass@1RL-D-DAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RL-D-DACModel=Qwen3-4B-Instruct-2507 (Deep), Reasoning Strategy=DAC, Training Phase=RL (Deep DAC setting)2026.02 | 51.3 | 81.6 | |
| RL-D-CoTModel=Qwen3-4B-Instruct-2507 (Deep), Reasoning Strategy=CoT, Training Phase=RL (Deep DAC setting)2026.02 | 49.9 | 76.9 | |
| RL-DACModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=DAC, Training Phase=RL2026.02 | 46.1 | 75.3 | |
| Init-CoTModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=CoT, Training Phase=Initial2026.02 | 42.7 | 72.1 | |
| Init-DACModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=DAC, Training Phase=Initial2026.02 | 40.2 | 71.9 | |
| RL-CoTModel=Qwen3-4B-Instruct-2507, Reasoning Strategy=CoT, Training Phase=RL2026.02 | 37.5 | 69 | |
| RL-DACModel=Qwen2.5-7B-Instruct, Reasoning Strategy=DAC, Training Phase=RL2026.02 | 10.4 | 30.4 | |
| RL-CoTModel=Qwen2.5-7B-Instruct, Reasoning Strategy=CoT, Training Phase=RL2026.02 | 8.2 | 27 | |
| Init-CoTModel=Qwen2.5-7B-Instruct, Reasoning Strategy=CoT, Training Phase=Initial2026.02 | 5.6 | 24.1 | |
| Init-DACModel=Qwen2.5-7B-Instruct, Reasoning Strategy=DAC, Training Phase=Initial2026.02 | 0.4 | 9.2 |