Mathematical Reasoning on Apex Shortlist
28.22pass@8InT + RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| InT + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=28.832026.01 | 28.22 | 33.72 | |
| SFT on self-reflections + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=23.192026.01 | 23.93 | 27.6 | |
| RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=13.472026.01 | 22.72 | 28.26 | |
| Hint-guided RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=23.062026.01 | 22.23 | 28.56 | |
| BaseBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=5.532026.01 | 20.79 | 21.17 | |
| SFT on ref. solutions + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=19.072026.01 | 20.51 | 20.76 |