Mathematical Reasoning on IMO-AnswerBench (pass@1, Average)
25.62Pass@1InT + RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| InT + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=28.832026.01 | 25.62 | 33.72 | |
| RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=13.472026.01 | 23.46 | 28.26 | |
| Hint-guided RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=23.062026.01 | 16.89 | 28.56 | |
| SFT on self-reflections + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=23.192026.01 | 15.53 | 27.6 | |
| BaseBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=5.532026.01 | 11.68 | 21.17 | |
| SFT on ref. solutions + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=19.072026.01 | 11.56 | 20.76 |