Mathematical Reasoning on AMO-Bench (pass@8, Average)
36.72Pass@8SFT on self-reflections + RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SFT on self-reflections + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=23.192026.01 | 36.72 | 27.6 | |
| InT + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=28.832026.01 | 36.16 | 33.72 | |
| SD-ZEROBase Model=Qwen3-4B-Instruct2026.04 | 36 | — | |
| RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=13.472026.01 | 35.21 | 28.26 | |
| Hint-guided RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=23.062026.01 | 33.34 | 28.56 | |
| Qwen3-4B-InstructBase Model=Qwen3-4B-Instruct2026.04 | 30 | — | |
| RFTBase Model=Qwen3-4B-Instruct2026.04 | 30 | — | |
| SD-ZEROBase Model=Olmo-3-7B-Instruct2026.04 | 30 | — | |
| GRPOBase Model=Qwen3-4B-Instruct2026.04 | 28 | — | |
| SRTBase Model=Qwen3-4B-Instruct2026.04 | 28 | — | |
| BaseBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=5.532026.01 | 26.24 | 21.17 | |
| SDFTBase Model=Qwen3-4B-Instruct2026.04 | 26 | — | |
| SFT on ref. solutions + RLBackbone=Qwen3-4B-Instruct-2507, Number of rollouts=128, Average train reward (D_train)=19.072026.01 | 25.19 | 20.76 | |
| RFTBase Model=Olmo-3-7B-Instruct2026.04 | 22 | — | |
| SDFTBase Model=Olmo-3-7B-Instruct2026.04 | 20 | — | |
| SRTBase Model=Olmo-3-7B-Instruct2026.04 | 20 | — | |
| SFTBase Model=Qwen3-4B-Instruct2026.04 | 18 | — | |
| SFTBase Model=Olmo-3-7B-Instruct2026.04 | 18 | — | |
| GRPOBase Model=Olmo-3-7B-Instruct2026.04 | 18 | — | |
| Olmo-3-7B-InstructBase Model=Olmo-3-7B-Instruct2026.04 | 16 | — |