Mathematical Reasoning on (AMC, Minerva, MATH, GSM8K, Olympiad, AIME24, AIME25)
56.46Overall Average ScoreR-Diverse
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| R-DiverseBackbone=Qwen3-8B-Base, Training Iterations=52026.02 | 56.46 | 66.02 | 66.18 | 82.2 | 94.39 | 49.78 | 12.19 | 24.48 | |
| Socratic-ZeroBackbone=Qwen3-8B-Base, Training Iterations=32026.02 | 56.1 | 63.7 | 52.4 | 81.2 | 87.3 | 55.1 | 24.6 | 28.4 | |
| R-Diverse*Backbone=Qwen3-8B-Base, Training Iterations=32026.02 | 55.4 | 59.3 | 63.24 | 80.6 | 94.31 | 49.19 | 17.71 | 23.44 | |
| R-ZeroBackbone=Qwen3-8B-Base, Training Iterations=32026.02 | 54.69 | 61.67 | 60.66 | 82 | 94.09 | 48.89 | 19.17 | 16.35 | |
| Absolute ZeroBackbone=Qwen3-8B-Base, Training Iterations=32026.02 | 52.68 | 57.89 | 57.9 | 76.6 | 92 | 47.8 | 18.2 | 18.4 | |
| R-DiverseBackbone=Qwen3-4B-Base, Training Iterations=52026.02 | 52.59 | 60.23 | 59.56 | 78.8 | 92.34 | 46.96 | 11.04 | 19.17 | |
| R-Diverse*Backbone=Qwen3-4B-Base, Training Iterations=32026.02 | 50.68 | 59.06 | 56.62 | 79 | 92.27 | 45.19 | 6.25 | 16.35 | |
| Base ModelBackbone=Qwen3-8B-Base2026.02 | 49.18 | 51.95 | 50 | 78 | 89.08 | 44.74 | 16.67 | 13.85 | |
| R-ZeroBackbone=Qwen3-4B-Base, Training Iterations=32026.02 | 49.07 | 57.27 | 52.94 | 79.6 | 92.12 | 44.59 | 4.27 | 12.71 | |
| SPIRALBackbone=Qwen3-4B-Base, Training Iterations=32026.02 | 47 | 57.5 | 42.4 | 76.4 | 91 | 38.4 | 10 | 13.3 | |
| Absolute ZeroBackbone=Qwen3-4B-Base, Training Iterations=32026.02 | 46.42 | 52.45 | 41.96 | 76.2 | 89.34 | 42.56 | 10.2 | 12.2 | |
| Base ModelBackbone=Qwen3-4B-Base2026.02 | 42.58 | 45.7 | 38.24 | 68.2 | 87.79 | 41.04 | 6.15 | 10.94 |