Mathematical Reasoning on DeepScaleR
62.1AccuracyHIPPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HIPPOTraining Data=DeepScaleR2026.06 | 62.1 | — | |
| HIPPOCategory=Ours2026.06 | 46.2 | 55.5 | |
| SP3FCategory=Reward-Shaping2026.06 | 46 | 52.5 | |
| PRM RLCategory=Reward-Shaping2026.06 | 45.5 | 52.8 | |
| Qwen2.5-7B + RLTraining=Standard Training2026.06 | 45.2 | 54 | |
| PREF-GRPOCategory=Reward-Shaping2026.06 | 42.2 | 53.4 | |
| SCASModel=Qwen2.5-7B2026.05 | 41.97 | — | |
| Qwen3-4B + SFTTraining Data=DeepScaleR2026.06 | 39.5 | — | |
| GRACEModel=Qwen2.5-7B2026.05 | 38.97 | — | |
| Qwen2.5-7B + SFTTraining=Standard Training2026.06 | 38.8 | 50.8 | |
| InfluenceModel=Qwen2.5-7B2026.05 | 34.5 | — | |
| SCASModel=Qwen2.5-3B2026.05 | 33.2 | — | |
| RSRModel=Qwen2.5-7B2026.05 | 30.2 | — | |
| GRACEModel=Qwen2.5-3B2026.05 | 28.4 | — | |
| InfluenceModel=Qwen2.5-3B2026.05 | 27.83 | — | |
| RouterModel=Qwen2.5-7B2026.05 | 27.47 | — | |
| Qwen3-4BTraining Data=DeepScaleR2026.06 | 27.2 | — | |
| IFDModel=Qwen2.5-3B2026.05 | 26.8 | — | |
| RSR-ItemModel=Qwen2.5-7B2026.05 | 24.37 | — | |
| RouterModel=Qwen2.5-3B2026.05 | 22.33 | — | |
| RSRModel=Qwen2.5-3B2026.05 | 21.53 | — | |
| RSR-ItemModel=Qwen2.5-3B2026.05 | 20.07 | — | |
| PPLModel=Qwen2.5-3B2026.05 | 19.4 | — | |
| PPLModel=Qwen2.5-7B2026.05 | 18.03 | — | |
| IFDModel=Qwen2.5-7B2026.05 | 17.73 | — | |
| SCASModel=Qwen2.5-0.5B2026.05 | 10.1 | — | |
| Qwen2.5-7BTraining=Standard Training2026.06 | 10.1 | 25.1 | |
| InfluenceModel=Qwen2.5-0.5B2026.05 | 8.77 | — | |
| RSRModel=Qwen2.5-0.5B2026.05 | 7.13 | — | |
| RouterModel=Qwen2.5-0.5B2026.05 | 6.63 | — | |
| GRACEModel=Qwen2.5-0.5B2026.05 | 5.67 | — | |
| IFDModel=Qwen2.5-0.5B2026.05 | 5.23 | — | |
| RSR-ItemModel=Qwen2.5-0.5B2026.05 | 4.53 | — | |
| PPLModel=Qwen2.5-0.5B2026.05 | 4.1 | — |