Mathematical Reasoning on MATH 500 (Accuracy, Avg Token Length)
89.7AccuracyCLSR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CLSRBackbone=Qwen3-8B, T (number of rounds)=32026.06 | 89.7 | 417 | |
| P2SBackbone=Qwen3-8B2026.06 | 88.9 | 1,205 | |
| PALBackbone=Qwen3-8B2026.06 | 88.6 | 422 | |
| PBrdBackbone=Qwen3-8B2026.06 | 88.4 | 843 | |
| PoTBackbone=Qwen3-8B2026.06 | 88.1 | 375 | |
| CoTBackbone=Qwen3-8B2026.06 | 87.8 | 905 | |
| Qwen3-14B + GRPOBackbone=Qwen3-14B, Training=GRPO2026.05 | 87.1 | 2,978 | |
| CLSRBackbone=Qwen3-8B2026.06 | 86.8 | 257 | |
| Qwen3-14B + SLATBackbone=Qwen3-14B, Training=SLAT2026.05 | 86.2 | 901 | |
| CLSRBackbone=Qwen3-8B, T (number of rounds)=12026.06 | 86.2 | 134 | |
| HIPPOCategory=Ours2026.06 | 69.3 | 55.5 | |
| PREF-GRPOCategory=Reward-Shaping2026.06 | 68.3 | 53.4 | |
| Qwen2.5-7B + RLTraining=Standard Training2026.06 | 68.2 | 54 | |
| SP3FCategory=Reward-Shaping2026.06 | 68 | 52.5 | |
| Qwen2.5-7B + SFTTraining=Standard Training2026.06 | 67.2 | 50.8 | |
| PRM RLCategory=Reward-Shaping2026.06 | 66.2 | 52.8 | |
| Qwen3-14BBackbone=Qwen3-14B2026.05 | 65.1 | 655 | |
| Qwen2.5-7BTraining=Standard Training2026.06 | 12.1 | 25.1 |