General Reasoning on TheoremQA (Accuracy, Avg.)
44.1AccuracyHIPPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HIPPOCategory=Ours2026.06 | 44.1 | 55.5 | |
| Qwen2.5-7B + RLTraining=Standard Training2026.06 | 42.4 | 54 | |
| PREF-GRPOCategory=Reward-Shaping2026.06 | 40.7 | 53.4 | |
| PRM RLCategory=Reward-Shaping2026.06 | 40.1 | 52.8 | |
| Qwen2.5-7B + SFTTraining=Standard Training2026.06 | 39.6 | 50.8 | |
| SP3FCategory=Reward-Shaping2026.06 | 38.2 | 52.5 | |
| Qwen2.5-7BTraining=Standard Training2026.06 | 28.3 | 25.1 |