General Reasoning on MMLU-Pro (Accuracy, Avg.)
58.8AccuracyHIPPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HIPPOCategory=Ours2026.06 | 58.8 | 55.5 | |
| PREF-GRPOCategory=Reward-Shaping2026.06 | 56.8 | 53.4 | |
| SP3FCategory=Reward-Shaping2026.06 | 56.1 | 52.5 | |
| PRM RLCategory=Reward-Shaping2026.06 | 56 | 52.8 | |
| Qwen2.5-7B + RLTraining=Standard Training2026.06 | 55.4 | 54 | |
| Qwen2.5-7B + SFTTraining=Standard Training2026.06 | 53 | 50.8 | |
| QuestABackbone=Qwen2.5-7B-Base2025.10 | 51 | — | |
| MENTORBackbone=Qwen2.5-7B-Base2025.10 | 50.2 | — | |
| LUFFYBackbone=Qwen2.5-7B-Base2025.10 | 49.7 | — | |
| On-policy RLBackbone=Qwen2.5-7B-Base2025.10 | 48 | — | |
| BaseBackbone=Qwen2.5-7B-Base2025.10 | 42.9 | — | |
| MENTORBackbone=LLaMa3.1-8B-Base2025.10 | 39.1 | — | |
| MENTORBackbone=Qwen2.5-3B-Base2025.10 | 36.8 | — | |
| On-policy RLBackbone=LLaMa3.1-8B-Base2025.10 | 35.7 | — | |
| LUFFYBackbone=LLaMa3.1-8B-Base2025.10 | 34.9 | — | |
| QuestABackbone=LLaMa3.1-8B-Base2025.10 | 33.9 | — | |
| Qwen2.5-7BTraining=Standard Training2026.06 | 33 | 25.1 | |
| QuestABackbone=Qwen2.5-3B-Base2025.10 | 30.9 | — | |
| LUFFYBackbone=Qwen2.5-3B-Base2025.10 | 30.8 | — | |
| On-policy RLBackbone=Qwen2.5-3B-Base2025.10 | 30.6 | — | |
| BaseBackbone=Qwen2.5-3B-Base2025.10 | 19.4 | — | |
| BaseBackbone=LLaMa3.1-8B-Base2025.10 | 0.1 | — |