Mathematical Reasoning on CARP-EN
0.651Average@2CoVRL
Evaluation Results
| Method | Links | |
|---|---|---|
| CoVRLBackbone=Qwen2.5-7B-Base2025.12 | 0.651 | |
| JLBBackbone=Qwen2.5-7B-Base, Algorithm=GRPO2025.12 | 0.634 | |
| RAVRBackbone=Qwen2.5-7B-Base, Algorithm=GRPO2025.12 | 0.632 | |
| RLPRBackbone=Qwen2.5-7B-Base, Algorithm=GRPO2025.12 | 0.629 | |
| VeriFreeBackbone=Qwen2.5-7B-Base, Algorithm=GRPO2025.12 | 0.628 | |
| HIPPOCategory=Ours2026.06 | 0.593 | |
| PREF-GRPOCategory=Reward-Shaping2026.06 | 0.589 | |
| Qwen2.5-7B + RLTraining=Standard Training2026.06 | 0.587 | |
| HIPPOTraining Data=DeepScaleR2026.06 | 0.574 | |
| PRM RLCategory=Reward-Shaping2026.06 | 0.561 | |
| Qwen2.5-7B + SFTTraining=Standard Training2026.06 | 0.556 | |
| Base ModelBackbone=Qwen2.5-7B-Base2025.12 | 0.543 | |
| SP3FCategory=Reward-Shaping2026.06 | 0.541 | |
| LaTROBackbone=Qwen2.5-7B-Base, Algorithm=GRPO2025.12 | 0.505 | |
| Qwen3-4B + SFTTraining Data=DeepScaleR2026.06 | 0.481 | |
| Qwen3-4BTraining Data=DeepScaleR2026.06 | 0.462 | |
| Qwen2.5-7BTraining=Standard Training2026.06 | 0.419 |