Knowledge Reasoning on HLE
4.45AccuracyVRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| VRPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 4.45 | |
| VRPOBase Model=Qwen2.5-7B-Cold Start2025.08 | 3.94 | |
| VRPOBase Model=Qwen3-8B2025.08 | 3.89 | |
| GRPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 3.8 | |
| λ-GRPOBase Model=Qwen3-8B2025.08 | 3.57 | |
| PPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 3.56 | |
| λ-GRPOBase Model=Qwen2.5-7B-Cold Start2025.08 | 3.34 | |
| BaseBase Model=Qwen2.5-7B-Cold Start2025.08 | 3.29 | |
| KTAEBase Model=Qwen2.5-7B-Cold Start2025.08 | 3.24 | |
| BaseBase Model=Qwen3-8B2025.08 | 2.89 | |
| KTAEBase Model=Qwen3-8B2025.08 | 2.64 | |
| Cold StartOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 2.55 |