Mathematical Reasoning on Minerva Math LLaMA 3.1-8B-Instruct (test)
18.01AccuracyPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPOBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 18.01 | |
| VRPOBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 17.65 | |
| BaseBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 17.28 | |
| GRPOBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 16.18 |