Mathematical Reasoning on MATH 500 LLaMA 3.1-8B-Instruct (test)
49.8AccuracyBase
Evaluation Results
| Method | Links | |
|---|---|---|
| BaseBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 49.8 | |
| VRPOBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 49.4 | |
| GRPOBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 49.2 | |
| PPOBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 46.2 |