Mathematical Reasoning on AMC 23 LLaMA 3.1-8B-Instruct (test)
27.5AccuracyGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPOBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 27.5 | |
| VRPOBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 27.5 | |
| PPOBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 25 | |
| BaseBackbone=LLaMA 3.1-8B-Instruct, Optimization Setting=test-time optimization, Reward Supervision=noisy rule-based2025.08 | 24.17 |