Scientific Reasoning & QA on HLE
3.61AccuracyReinforce++
Evaluation Results
| Method | Links | |
|---|---|---|
| Reinforce++Training Domain=Math Domain2025.12 | 3.61 | |
| DVPOTraining Domain=Math Domain2025.12 | 3.57 | |
| Robust BellmanTraining Domain=Math Domain2025.12 | 3.43 | |
| PPOTraining Domain=Math Domain2025.12 | 3.34 | |
| Dr.GRPOTraining Domain=Math Domain2025.12 | 3.2 | |
| GRPOTraining Domain=Math Domain2025.12 | 3.01 | |
| BaseTraining Domain=Math Domain2025.12 | 2.89 |