Scientific Reasoning & QA on SampleQA
3.31AccuracyDVPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DVPOTraining Domain=Math Domain2025.12 | 3.31 | |
| Reinforce++Training Domain=Math Domain2025.12 | 3.19 | |
| Dr.GRPOTraining Domain=Math Domain2025.12 | 3.1 | |
| GRPOTraining Domain=Math Domain2025.12 | 2.91 | |
| BaseTraining Domain=Math Domain2025.12 | 2.89 | |
| PPOTraining Domain=Math Domain2025.12 | 2.7 | |
| Robust BellmanTraining Domain=Math Domain2025.12 | 2.61 |