Scientific Reasoning & QA on Science & QA Domain Multiple Datasets
4.04Average AccuracyDVPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DVPOTraining Domain=Math Domain2025.12 | 4.04 | |
| Reinforce++Training Domain=Math Domain2025.12 | 3.72 | |
| Dr.GRPOTraining Domain=Math Domain2025.12 | 3.55 | |
| GRPOTraining Domain=Math Domain2025.12 | 3.3 | |
| Robust BellmanTraining Domain=Math Domain2025.12 | 3.22 | |
| PPOTraining Domain=Math Domain2025.12 | 3.16 | |
| BaseTraining Domain=Math Domain2025.12 | 2.96 |