General Reasoning & QA on All Evaluated Datasets
39.7Average AccuracyDVPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DVPOTraining Domain=Math Domain2025.12 | 39.7 | |
| Dr.GRPOTraining Domain=Math Domain2025.12 | 36.75 | |
| Reinforce++Training Domain=Math Domain2025.12 | 36.65 | |
| Robust BellmanTraining Domain=Math Domain2025.12 | 35.98 | |
| GRPOTraining Domain=Math Domain2025.12 | 35.28 | |
| PPOTraining Domain=Math Domain2025.12 | 34.72 | |
| BaseTraining Domain=Math Domain2025.12 | 34.64 |