Mathematical Reasoning on Minerva decontaminated (Accuracy)
37.1AccuracyDAPO++
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPO++Backbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 37.1 | |
| DAPO-Math-17kBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 36.7 | |
| OpenR1-Math-220kBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 35.7 | |
| DeepScaleRBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 34.7 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 34.5 | |
| DeepMath-103KBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 31.9 | |
| DeepMath-103KBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 26.5 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 25.6 | |
| DeepScaleRBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 23.3 | |
| OpenR1-Math-220kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 23.1 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 22.8 | |
| DAPO-Math-17kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 22.6 | |
| DAPO++Backbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 21.9 | |
| Qwen3-1.7B-BaseBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 15.3 |