Mathematical Reasoning on AIME25 decontaminated (Accuracy)
22.6AccuracyDAPO++
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPO++Backbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 22.6 | |
| DAPO-Math-17kBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 21.5 | |
| DeepScaleRBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 17.1 | |
| DeepMath-103KBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 16.7 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 15.8 | |
| OpenR1-Math-220kBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 15.4 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 10.5 | |
| DeepScaleRBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 7.6 | |
| OpenR1-Math-220kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 6.3 | |
| DAPO-Math-17kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 5.9 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 4.6 | |
| DAPO++Backbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 3.3 | |
| DeepMath-103KBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 3.1 | |
| Qwen3-1.7B-BaseBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 2.3 |