Mathematical Reasoning on AMO decontaminated (Accuracy)
3.9AccuracyDAPO++
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPO++Backbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 3.9 | |
| DeepMath-103KBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 3.7 | |
| OpenR1-Math-220kBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 3.3 | |
| DeepMath-103KBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 3.2 | |
| DeepScaleRBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 2.9 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 2.8 | |
| DAPO-Math-17kBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 2.4 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 2 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 1.8 | |
| DAPO++Backbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 1.7 | |
| OpenR1-Math-220kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 1.4 | |
| Qwen3-1.7B-BaseBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 1.3 | |
| DAPO-Math-17kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 1.3 | |
| DeepScaleRBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 1 |