Mathematical Reasoning on Olympiad decontaminated (Accuracy)
43.5AccuracyDAPO++
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPO++Backbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 43.5 | |
| DAPO-Math-17kBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 43 | |
| DeepMath-103KBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 39.2 | |
| DeepScaleRBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 38.8 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 37.8 | |
| OpenR1-Math-220kBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 37 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 27.9 | |
| DAPO++Backbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 24.9 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 24.7 | |
| OpenR1-Math-220kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 24 | |
| DeepScaleRBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 23.7 | |
| DeepMath-103KBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 23.1 | |
| DAPO-Math-17kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 22.9 | |
| Qwen3-1.7B-BaseBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 17.6 |