Mathematical Reasoning on AMC23 decontaminated (Accuracy)
69.8AccuracyDAPO-Math-17k
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPO-Math-17kBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 69.8 | |
| DAPO++Backbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 69.3 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 64.1 | |
| OpenR1-Math-220kBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 63.2 | |
| DeepMath-103KBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 62.7 | |
| DeepScaleRBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 61.6 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=Mean@322026.05 | 48.6 | |
| DAPO++Backbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 41.9 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 40.9 | |
| DAPO-Math-17kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 39.5 | |
| DeepMath-103KBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 35.4 | |
| DeepScaleRBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 34.5 | |
| OpenR1-Math-220kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 31.6 | |
| Qwen3-1.7B-BaseBackbone=Qwen3-1.7B, Sampling Strategy=Mean@322026.05 | 28.2 |