Mathematical Reasoning on Math500 decontaminated (Accuracy)
77.8AccuracyDAPO-Math-17k
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPO-Math-17kBackbone=Qwen3-8B, RLVR Training Data=DAPO-Math-17k, Sampling Strategy=Mean@42026.05 | 77.8 | |
| DAPO++Backbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 77.7 | |
| DeepScaleRBackbone=Qwen3-8B, RLVR Training Data=DeepScaleR, Sampling Strategy=Mean@42026.05 | 75.9 | |
| DeepMath-103KBackbone=Qwen3-8B, RLVR Training Data=DeepMath-103K, Sampling Strategy=Mean@42026.05 | 73.4 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-8B, RLVR Training Data=Skywork-OR1-RL-Data, Sampling Strategy=Mean@42026.05 | 73.2 | |
| OpenR1-Math-220kBackbone=Qwen3-8B, RLVR Training Data=OpenR1-Math-220k, Sampling Strategy=Mean@42026.05 | 73.1 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 61.6 | |
| DAPO++Backbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 60 | |
| OpenR1-Math-220kBackbone=Qwen3-1.7B, RLVR Training Data=OpenR1-Math-220k, Sampling Strategy=Mean@42026.05 | 58.9 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-1.7B, RLVR Training Data=Skywork-OR1-RL-Data, Sampling Strategy=Mean@42026.05 | 58.8 | |
| DAPO-Math-17kBackbone=Qwen3-1.7B, RLVR Training Data=DAPO-Math-17k, Sampling Strategy=Mean@42026.05 | 58.5 | |
| DeepScaleRBackbone=Qwen3-1.7B, RLVR Training Data=DeepScaleR, Sampling Strategy=Mean@42026.05 | 58.1 | |
| DeepMath-103KBackbone=Qwen3-1.7B, RLVR Training Data=DeepMath-103K, Sampling Strategy=Mean@42026.05 | 57.9 | |
| Qwen3-1.7B-BaseBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 48.4 |