Mathematical Reasoning on HLE decontaminated (Accuracy)
8.4AccuracyDeepMath-103K
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepMath-103KBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 8.4 | |
| DAPO++Backbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 6.8 | |
| DeepScaleRBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 6.3 | |
| Qwen3-1.7B-BaseBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 5.9 | |
| DAPO-Math-17kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 5.9 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 5.7 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 5.1 | |
| OpenR1-Math-220kBackbone=Qwen3-1.7B, Sampling Strategy=Mean@42026.05 | 4.7 | |
| DAPO++Backbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 4.7 | |
| DeepScaleRBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 4.5 | |
| DeepMath-103KBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 4.5 | |
| DAPO-Math-17kBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 4.1 | |
| OpenR1-Math-220kBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 3.9 | |
| Skywork-OR1-RL-DataBackbone=Qwen3-8B, Sampling Strategy=Mean@42026.05 | 3.1 |