Mathematical Reasoning on GSM8K (pass@1, standard deviation)
88.2Accuracy (pass@1)DeepSeekMath-7B-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DeepSeekMath-7B-RLTrained Model=7B, Zero-shot=true, Temperature=0.62025.05 | 88.2 | — | |
| Mathstral-7B-v0.1Trained Model=7B, Zero-shot=true, Temperature=0.62025.05 | 84.9 | — | |
| UniRBackbone=Qwen2.5-3B, Trained Model=1.5B, Zero-shot=true, Temperature=0.62025.05 | 84.5 | — | |
| Internlm2-math-plus-7BTrained Model=7B, Zero-shot=true, Temperature=0.62025.05 | 84 | — | |
| GRPO FullBackbone=Qwen2.5-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 81.3 | — | |
| UniRBackbone=Llama3.2-3B, Trained Model=1B, Zero-shot=true, Temperature=0.62025.05 | 77.5 | — | |
| Backbone + 1.5BBackbone=Qwen2.5-3B, Zero-shot=true, Temperature=0.62025.05 | 75.6 | — | |
| NuminaMath-7B-CoTTrained Model=7B, Zero-shot=true, Temperature=0.62025.05 | 75.4 | — | |
| GRPO LoRABackbone=Qwen2.5-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 75 | — | |
| Backbone onlyBackbone=Qwen2.5-3B, Zero-shot=true, Temperature=0.62025.05 | 74.4 | — | |
| GRPO LoRABackbone=Llama3.2-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 65.8 | — | |
| Backbone onlyBackbone=Llama3.2-3B, Zero-shot=true, Temperature=0.62025.05 | 65.6 | — | |
| GRPO FullBackbone=Llama3.2-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 65.1 | — | |
| Backbone + 1BBackbone=Llama3.2-3B, Zero-shot=true, Temperature=0.62025.05 | 63.8 | — |