Mathematical Reasoning on OlympiadBench (pass@1, standard deviation)
28.2Pass@1 RateUniR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UniRBackbone=Qwen2.5-3B, Trained Model=1.5B, Zero-shot=true, Temperature=0.62025.05 | 28.2 | — | |
| GRPO FullBackbone=Qwen2.5-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 27.5 | — | |
| GRPO LoRABackbone=Qwen2.5-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 27.1 | — | |
| Backbone + 1.5BBackbone=Qwen2.5-3B, Zero-shot=true, Temperature=0.62025.05 | 25.1 | — | |
| Backbone onlyBackbone=Qwen2.5-3B, Zero-shot=true, Temperature=0.62025.05 | 24.6 | — | |
| Mathstral-7B-v0.1Trained Model=7B, Zero-shot=true, Temperature=0.62025.05 | 21.5 | — | |
| NuminaMath-7B-CoTTrained Model=7B, Zero-shot=true, Temperature=0.62025.05 | 19.9 | — | |
| DeepSeekMath-7B-RLTrained Model=7B, Zero-shot=true, Temperature=0.62025.05 | 19 | — | |
| Internlm2-math-plus-7BTrained Model=7B, Zero-shot=true, Temperature=0.62025.05 | 18.8 | — | |
| UniRBackbone=Llama3.2-3B, Trained Model=1B, Zero-shot=true, Temperature=0.62025.05 | 16.4 | — | |
| GRPO LoRABackbone=Llama3.2-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 11.9 | — | |
| Backbone + 1BBackbone=Llama3.2-3B, Zero-shot=true, Temperature=0.62025.05 | 9.9 | — | |
| GRPO FullBackbone=Llama3.2-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 9.4 | — | |
| Backbone onlyBackbone=Llama3.2-3B, Zero-shot=true, Temperature=0.62025.05 | 8.5 | — |