Mathematical Reasoning on AIME24 (pass@1, standard deviation)
7.7Pass@1 AccuracyUniR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UniRBackbone=Qwen2.5-3B, Trained Model=1.5B, Zero-shot=true, Temperature=0.62025.05 | 7.7 | — | |
| UniRBackbone=Llama3.2-3B, Trained Model=1B, Zero-shot=true, Temperature=0.62025.05 | 7.3 | — | |
| Backbone onlyBackbone=Qwen2.5-3B, Zero-shot=true, Temperature=0.62025.05 | 6.3 | — | |
| GRPO LoRABackbone=Llama3.2-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 6 | — | |
| GRPO LoRABackbone=Qwen2.5-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 5.7 | — | |
| Backbone + 1BBackbone=Llama3.2-3B, Zero-shot=true, Temperature=0.62025.05 | 5 | — | |
| GRPO FullBackbone=Llama3.2-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 5 | — | |
| GRPO FullBackbone=Qwen2.5-3B, Trained Model=3B, Zero-shot=true, Temperature=0.62025.05 | 4.7 | — | |
| Backbone + 1.5BBackbone=Qwen2.5-3B, Zero-shot=true, Temperature=0.62025.05 | 4 | — | |
| Backbone onlyBackbone=Llama3.2-3B, Zero-shot=true, Temperature=0.62025.05 | 3.7 | — |