Mathematical Reasoning on AIME-25 (pass@4)
55.3Pass@4Hybrid-LoRA
Evaluation Results
| Method | Links | |
|---|---|---|
| Hybrid-LoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GSPO, #Tunable Params=449M2026.05 | 55.3 | |
| AutoLoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GSPO, #Tunable Params=453M2026.05 | 52.7 | |
| Hybrid-LoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GRPO, #Tunable Params=449M2026.05 | 52 | |
| AutoLoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GRPO, #Tunable Params=453M2026.05 | 48.7 | |
| Full-FT (ref.)Backbone=Qwen-2.5 3B Instruct, Post-training Approach=GSPO, #Tunable Params=3086M2026.05 | 47.3 | |
| Hybrid-LoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GSPO, #Tunable Params=192M2026.05 | 45.3 | |
| Full-FT (ref.)Backbone=Qwen-2.5 3B Instruct, Post-training Approach=GRPO, #Tunable Params=3086M2026.05 | 44 | |
| Hybrid-LoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GRPO, #Tunable Params=192M2026.05 | 42 | |
| AutoLoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GSPO, #Tunable Params=194M2026.05 | 40.7 | |
| AutoLoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GRPO, #Tunable Params=201M2026.05 | 38.7 | |
| Full-FT (ref.)Backbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=1544M2026.05 | 37.3 | |
| Full-FT (ref.)Backbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=1544M2026.05 | 36.7 | |
| Hybrid-LoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=105M2026.05 | 36.7 | |
| Hybrid-LoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=105M2026.05 | 35.3 | |
| LoRA-DropBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=105M2026.05 | 34 | |
| AdaLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=105M2026.05 | 33.3 | |
| AutoLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=107M2026.05 | 32.7 | |
| LoRA-DropBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=105M2026.05 | 32 | |
| AutoLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=106M2026.05 | 31.3 | |
| AdaLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=106M2026.05 | 31.3 | |
| LoRA-FFNBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=122M2026.05 | 30.7 | |
| Full-FTBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=SFT, #Tunable Params=1544M2026.05 | 21.3 | |
| CoTBackbone=Qwen-2.5 3B Instruct, Post-training Approach=-, #Tunable Params=0.02026.05 | 20.6 | |
| COTBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=COT, #Tunable Params=0.02026.05 | 10.7 | |
| IOBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=IO, #Tunable Params=0.02026.05 | 0 |