Mathematical Reasoning on AIME 24 (pass@4)
60Pass@4Hybrid-LoRA
Evaluation Results
| Method | Links | |
|---|---|---|
| Hybrid-LoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GSPO, #Tunable Params=449M2026.05 | 60 | |
| Hybrid-LoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GRPO, #Tunable Params=449M2026.05 | 56 | |
| AutoLoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GSPO, #Tunable Params=453M2026.05 | 55.3 | |
| AutoLoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GRPO, #Tunable Params=453M2026.05 | 52.7 | |
| Full-FT (ref.)Backbone=Qwen-2.5 3B Instruct, Post-training Approach=GSPO, #Tunable Params=3086M2026.05 | 49.3 | |
| Hybrid-LoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GSPO, #Tunable Params=192M2026.05 | 48 | |
| Full-FT (ref.)Backbone=Qwen-2.5 3B Instruct, Post-training Approach=GRPO, #Tunable Params=3086M2026.05 | 46 | |
| AutoLoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GSPO, #Tunable Params=194M2026.05 | 44 | |
| Hybrid-LoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GRPO, #Tunable Params=192M2026.05 | 43.3 | |
| Full-FT (ref.)Backbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=1544M2026.05 | 42 | |
| Hybrid-LoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=105M2026.05 | 42 | |
| AutoLoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GRPO, #Tunable Params=201M2026.05 | 40.7 | |
| Full-FT (ref.)Backbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=1544M2026.05 | 40 | |
| LoRA-DropBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=105M2026.05 | 40 | |
| Hybrid-LoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=105M2026.05 | 38 | |
| AdaLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=106M2026.05 | 36 | |
| AutoLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=107M2026.05 | 35.3 | |
| AutoLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=106M2026.05 | 34.7 | |
| LoRA-DropBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=105M2026.05 | 34 | |
| LoRA-FFNBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=122M2026.05 | 34 | |
| AdaLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=105M2026.05 | 32 | |
| CoTBackbone=Qwen-2.5 3B Instruct, Post-training Approach=-, #Tunable Params=0.02026.05 | 24 | |
| Full-FTBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=SFT, #Tunable Params=1544M2026.05 | 22.7 | |
| COTBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=COT, #Tunable Params=0.02026.05 | 14.7 | |
| IOBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=IO, #Tunable Params=0.02026.05 | 3.3 |