Code Reasoning on LeetCodeDataset
74.5Pass@4Hybrid-LoRA
Evaluation Results
| Method | Links | |
|---|---|---|
| Hybrid-LoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GSPO, #Tunable Params=449M2026.05 | 74.5 | |
| Hybrid-LoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GRPO, #Tunable Params=449M2026.05 | 73.2 | |
| AutoLoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GSPO, #Tunable Params=453M2026.05 | 72.5 | |
| AutoLoRABackbone=Qwen-2.5 7B Instruct, Post-training Approach=GRPO, #Tunable Params=453M2026.05 | 71.5 | |
| Full-FT (ref.)Backbone=Qwen-2.5 3B Instruct, Post-training Approach=GSPO, #Tunable Params=3086M2026.05 | 65.1 | |
| Hybrid-LoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GSPO, #Tunable Params=192M2026.05 | 64 | |
| Full-FT (ref.)Backbone=Qwen-2.5 3B Instruct, Post-training Approach=GRPO, #Tunable Params=3086M2026.05 | 63.8 | |
| Hybrid-LoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GRPO, #Tunable Params=192M2026.05 | 62.7 | |
| AutoLoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GSPO, #Tunable Params=194M2026.05 | 62.6 | |
| AutoLoRABackbone=Qwen-2.5 3B Instruct, Post-training Approach=GRPO, #Tunable Params=201M2026.05 | 59.6 | |
| Full-FT (ref.)Backbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=1544M2026.05 | 49.1 | |
| Full-FT (ref.)Backbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=1544M2026.05 | 48.3 | |
| Hybrid-LoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=105M2026.05 | 48 | |
| Hybrid-LoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=105M2026.05 | 47.6 | |
| LoRA-DropBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=105M2026.05 | 46.3 | |
| AutoLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=106M2026.05 | 45.7 | |
| AdaLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GRPO, #Tunable Params=105M2026.05 | 45.4 | |
| AutoLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=107M2026.05 | 45.2 | |
| AdaLoRABackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=106M2026.05 | 44.8 | |
| LoRA-DropBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=105M2026.05 | 44.7 | |
| LoRA-FFNBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=GSPO, #Tunable Params=122M2026.05 | 44.5 | |
| Full-FTBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=SFT, #Tunable Params=1544M2026.05 | 40.6 | |
| CoTBackbone=Qwen-2.5 3B Instruct, Post-training Approach=-, #Tunable Params=0.02026.05 | 40.2 | |
| COTBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=COT, #Tunable Params=0.02026.05 | 14.6 | |
| IOBackbone=Qwen-2.5 1.5B Instruct, Post-training Approach=IO, #Tunable Params=0.02026.05 | 0 |