Mathematical Reasoning on GSM8K @1 (test)
76.42AccuracyLoRA-RLMO
Evaluation Results
| Method | Links | |
|---|---|---|
| LoRA-RLMOB0 initialization=0, A0 initialization=V_{-r}^T, training steps=500, learning rate decay=cosine2026.06 | 76.42 | |
| LoRAB0 initialization=0, A0 initialization=N(0, 1/n), training steps=500, learning rate decay=cosine2026.06 | 75.64 | |
| LoRA-RLPOB0 initialization=0, A0 initialization=V_{r}^T, training steps=500, learning rate decay=cosine2026.06 | 75.59 | |
| MiLoRAB0 initialization=U_{-r}Σ_{-r}^{1/2}, A0 initialization=Σ_{-r}^{1/2}V_{-r}^T, training steps=500, learning rate decay=cosine2026.06 | 75.41 | |
| PiSSAB0 initialization=U_{r}Σ_{r}^{1/2}, A0 initialization=Σ_{r}^{1/2}V_{r}^T, training steps=500, learning rate decay=cosine2026.06 | 9.65 |