Mathematical Reasoning on AIME22 @32 (test)
46.67AccuracyLoRA-RLPO
Evaluation Results
| Method | Links | |
|---|---|---|
| LoRA-RLPOB0 initialization=0, A0 initialization=V_{r}^T, training steps=500, learning rate decay=cosine2026.06 | 46.67 | |
| LoRAB0 initialization=0, A0 initialization=N(0, 1/n), training steps=500, learning rate decay=cosine2026.06 | 43.33 | |
| LoRA-RLMOB0 initialization=0, A0 initialization=V_{-r}^T, training steps=500, learning rate decay=cosine2026.06 | 42.22 | |
| MiLoRAB0 initialization=U_{-r}Σ_{-r}^{1/2}, A0 initialization=Σ_{-r}^{1/2}V_{-r}^T, training steps=500, learning rate decay=cosine2026.06 | 28.89 | |
| PiSSAB0 initialization=U_{r}Σ_{r}^{1/2}, A0 initialization=Σ_{r}^{1/2}V_{r}^T, training steps=500, learning rate decay=cosine2026.06 | 0 |