Reasoning Robustness on Mathematical Reasoning Perturbation Experiments
76.2Robustness Perturbation Success Rate (R-PSR)R1-Qwen-7B (Base)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| R1-Qwen-7B (Base)Training Time=/2025.09 | 76.2 | 5.9 | |
| SFTTraining Time=9m 36s2025.09 | 73.5 | 7.3 | |
| RL (GRPO)Training Time=4h 09m 35s2025.09 | 35.6 | 23.1 | |
| FARLTraining Time=4h 22m 53s2025.09 | 29.5 | 20.1 |