Mathematical Reasoning on MMLU Math&Logic (train)
39.2R-PSRSFT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SFTBackbone=R1-Llama-8B, Training Time=10m 21s2025.09 | 39.2 | 31.1 | 1,381.7 | 78.7 | |
| R1-Llama-8B (Base)Backbone=R1-Llama-8B2025.09 | 37.8 | 38.1 | 1,537.9 | 72.5 | |
| RL (GRPO)Backbone=R1-Llama-8B, Training Time=4h 6m 27s2025.09 | 25.9 | 26.2 | 1,854 | 86.9 | |
| FARLBackbone=R1-Llama-8B, Training Time=4h 26m 4s2025.09 | 19.7 | 23.4 | 1,914 | 89.1 |