Mathematical Reasoning on 6 Math Reasoning Benchmarks Average
21.83AccuracyGRPO + RSI-S
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GRPO + RSI-SModel=Qwen2.5-3B, Evaluation Protocol=avg@322026.06 | 21.83 | 1,022.12 | 3.3 | -182.86 | |
| GRPOModel=Qwen2.5-3B, Evaluation Protocol=avg@322026.06 | 18.53 | 1,204.98 | — | — | |
| GRPO + PBModel=Qwen2.5-3B, Evaluation Protocol=avg@322026.06 | 18.32 | 922.82 | — | — | |
| GRPO + EBModel=Qwen2.5-3B, Evaluation Protocol=avg@322026.06 | 17.86 | 1,119.59 | — | — | |
| GRPO + RSI-SBackbone=Qwen2.5-1.5B, Evaluation Protocol=avg@322026.06 | 14.25 | 1,000.33 | 2.1 | -108.7 | |
| GRPOBackbone=Qwen2.5-1.5B, Evaluation Protocol=avg@322026.06 | 12.15 | 1,109.03 | — | — | |
| GRPO + PBBackbone=Qwen2.5-1.5B, Evaluation Protocol=avg@322026.06 | 11.83 | 998.61 | — | — | |
| GRPO + EBBackbone=Qwen2.5-1.5B, Evaluation Protocol=avg@322026.06 | 11.64 | 1,066.12 | — | — |