Mathematical Reasoning on AMC 2022-2024
37.93AccuracyGRPO + RSI-S
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GRPO + RSI-SModel=Qwen2.5-3B, Evaluation Protocol=avg@322026.06 | 37.93 | 926.96 | 5.95 | -171.74 | |
| GRPO + PBModel=Qwen2.5-3B, Evaluation Protocol=avg@322026.06 | 33.02 | 854.23 | — | — | |
| GRPOModel=Qwen2.5-3B, Evaluation Protocol=avg@322026.06 | 31.98 | 1,098.7 | — | — | |
| GRPO + EBModel=Qwen2.5-3B, Evaluation Protocol=avg@322026.06 | 31.88 | 1,030.31 | — | — | |
| GRPO + RSI-SBackbone=Qwen2.5-1.5B, Evaluation Protocol=avg@322026.06 | 26.04 | 917.96 | 4.09 | -79.45 | |
| GRPOBackbone=Qwen2.5-1.5B, Evaluation Protocol=avg@322026.06 | 21.95 | 997.41 | — | — | |
| GRPO + PBBackbone=Qwen2.5-1.5B, Evaluation Protocol=avg@322026.06 | 21.54 | 913.13 | — | — | |
| GRPO + EBBackbone=Qwen2.5-1.5B, Evaluation Protocol=avg@322026.06 | 21.06 | 994.19 | — | — |