Math Reasoning on AIME 2024-2026
0.1125Accuracy (avg@32)GRPO + RSI-S
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GRPO + RSI-SBackbone=Qwen2.5-7B2026.06 | 0.1125 | 969.56 | 0.56 | -345.24 | |
| GRPOBackbone=Qwen2.5-7B2026.06 | 0.1069 | 1,314.8 | — | — | |
| GRPO + PBBackbone=Qwen2.5-7B2026.06 | 0.1056 | 1,124.84 | — | — | |
| GRPO + EBBackbone=Qwen2.5-7B2026.06 | 0.0997 | 1,277.61 | — | — |