Math Reasoning on AIME 2022–2024
9.27AccuracyGRPO + WeMask (TF)
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO + WeMask (TF)Setting=Training-free (TF)2026.05 | 9.27 | |
| GRPO + WeMask (TA)Setting=Training-aware (TA)2026.05 | 7.8 | |
| GRPO2026.05 | 7.4 | |
| Qwen3-4B2026.05 | 5.92 |
| Method | Links | |
|---|---|---|
| GRPO + WeMask (TF)Setting=Training-free (TF)2026.05 | 9.27 | |
| GRPO + WeMask (TA)Setting=Training-aware (TA)2026.05 | 7.8 | |
| GRPO2026.05 | 7.4 | |
| Qwen3-4B2026.05 | 5.92 |