Mathematical Reasoning on AIME 2025 (Mean@32)
16.51Mean Score (32 Samples)Qwen2.5-Math-7B + Resample w/ LOPE (w/ Training Signal Shaping)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-Math-7B + Resample w/ LOPE (w/ Training Signal Shaping)Model=Qwen2.5-Math-7B, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=true2026.05 | 16.51 | |
| Qwen3-4B-Base + Resample w/ LOPE (w/ Training Signal Shaping)Model=Qwen3-4B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=true2026.05 | 16.27 | |
| Qwen3-4B-Base + Resample w/ LOPE (w/o Training Signal Shaping)Model=Qwen3-4B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=false2026.05 | 13.85 | |
| Qwen3-4B-Base + GRPOModel=Qwen3-4B-Base, Optimization Method=GRPO2026.05 | 13.12 | |
| Qwen3-4B-Base + Resample w/ Naive PromptModel=Qwen3-4B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=Naive Prompt2026.05 | 11.67 | |
| Qwen2.5-Math-7B + Resample w/ LOPE (w/o Training Signal Shaping)Model=Qwen2.5-Math-7B, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=false2026.05 | 10.52 | |
| Qwen2.5-Math-7B + GRPOModel=Qwen2.5-Math-7B, Optimization Method=GRPO2026.05 | 9.9 | |
| Qwen2.5-Math-7B + Resample w/ Naive PromptModel=Qwen2.5-Math-7B, Optimization Method=GRPO + Resample, Prompt Strategy=Naive Prompt2026.05 | 9.17 | |
| Qwen2.5-Math-7BModel=Qwen2.5-Math-7B, Optimization Method=Base2026.05 | 7.9 | |
| Qwen3-4B-BaseModel=Qwen3-4B-Base, Optimization Method=Base2026.05 | 7.24 | |
| Qwen3-1.7B-Base + Resample w/ LOPE (w/o Training Signal Shaping)Model=Qwen3-1.7B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=false2026.05 | 5.83 | |
| Qwen3-1.7B-Base + Resample w/ LOPE (w/ Training Signal Shaping)Model=Qwen3-1.7B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=true2026.05 | 5.73 | |
| Qwen3-1.7B-Base + Resample w/ Naive PromptModel=Qwen3-1.7B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=Naive Prompt2026.05 | 4.58 | |
| Qwen3-1.7B-Base + GRPOModel=Qwen3-1.7B-Base, Optimization Method=GRPO2026.05 | 4.47 | |
| Qwen3-1.7B-BaseModel=Qwen3-1.7B-Base, Optimization Method=Base2026.05 | 2 |