Mathematical Reasoning on AIME 2024 (Mean@32)
19.9Mean Score (k=32)Qwen3-4B-Base + Resample w/ LOPE (w/ Training Signal Shaping)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-4B-Base + Resample w/ LOPE (w/ Training Signal Shaping)Model=Qwen3-4B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=true2026.05 | 19.9 | |
| Qwen2.5-Math-7B + Resample w/ LOPE (w/ Training Signal Shaping)Model=Qwen2.5-Math-7B, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=true2026.05 | 19.58 | |
| Qwen3-4B-Base + Resample w/ LOPE (w/o Training Signal Shaping)Model=Qwen3-4B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=false2026.05 | 19.01 | |
| Qwen2.5-Math-7B + GRPOModel=Qwen2.5-Math-7B, Optimization Method=GRPO2026.05 | 17.66 | |
| Qwen2.5-Math-7B + Resample w/ Naive PromptModel=Qwen2.5-Math-7B, Optimization Method=GRPO + Resample, Prompt Strategy=Naive Prompt2026.05 | 17.19 | |
| Qwen3-4B-Base + GRPOModel=Qwen3-4B-Base, Optimization Method=GRPO2026.05 | 16.41 | |
| Qwen2.5-Math-7B + Resample w/ LOPE (w/o Training Signal Shaping)Model=Qwen2.5-Math-7B, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=false2026.05 | 15.31 | |
| Qwen3-4B-Base + Resample w/ Naive PromptModel=Qwen3-4B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=Naive Prompt2026.05 | 14.9 | |
| Qwen2.5-Math-7BModel=Qwen2.5-Math-7B, Optimization Method=Base2026.05 | 12.9 | |
| Qwen3-4B-BaseModel=Qwen3-4B-Base, Optimization Method=Base2026.05 | 9.38 | |
| Qwen3-1.7B-Base + Resample w/ LOPE (w/ Training Signal Shaping)Model=Qwen3-1.7B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=true2026.05 | 8.8 | |
| Qwen3-1.7B-Base + Resample w/ Naive PromptModel=Qwen3-1.7B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=Naive Prompt2026.05 | 8.7 | |
| Qwen3-1.7B-Base + Resample w/ LOPE (w/o Training Signal Shaping)Model=Qwen3-1.7B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=false2026.05 | 7.97 | |
| Qwen3-1.7B-Base + GRPOModel=Qwen3-1.7B-Base, Optimization Method=GRPO2026.05 | 6.15 | |
| Qwen3-1.7B-BaseModel=Qwen3-1.7B-Base, Optimization Method=Base2026.05 | 5.33 |