Mathematical Reasoning on AMC 2022, 2023, 2024
61.19Accuracy@1Qwen2.5-Math-7B + Resample w/ LOPE (w/ Training Signal Shaping)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-Math-7B + Resample w/ LOPE (w/ Training Signal Shaping)Model=Qwen2.5-Math-7B, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=true2026.05 | 61.19 | |
| Qwen3-4B-Base + Resample w/ LOPE (w/ Training Signal Shaping)Model=Qwen3-4B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=true2026.05 | 58.21 | |
| Qwen3-4B-Base + Resample w/ LOPE (w/o Training Signal Shaping)Model=Qwen3-4B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=false2026.05 | 52.99 | |
| Qwen2.5-Math-7B + Resample w/ Naive PromptModel=Qwen2.5-Math-7B, Optimization Method=GRPO + Resample, Prompt Strategy=Naive Prompt2026.05 | 50 | |
| Qwen3-4B-Base + GRPOModel=Qwen3-4B-Base, Optimization Method=GRPO2026.05 | 47.76 | |
| Qwen2.5-Math-7B + GRPOModel=Qwen2.5-Math-7B, Optimization Method=GRPO2026.05 | 47.76 | |
| Qwen2.5-Math-7B + Resample w/ LOPE (w/o Training Signal Shaping)Model=Qwen2.5-Math-7B, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=false2026.05 | 47.01 | |
| Qwen3-4B-Base + Resample w/ Naive PromptModel=Qwen3-4B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=Naive Prompt2026.05 | 45.52 | |
| Qwen2.5-Math-7BModel=Qwen2.5-Math-7B, Optimization Method=Base2026.05 | 35.4 | |
| Qwen3-1.7B-Base + Resample w/ LOPE (w/o Training Signal Shaping)Model=Qwen3-1.7B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=false2026.05 | 33.58 | |
| Qwen3-1.7B-Base + Resample w/ LOPE (w/ Training Signal Shaping)Model=Qwen3-1.7B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=LOPE, Training Signal Shaping=true2026.05 | 32.84 | |
| Qwen3-4B-BaseModel=Qwen3-4B-Base, Optimization Method=Base2026.05 | 32.84 | |
| Qwen3-1.7B-Base + Resample w/ Naive PromptModel=Qwen3-1.7B-Base, Optimization Method=GRPO + Resample, Prompt Strategy=Naive Prompt2026.05 | 28.36 | |
| Qwen3-1.7B-Base + GRPOModel=Qwen3-1.7B-Base, Optimization Method=GRPO2026.05 | 27.61 | |
| Qwen3-1.7B-BaseModel=Qwen3-1.7B-Base, Optimization Method=Base2026.05 | 26.87 |