Mathematical Reasoning on AMC 2024
70AccuracyGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPObase_model=Qwen2.5-Math-7B2026.05 | 70 | |
| CoDistill-GRPObase_model=Qwen2.5-Math-7B, alpha=1, T=0, CT=true2026.05 | 69.5 | |
| Qwen3 + DAPO + Hidden-AlignSize=14B2026.06 | 65.62 | |
| Qwen3 + DAPOSize=14B2026.06 | 64.1 | |
| CoDistill-GRPObase_model=Qwen2.5-Math-7B, alpha=1, T=0, CT=false2026.05 | 64 | |
| CoDistill-GRPObase_model=Qwen2.5-Math-7B, alpha=1, T=50, CT=true2026.05 | 63.5 | |
| CoDistill-GRPObase_model=Qwen2.5-Math-7B, alpha=2, T=0, CT=true2026.05 | 63 | |
| Qwen3 + DAPO + Hidden-AlignSize=4B2026.06 | 62.15 | |
| CoDistill-GRPObase_model=Qwen2.5-Math-7B, alpha=1, T=50, CT=false2026.05 | 62 | |
| CoDistill-GRPObase_model=Qwen2.5-Math-7B, alpha=2, T=0, CT=false2026.05 | 62 | |
| DAPO w/ EDASBackbone=Qwen3-8B2026.05 | 59.38 | |
| Qwen3 + DAPOSize=4B2026.06 | 58.75 | |
| DAPO w/ EDASBackbone=Qwen3-4B2026.05 | 58.19 | |
| DAPOBackbone=Qwen3-4B2026.05 | 57.15 | |
| DAPOBackbone=Qwen3-8B2026.05 | 56.88 | |
| DAPO w/ En AdvBackbone=Qwen3-8B2026.05 | 55.62 | |
| DAPO w/ En AdvBackbone=Qwen3-4B2026.05 | 49.58 | |
| Qwen3 (base)Size=14B2026.06 | 49.58 | |
| GRPO w/ EDASBackbone=Qwen3-8B2026.05 | 49.38 | |
| GRPOBackbone=Qwen3-8B2026.05 | 48.75 | |
| DAPO w/ EDASBackbone=Qwen3-4B-Base2026.05 | 48.68 | |
| Qwen3 + DAPO + Hidden-AlignSize=1.7B2026.06 | 47.57 | |
| Qwen3 + DAPOSize=1.7B2026.06 | 47.43 | |
| Qwen2.5-Math-7Bstatus=Base Model2026.05 | 47 | |
| Qwen3 (base)Size=4B2026.06 | 45.35 | |
| PKPOBackbone=Qwen3-8B2026.05 | 45.07 | |
| BaselineBackbone=Qwen3-4B2026.05 | 44.31 | |
| BaselineBackbone=Qwen3-8B2026.05 | 44.24 | |
| DAPO w/ En AdvBackbone=Qwen3-4B-Base2026.05 | 34.24 | |
| DAPOBackbone=Qwen3-4B-Base2026.05 | 33.68 | |
| Qwen3 (base)Size=1.7B2026.06 | 27.99 | |
| BaselineBackbone=Qwen3-4B-Base2026.05 | 12.08 |