Mathematical Reasoning on AMC 2023 (Pass@1, Avg@8, Pass@8)
82.5Pass@1MEL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MELBackbone=Qwen3-14B-Base2026.02 | 82.5 | 82.81 | 95 | |
| GRPOBackbone=Qwen3-14B-Base2026.02 | 75 | 75.94 | 95 | |
| MELBackbone=Qwen3-8B-Base2026.02 | 70 | 70.31 | 90 | |
| GRPOBackbone=Qwen3-8B-Base2026.02 | 67.5 | 69.06 | 87.5 | |
| BaselineBackbone=Qwen3-8B-Base2026.02 | 65 | 52.5 | 87.5 | |
| MELBackbone=Qwen3-4B-Base2026.02 | 60 | 60.31 | 87.5 | |
| BaselineBackbone=Qwen3-14B-Base2026.02 | 60 | 51.25 | 82.5 | |
| GRPOBackbone=Qwen3-4B-Base2026.02 | 57.5 | 58.13 | 85 | |
| Qwen2.5-7B + GRPOBase Model=Qwen2.5-7B, RL Framework=GRPO, VERL Integration=false2025.09 | 55 | — | — | |
| Qwen2.5-7B + PPO w/ VERL.Base Model=Qwen2.5-7B, RL Framework=PPO, VERL Integration=true2025.09 | 52.5 | — | — | |
| Qwen2.5-7B + GRPO w/ VERL.Base Model=Qwen2.5-7B, RL Framework=GRPO, VERL Integration=true2025.09 | 50 | — | — | |
| Qwen2.5-7B + PPOBase Model=Qwen2.5-7B, RL Framework=PPO, VERL Integration=false2025.09 | 50 | — | — | |
| BaselineBackbone=Qwen3-4B-Base2026.02 | 45 | 42.73 | 72.5 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B, RL Framework=None, VERL Integration=false2025.09 | 45 | — | — | |
| Llama-3.2-3B-Instruct + GRPOBase Model=Llama-3.2-3B-Instruct, RL Framework=GRPO, VERL Integration=false2025.09 | 27.5 | — | — | |
| Llama-3.2-3B-InstructBase Model=Llama-3.2-3B-Instruct, RL Framework=None, VERL Integration=false2025.09 | 25 | — | — | |
| Llama-3.2-3B-Instruct + GRPO w/ VERL.Base Model=Llama-3.2-3B-Instruct, RL Framework=GRPO, VERL Integration=true2025.09 | 25 | — | — | |
| Llama-3.2-3B-Instruct + PPO w/ VERL.Base Model=Llama-3.2-3B-Instruct, RL Framework=PPO, VERL Integration=true2025.09 | 25 | — | — | |
| Llama-3.2-3B-Instruct + PPOBase Model=Llama-3.2-3B-Instruct, RL Framework=PPO, VERL Integration=false2025.09 | 22.5 | — | — |