Mathematical Reasoning on AMC23 (Pass@1 and Pass@32)
52.58Pass@1LEPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LEPOBase Model=Qwen2.5-7B2026.04 | 52.58 | 92.5 | |
| Soft TokensBase Model=Qwen2.5-7B2026.04 | 50.47 | 82.5 | |
| GRPOBase Model=Qwen2.5-7B, latent inference=true2026.04 | 49.14 | 92.5 | |
| GRPOBase Model=Qwen2.5-7B2026.04 | 47.89 | 90 | |
| HRPOBase Model=Qwen2.5-7B2026.04 | 47.5 | 80 | |
| LEPOBase Model=Qwen2.5-3B2026.04 | 35.08 | 90 | |
| HRPOBase Model=Qwen2.5-3B2026.04 | 35 | 77.5 | |
| GRPOBase Model=Qwen2.5-3B2026.04 | 33.36 | 87.5 | |
| GRPOBase Model=Qwen2.5-3B, latent inference=true2026.04 | 32.74 | 87.5 | |
| Soft TokensBase Model=Qwen2.5-3B2026.04 | 27.42 | 77.5 | |
| LEPOBase Model=Llama3.2-3B2026.04 | 27.03 | 77.5 | |
| CoTBase Model=Qwen2.5-7B2026.04 | 25.62 | 85 | |
| CoTBase Model=Qwen2.5-7B, latent inference=true2026.04 | 25.16 | 85 | |
| CoTBase Model=Qwen2.5-3B, latent inference=true2026.04 | 25.11 | 82.5 | |
| CoTBase Model=Qwen2.5-3B2026.04 | 24.22 | 80 | |
| GRPOBase Model=Llama3.2-3B2026.04 | 24.14 | 75 | |
| GRPOBase Model=Llama3.2-3B, latent inference=true2026.04 | 23.98 | 72.5 | |
| CoTBase Model=Llama3.2-3B, latent inference=true2026.04 | 21.64 | 77.5 | |
| CoTBase Model=Llama3.2-3B2026.04 | 21.48 | 75 | |
| Soft TokensBase Model=Llama3.2-3B2026.04 | 20.55 | 72.5 | |
| HRPOBase Model=Llama3.2-3B2026.04 | 17.5 | 67.5 |