Mathematical Reasoning on Average Reasoning Benchmarks (Pass@1, Pass@32)
45.3Pass@1LEPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LEPOBase Model=Qwen2.5-7B2026.04 | 45.3 | 69.54 | |
| GRPOBase Model=Qwen2.5-7B, latent inference=true2026.04 | 43.82 | 67.13 | |
| GRPOBase Model=Qwen2.5-7B2026.04 | 43.51 | 67.56 | |
| Soft TokensBase Model=Qwen2.5-7B2026.04 | 43.27 | 62.29 | |
| HRPOBase Model=Qwen2.5-7B2026.04 | 40.02 | 57.13 | |
| LEPOBase Model=Qwen2.5-3B2026.04 | 36.06 | 64.43 | |
| GRPOBase Model=Qwen2.5-3B, latent inference=true2026.04 | 34.69 | 62.65 | |
| GRPOBase Model=Qwen2.5-3B2026.04 | 34.59 | 62.73 | |
| HRPOBase Model=Qwen2.5-3B2026.04 | 32.73 | 54.56 | |
| Soft TokensBase Model=Qwen2.5-3B2026.04 | 30.5 | 54.83 | |
| LEPOBase Model=Llama3.2-3B2026.04 | 29.8 | 60.92 | |
| CoTBase Model=Qwen2.5-3B, latent inference=true2026.04 | 28.78 | 62.19 | |
| CoTBase Model=Qwen2.5-3B2026.04 | 28.5 | 61.5 | |
| GRPOBase Model=Llama3.2-3B, latent inference=true2026.04 | 27.77 | 58.5 | |
| GRPOBase Model=Llama3.2-3B2026.04 | 27.73 | 58.2 | |
| CoTBase Model=Llama3.2-3B, latent inference=true2026.04 | 27.06 | 58.76 | |
| Soft TokensBase Model=Llama3.2-3B2026.04 | 27 | 55.1 | |
| CoTBase Model=Llama3.2-3B2026.04 | 26.99 | 57.04 | |
| HRPOBase Model=Llama3.2-3B2026.04 | 26.73 | 51.97 | |
| CoTBase Model=Qwen2.5-7B2026.04 | 21.2 | 64.01 | |
| CoTBase Model=Qwen2.5-7B, latent inference=true2026.04 | 21.11 | 66.72 |