Mathematical Reasoning on Minvervamath
34.06Pass@1LEPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LEPOBase Model=Qwen2.5-7B2026.04 | 34.06 | 59.56 | |
| GRPOBase Model=Qwen2.5-7B, latent inference=true2026.04 | 34.03 | 58.82 | |
| GRPOBase Model=Qwen2.5-7B2026.04 | 33.98 | 57.72 | |
| Soft TokensBase Model=Qwen2.5-7B2026.04 | 30.33 | 47.06 | |
| LEPOBase Model=Qwen2.5-3B2026.04 | 24.22 | 50.74 | |
| GRPOBase Model=Qwen2.5-3B2026.04 | 22.84 | 51.47 | |
| HRPOBase Model=Qwen2.5-7B2026.04 | 22.79 | 43.38 | |
| GRPOBase Model=Qwen2.5-3B, latent inference=true2026.04 | 21.69 | 50.37 | |
| LEPOBase Model=Llama3.2-3B2026.04 | 17.65 | 48.16 | |
| Soft TokensBase Model=Qwen2.5-3B2026.04 | 17.13 | 33.82 | |
| CoTBase Model=Qwen2.5-3B, latent inference=true2026.04 | 16.91 | 50.74 | |
| Soft TokensBase Model=Llama3.2-3B2026.04 | 16.91 | 43.38 | |
| GRPOBase Model=Llama3.2-3B, latent inference=true2026.04 | 16.74 | 47.06 | |
| GRPOBase Model=Llama3.2-3B2026.04 | 16.67 | 47.06 | |
| CoTBase Model=Qwen2.5-3B2026.04 | 16.61 | 50 | |
| HRPOBase Model=Qwen2.5-3B2026.04 | 16.54 | 33.09 | |
| CoTBase Model=Llama3.2-3B2026.04 | 16.22 | 45.96 | |
| HRPOBase Model=Llama3.2-3B2026.04 | 15.81 | 41.18 | |
| CoTBase Model=Llama3.2-3B, latent inference=true2026.04 | 15.8 | 45.96 | |
| CoTBase Model=Qwen2.5-7B2026.04 | 14.1 | 54.04 | |
| CoTBase Model=Qwen2.5-7B, latent inference=true2026.04 | 13.57 | 55.15 |