Mathematical Reasoning on AIME 2025 (Pass@1, #L)
23.23Pass@1 RateLatent-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Latent-GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 23.23 | 1,735 | |
| GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Explicit Reasoning2026.04 | 19.79 | 6,815 | |
| SFTBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Explicit Reasoning2026.04 | 6.77 | 6,550 | |
| Latent-SFTBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 6.61 | 1,299 | |
| Soft-GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 3.59 | 1,511 |