Mathematical Reasoning on AIME 2024 (Pass@1 and #L)
26.56Pass@1 AccuracyLatent-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Latent-GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 26.56 | 2,548 | |
| GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Explicit Reasoning2026.04 | 16.61 | 7,500 | |
| SFTBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Explicit Reasoning2026.04 | 13.39 | 6,423 | |
| Latent-SFTBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 6.67 | 1,651 | |
| Soft-GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 6.2 | 1,894 |