Aggregated Reasoning on Average (Math500, AIME24, AIME25, GPQA)
41.72Pass@1Latent-GRPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Latent-GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 41.72 | 1,649 | 14.77 | 3.31 | |
| GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Explicit Reasoning2026.04 | 37.45 | 5,466 | 7.54 | 1 | |
| SFTBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Explicit Reasoning2026.04 | 29.91 | 4,798 | — | — | |
| Latent-SFTBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 26.95 | 1,309 | — | — | |
| Soft-GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 24.38 | 1,491 | -2.57 | 3.67 |