Scientific Question Answering on GPQA (Pass@1, #L)
38.25Pass@1 AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Explicit Reasoning2026.04 | 38.25 | 4,568 | |
| Latent-GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 36.68 | 1,384 | |
| SFTBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Explicit Reasoning2026.04 | 32.07 | 3,555 | |
| Latent-SFTBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 29.67 | 1,214 | |
| Soft-GRPOBase Model=Qwen2.5-Math-7B, Reasoning Strategy=Latent Reasoning, Sampling Mode=No Sampling2026.04 | 27.12 | 1,426 |