Mathematical Reasoning on OlympiadBench (pass@1, pass@32)
26.6Pass@1 RateOurs
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OursModel=Qwen3-8B-Base, Training Setting=Full subset training, Method Identity=LatentRevise2026.06 | 26.6 | 48.9 | |
| GRPO (n=16)Model=Qwen3-8B-Base, Training Setting=Full subset training, Rollout Size=162026.06 | 25.7 | 46.7 | |
| GRPO (n=8)Model=Qwen3-8B-Base, Training Setting=Full subset training, Rollout Size=82026.06 | 24.6 | 47.5 | |
| DAPOModel=Qwen3-8B-Base, Training Setting=Full subset training2026.06 | 23.7 | 46.3 | |
| BaseModel=Qwen3-8B-Base, Training Setting=Full subset training2026.06 | 14.2 | 45.1 | |
| OursModel=Qwen2.5-1.5B-Instruct, Training Setting=Full subset training, Method Identity=LatentRevise2026.06 | 12.4 | 38 | |
| GRPO (n=16)Model=Qwen2.5-1.5B-Instruct, Training Setting=Full subset training, Rollout Size=162026.06 | 12 | 36.8 | |
| DAPOModel=Qwen2.5-1.5B-Instruct, Training Setting=Full subset training2026.06 | 11.9 | 36.1 | |
| GRPO (n=8)Model=Qwen2.5-1.5B-Instruct, Training Setting=Full subset training, Rollout Size=82026.06 | 11.8 | 35.6 | |
| BaseModel=Qwen2.5-1.5B-Instruct, Training Setting=Full subset training2026.06 | 11.2 | 37.4 |