Mathematical Reasoning on Minerva Math (pass@1, pass@32)
13Pass@1Ours
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OursModel=Qwen3-8B-Base, Training Setting=Full subset training, Method Identity=LatentRevise2026.06 | 13 | 42.1 | |
| GRPO (n=16)Model=Qwen3-8B-Base, Training Setting=Full subset training, Rollout Size=162026.06 | 12.7 | 39.3 | |
| GRPO (n=8)Model=Qwen3-8B-Base, Training Setting=Full subset training, Rollout Size=82026.06 | 12.5 | 41.9 | |
| DAPOModel=Qwen3-8B-Base, Training Setting=Full subset training2026.06 | 11.4 | 41.2 | |
| OursModel=Qwen2.5-1.5B-Instruct, Training Setting=Full subset training, Method Identity=LatentRevise2026.06 | 9.1 | 31.9 | |
| GRPO (n=16)Model=Qwen2.5-1.5B-Instruct, Training Setting=Full subset training, Rollout Size=162026.06 | 8.7 | 30.5 | |
| DAPOModel=Qwen2.5-1.5B-Instruct, Training Setting=Full subset training2026.06 | 8.7 | 29.4 | |
| GRPO (n=8)Model=Qwen2.5-1.5B-Instruct, Training Setting=Full subset training, Rollout Size=82026.06 | 8.6 | 30.5 | |
| BaseModel=Qwen2.5-1.5B-Instruct, Training Setting=Full subset training2026.06 | 6.4 | 27.6 | |
| BaseModel=Qwen3-8B-Base, Training Setting=Full subset training2026.06 | 6.2 | 36.7 |