Mathematical Reasoning on OlympiadBench (acc@1, Overall)
52Acc@1SHEAR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SHEARBackbone=Qwen2.5-14B-Base2026.04 | 52 | — | |
| GRPOBackbone=Qwen2.5-14B-Base2026.04 | 49.9 | — | |
| Entropy adv.Backbone=Qwen2.5-14B-Base2026.04 | 49.4 | — | |
| SHEARBackbone=Qwen2.5-Math-7B2026.04 | 48.7 | — | |
| Entropy adv.Backbone=Qwen2.5-Math-7B2026.04 | 48.6 | — | |
| PRM(Reshape adv.)Backbone=Qwen2.5-Math-7B2026.04 | 48.1 | — | |
| GRPOBackbone=Qwen2.5-Math-7B2026.04 | 47.8 | — | |
| PRM(PURE)Backbone=Qwen2.5-Math-7B2026.04 | 47.6 | — | |
| PRM(Reshape adv.)Backbone=Qwen2.5-14B-Base2026.04 | 44.1 | — | |
| PRM(PURE)Backbone=Qwen2.5-14B-Base2026.04 | 40.7 | — | |
| CDA-GRPOAlgorithm=CDA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 36.9 | 49 | |
| GRPOAlgorithm=GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 35.4 | 47.8 | |
| VM-AV-GRPOAlgorithm=VM-AV-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 35.3 | 52.5 | |
| AV-GRPOAlgorithm=AV-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 35.3 | 50.9 | |
| MSA-GRPOAlgorithm=MSA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 35.3 | 50.7 | |
| FA-GRPOAlgorithm=FA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 35 | 49.9 | |
| PR-GRPOAlgorithm=PR-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 33.2 | 49.4 | |
| SVE-LNA-GRPOAlgorithm=SVE-LNA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 32.7 | 48.7 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.04 | 24.5 | — | |
| PRM(Reshape adv.)Backbone=Llama3.1-8B-Instruct2026.04 | 23.4 | — | |
| SHEARBackbone=Llama3.1-8B-Instruct2026.04 | 22.8 | — | |
| Entropy adv.Backbone=Llama3.1-8B-Instruct2026.04 | 22.1 | — | |
| PRM(PURE)Backbone=Llama3.1-8B-Instruct2026.04 | 20.5 | — |