Mathematical Reasoning on OlympiadBench (Accuracy, Speedup)
60.44AccuracyASLEC-CASL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ASLEC-CASLBase Model=Qwen 4B-Instruct2026.04 | 60.44 | — | |
| PieceHintBase model=DeepSeek-R1-Distill-7B2026.04 | 59.5 | — | |
| ASLEC-DROPBase Model=Qwen 4B-Instruct2026.04 | 57.64 | — | |
| GRPOBase model=DeepSeek-R1-Distill-7B2026.04 | 56.8 | — | |
| DeepSeek-R1-Distill-7BRole=backbone2026.04 | 55.1 | — | |
| Local LPBase Model=Qwen 4B-Instruct2026.04 | 50.14 | — | |
| ASLEC-CASLBase Model=Qwen 8B-Base2026.04 | 49.03 | — | |
| ASLEC-DROPBase Model=Qwen 8B-Base2026.04 | 47.85 | — | |
| GRACEBase Model=Qwen 4B-Instruct2026.04 | 47.79 | — | |
| ASLEC-CASLBase Model=Qwen 7B-Instruct2026.04 | 45.18 | — | |
| ASLEC-CASLBase Model=Qwen 4B-Base2026.04 | 42.81 | — | |
| Local LPBase Model=Qwen 8B-Base2026.04 | 42.81 | — | |
| CoDaPOBackbone=Qwen2.5-14B-Instruct2026.06 | 41.63 | — | |
| Seed-GRPOBackbone=Qwen-2.5-1.5B-Instruct2026.05 | 41.3 | — | |
| ASLEC-DROPBase Model=Qwen 7B-Instruct2026.04 | 41.17 | — | |
| GRACEBase Model=Qwen 8B-Base2026.04 | 39.7 | — | |
| BaseBackbone=Qwen2.5-14B-Instruct2026.06 | 38.49 | — | |
| ASLEC-DROPBase Model=Qwen 4B-Base2026.04 | 38.38 | — | |
| GRPO + CDBackbone=Qwen-2.5-1.5B-Instruct, Uncertainty Signal=Cosine Dispersion2026.05 | 38.24 | — | |
| GRPOBackbone=Qwen2.5-14B-Instruct2026.06 | 38.13 | — | |
| CoDaPOBase Model=Qwen2.5-Math-7B2026.06 | 37.98 | — | |
| GRPOBase Model=Qwen2.5-Math-7B2026.06 | 37.35 | — | |
| GRPO + BoTBackbone=Qwen-2.5-1.5B-Instruct, Uncertainty Signal=Barycentric Transport2026.05 | 37.25 | — | |
| EMPOBackbone=Qwen-2.5-1.5B-Instruct2026.05 | 36.6 | — | |
| GRPO + SEBackbone=Qwen-2.5-1.5B-Instruct2026.05 | 36.27 | — | |
| GPGBase Model=Qwen2.5-Math-7B2026.06 | 36.26 | — | |
| DAPOBase Model=Qwen2.5-Math-7B2026.06 | 36.18 | — | |
| CoDaPOBase Model=Qwen2.5-Math-1.5B2026.06 | 36.16 | — | |
| Dr. GRPOBase Model=Qwen2.5-Math-7B2026.06 | 36 | — | |
| GRPO-CareBackbone=Qwen-2.5-1.5B-Instruct2026.05 | 35.78 | — | |
| Local LPBase Model=Qwen 4B-Base2026.04 | 34.11 | — | |
| Local LPBase Model=Qwen 7B-Instruct2026.04 | 33.97 | — | |
| GRACEBase Model=Qwen 4B-Base2026.04 | 33.33 | — | |
| GRPO + KLEBackbone=Qwen-2.5-1.5B-Instruct2026.05 | 33.33 | — | |
| DAPOBase Model=Qwen2.5-Math-1.5B2026.06 | 32.87 | — | |
| GPGBase Model=Qwen2.5-Math-1.5B2026.06 | 32.72 | — | |
| GRACEBase Model=Qwen 7B-Instruct2026.04 | 32.35 | — | |
| GRPOBase Model=Qwen2.5-Math-1.5B2026.06 | 32.18 | — | |
| Dr. GRPOBase Model=Qwen2.5-Math-1.5B2026.06 | 31.39 | — | |
| Qwen2.5-Math-1.5BBackbone=Qwen-2.5-1.5B-Instruct2026.05 | 28.4 | — | |
| BaseBase Model=Qwen2.5-Math-7B2026.06 | 27.53 | — | |
| DAREModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 26.41 | — | |
| EDCOModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 24.63 | — | |
| LLM-JudgeModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 24.04 | — | |
| DOTSModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 23.74 | — | |
| Previous FR EstimationModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 23.15 | — | |
| GRPOModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 22.55 | — | |
| MoPPSModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 21.96 | — | |
| ARROLModel=Qwen-3-1.7B-Base, Base Method=DAPO2026.03 | 20.97 | 1.7 | |
| DAPOModel=Qwen-3-1.7B-Base2026.03 | 20.51 | — | |
| BaseBase Model=Qwen2.5-Math-1.5B2026.06 | 18.78 | — | |
| GRPOBase Model=Llama-3.2-1B-Instruct2026.06 | 6.4 | — | |
| CoDaPOBase Model=Llama-3.2-1B-Instruct2026.06 | 6.36 | — | |
| DAPOBase Model=Llama-3.2-1B-Instruct2026.06 | 6 | — | |
| Dr. GRPOBase Model=Llama-3.2-1B-Instruct2026.06 | 4.98 | — | |
| GPGBase Model=Llama-3.2-1B-Instruct2026.06 | 4.91 | — | |
| BaseBase Model=Llama-3.2-1B-Instruct2026.06 | 3.92 | — |