Mathematical Reasoning on AMC23 (Accuracy and Length Delta Analysis)
87.97AccuracyOriginal
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| OriginalModel=DeepSeek-R1-Distill-Qwen-7B2025.08 | 87.97 | — | 6,966 | — | |
| LCPOModel=DeepSeek-R1-Distill-Qwen-7B2025.08 | 86.88 | -1.09 | 3,108 | -55.38 | |
| AdaptThinkModel=DeepSeek-R1-Distill-Qwen-7B2025.08 | 86.56 | -1.41 | 4,701 | -32.52 | |
| AutoThinkModel=DeepSeek-R1-Distill-Qwen-7B2025.08 | 83.91 | -4.06 | 4,005 | -42.51 | |
| ADv2Backbone=Qwen3-14B, Indicator Pool Source=Qwen3-8B-based MAS2026.02 | 77.5 | — | — | — | |
| RLVRBackbone=Qwen3-8B-Base, Cost=100%2026.05 | 73.8 | — | — | — | |
| RELEXBackbone=Qwen3-8B-Base, Cost=20%2026.05 | 72.8 | — | — | — | |
| Dynamic-MASBackbone=Qwen3-14B2026.02 | 72.5 | — | — | — | |
| OriginalModel=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 70.62 | — | 10,162 | — | |
| LCPOModel=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 70.47 | -0.15 | 4,026 | -60.38 | |
| Logits Extrap.Backbone=Qwen3-8B-Base, Cost=20%2026.05 | 68.4 | — | — | — | |
| AdaptThinkModel=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 68.28 | -2.34 | 3,188 | -68.63 | |
| Weight Extrap.Backbone=Qwen3-8B-Base, Cost=20%2026.05 | 68.1 | — | — | — | |
| ExPOBackbone=Qwen3-8B-Base, Cost=20%2026.05 | 67.8 | — | — | — | |
| AutoThinkModel=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 67.34 | -3.28 | 3,487 | -65.69 | |
| RELEXBackbone=Qwen3-4B-Base, Cost=15%2026.05 | 67.2 | — | — | — | |
| AlphaRLBackbone=Qwen3-8B-Base, Cost=20%2026.05 | 66.9 | — | — | — | |
| RLVRBackbone=Qwen3-4B-Base, Cost=100%2026.05 | 64.1 | — | — | — | |
| Single AgentBackbone=Qwen3-14B2026.02 | 62.5 | — | — | — | |
| STEERBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 61.6 | — | — | — | |
| ExPOBackbone=Qwen3-4B-Base, Cost=15%2026.05 | 60.9 | — | — | — | |
| Logits Extrap.Backbone=Qwen3-4B-Base, Cost=15%2026.05 | 59.1 | — | — | — | |
| Weight Extrap.Backbone=Qwen3-4B-Base, Cost=15%2026.05 | 58.8 | — | — | — | |
| OPOBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 58.2 | — | — | — | |
| RELEXBackbone=Qwen2.5-Math-1.5B, Cost=15%2026.05 | 56.2 | — | — | — | |
| GRPOBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 56 | — | — | — | |
| Clip-CovBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 56 | — | — | — | |
| Entro. Adv.Backbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 55.7 | — | — | — | |
| AlphaRLBackbone=Qwen3-4B-Base, Cost=15%2026.05 | 55.3 | — | — | — | |
| RLVRBackbone=Qwen2.5-Math-1.5B, Cost=100%2026.05 | 54.4 | — | — | — | |
| BaseBackbone=Qwen3-8B-Base, Cost=0%2026.05 | 53.8 | — | — | — | |
| Weight Extrap.Backbone=Qwen2.5-Math-1.5B, Cost=15%2026.05 | 52.2 | — | — | — | |
| AlphaRLBackbone=Qwen2.5-Math-1.5B, Cost=15%2026.05 | 50.6 | — | — | — | |
| ExPOBackbone=Qwen2.5-Math-1.5B, Cost=15%2026.05 | 50.3 | — | — | — | |
| Logits Extrap.Backbone=Qwen2.5-Math-1.5B, Cost=15%2026.05 | 44.8 | — | — | — | |
| BaseBackbone=Qwen3-4B-Base, Cost=0%2026.05 | 43.8 | — | — | — | |
| BaseBackbone=Qwen2.5-Math-1.5B, Cost=0%2026.05 | 33.1 | — | — | — | |
| BaseBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 24.7 | — | — | — |