Mathematical Reasoning on Math Benchmarks Aggregate (Average Accuracy and Length)
81.9Accuracy (Avg)Standardp
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| StandardpBackbone=DeepSeek-R1-7B2026.02 | 81.9 | 6,564.23 | — | — | |
| S3-CoTBackbone=DeepSeek-R1-7B2026.02 | 81.28 | 5,487.14 | 0.09 | — | |
| EffReaBackbone=DeepSeek-R1-7B2026.02 | 81.17 | 4,784.84 | 0.18 | — | |
| LASERDEBackbone=DeepSeek-R1-7B2026.02 | 80.94 | 2,880.33 | 0.44 | — | |
| C3oTBackbone=DeepSeek-R1-7B2026.02 | 80.78 | 6,246.5 | -0.09 | — | |
| AutoTHINKBackbone=DeepSeek-R1-7B2026.02 | 80.65 | 3,930.1 | 0.25 | — | |
| S3-CoTscBackbone=DeepSeek-R1-7B2026.02 | 79.96 | 5,497.31 | -0.07 | — | |
| EfficientpBackbone=DeepSeek-R1-7B2026.02 | 76.45 | 5,251.44 | -0.47 | — | |
| LC-R1Backbone=DeepSeek-R1-7B2026.02 | 75.33 | 2,745.73 | -0.22 | — | |
| ASPO-Math-30BBackbone=Qwen3-30B-A3B2025.10 | 71.8 | — | — | — | |
| GRPOBackbone=Qwen3-30B-A3B2025.10 | 68.8 | — | — | — | |
| ASPO-Math-8BBackbone=Qwen3-8B2025.10 | 65.7 | — | — | — | |
| ASPO-Math-4BBackbone=Qwen3-4B2025.10 | 65 | — | — | — | |
| ShorterBetterBackbone=DeepSeek-R1-7B2026.02 | 64.03 | 1,760.43 | -1.45 | — | |
| CoT-ValveBackbone=DeepSeek-R1-7B2026.02 | 63.83 | 1,986.46 | -1.51 | — | |
| GRPOBackbone=Qwen3-8B2025.10 | 63.3 | — | — | — | |
| HACPOModel Backbone=Qwen3-8B-Base2026.03 | 63 | — | — | — | |
| GRPOBackbone=Qwen3-4B2025.10 | 61.6 | — | — | — | |
| HACPOModel Backbone=Qwen3-4B-Base2026.03 | 61.4 | — | — | — | |
| ASPO-Math-1.5BBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 59.3 | — | — | — | |
| Nemotron-1.5BBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 58.7 | — | — | — | |
| C3oTBackbone=Qwen2.5-7B2026.02 | 55.52 | 620.85 | 0.19 | — | |
| S3-CoTBackbone=Qwen2.5-7B2026.02 | 55.43 | 522.29 | 0.33 | — | |
| S3-CoTscBackbone=Qwen2.5-7B2026.02 | 54.99 | 534.08 | 0.27 | — | |
| StandardpBackbone=Qwen2.5-7B2026.02 | 54.28 | 673.14 | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 53.5 | — | — | — | |
| DeepScaleR-1.5BBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 53.5 | — | — | — | |
| Qwen3-30B-A3BBackbone=Qwen3-30B-A3B2025.10 | 53.3 | — | — | — | |
| TokenSkipBackbone=Qwen2.5-7B2026.02 | 53.21 | 595.6 | -0.08 | — | |
| EfficientpBackbone=Qwen2.5-7B2026.02 | 52.9 | 430.66 | 0.11 | — | |
| CoT-ValveBackbone=Qwen2.5-7B2026.02 | 51.42 | 721.71 | -0.6 | — | |
| Qwen3-8BBackbone=Qwen3-8B2025.10 | 49.7 | — | — | — | |
| HACPOModel Backbone=Qwen3-1.7B-Base2026.03 | 49.6 | — | — | — | |
| Qwen3-4BBackbone=Qwen3-4B2025.10 | 48.3 | — | — | — | |
| DeepSeek-R1-1.5BBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 46.8 | — | — | — | |
| TEPOBackbone=Qwen3-14B, Method Variant=TEPO2026.04 | 44.02 | — | — | — | |
| Qwen3-14B w. GSPOBackbone=Qwen3-14B, Method Variant=GSPO2026.04 | 42.28 | — | — | — | |
| Qwen3-14B w. GPGBackbone=Qwen3-14B, Method Variant=GPG2026.04 | 42.16 | — | — | — | |
| Qwen3-14B w. KL-CovBackbone=Qwen3-14B, Method Variant=KL-Cov2026.04 | 41.85 | — | — | — | |
| Qwen3-14B w. Entropy-based TermBackbone=Qwen3-14B, Method Variant=Entropy-based Term2026.04 | 41.56 | — | — | — | |
| Qwen3-14B w. GRPO/DAPOBackbone=Qwen3-14B, Method Variant=GRPO/DAPO2026.04 | 41.51 | — | — | — | |
| Qwen3-14B w. CLIP-CovBackbone=Qwen3-14B, Method Variant=CLIP-Cov2026.04 | 41.29 | — | — | — | |
| Qwen3-14BBackbone=Qwen3-14B, Method Variant=Base2026.04 | 38.34 | — | — | — | |
| HACPOModel Backbone=Llama3.2-3B-Instruct2026.03 | 37 | — | — | — | |
| TEPOBackbone=Qwen2.5-7B, Method Variant=TEPO2026.04 | 32.59 | — | — | — | |
| Qwen2.5-7B w. GPGBackbone=Qwen2.5-7B, Method Variant=GPG2026.04 | 31.91 | — | — | — | |
| Qwen2.5-7B w. CLIP-CovBackbone=Qwen2.5-7B, Method Variant=CLIP-Cov2026.04 | 31.64 | — | — | — | |
| Qwen2.5-7B w. Entropy-based TermBackbone=Qwen2.5-7B, Method Variant=Entropy-based Term2026.04 | 31.62 | — | — | — | |
| Qwen2.5-7B w. KL-CovBackbone=Qwen2.5-7B, Method Variant=KL-Cov2026.04 | 31.6 | — | — | — | |
| Qwen2.5-7B w. GSPOBackbone=Qwen2.5-7B, Method Variant=GSPO2026.04 | 31.33 | — | — | — | |
| Qwen2.5-7B w. GRPO/DAPOBackbone=Qwen2.5-7B, Method Variant=GRPO/DAPO2026.04 | 30.85 | — | — | — | |
| HAPOBackbone=LLaMA3.2-3B Instruct2025.09 | 27.42 | — | — | — | |
| HAPOBackbone=LLaMA3.1-8B-Instruct2025.09 | 27.06 | — | — | — | |
| DAPO w/ Forking TokensBackbone=LLaMA3.1-8B-Instruct2025.09 | 25.3 | — | — | — | |
| Vanilla DAPOBackbone=LLaMA3.1-8B-Instruct2025.09 | 24.21 | — | — | — | |
| DAPO w/ Forking TokensBackbone=LLaMA3.2-3B Instruct2025.09 | 23.86 | — | — | — | |
| HACPOModel Backbone=Llama3.2-1B-Instruct2026.03 | 23.3 | — | — | — | |
| Vanilla DAPOBackbone=LLaMA3.2-3B Instruct2025.09 | 22.99 | — | — | — | |
| HACPOModel Backbone=Llama3.2-1B-Instruct, Experimental Context=Heterogeneous Setup2026.03 | 22.8 | — | — | — | |
| Vanilla GRPOBackbone=LLaMA3.1-8B-Instruct2025.09 | 22.07 | — | — | — | |
| Vanilla GRPOBackbone=LLaMA3.2-3B Instruct2025.09 | 20.97 | — | — | — | |
| Qwen2.5-7BBackbone=Qwen2.5-7B, Method Variant=Base2026.04 | 13.3 | — | — | — | |
| DEPOModel=QWEN3-4B, Data Budget=20%2026.05 | — | — | — | 62.8 | |
| DEPOModel=QWEN3-1.7B, Data Budget=20%2026.05 | — | — | — | 49.4 | |
| DEPOModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | — | — | — | 22.1 | |
| IFDModel=QWEN3-4B, Data Budget=20%2026.05 | — | — | — | 60.4 | |
| IFDModel=QWEN3-1.7B, Data Budget=20%2026.05 | — | — | — | 44.9 | |
| IFDModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | — | — | — | 21.2 | |
| IRDSModel=QWEN3-4B, Data Budget=20%2026.05 | — | — | — | 67 | |
| IRDSModel=QWEN3-1.7B, Data Budget=20%2026.05 | — | — | — | 54.2 | |
| IRDSModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | — | — | — | 22.6 | |
| LIMRModel=QWEN3-4B, Data Budget=20%2026.05 | — | — | — | 63.1 | |
| LIMRModel=QWEN3-1.7B, Data Budget=20%2026.05 | — | — | — | 50.2 | |
| LIMRModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | — | — | — | 21.5 | |
| PPL-MIDDLEModel=QWEN3-4B, Data Budget=20%2026.05 | — | — | — | 62.9 | |
| PPL-MIDDLEModel=QWEN3-1.7B, Data Budget=20%2026.05 | — | — | — | 46.7 | |
| PPL-MIDDLEModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | — | — | — | 21.4 | |
| PPL-TOPModel=QWEN3-4B, Data Budget=20%2026.05 | — | — | — | 60.4 | |
| PPL-TOPModel=QWEN3-1.7B, Data Budget=20%2026.05 | — | — | — | 45.1 | |
| PPL-TOPModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | — | — | — | 20.8 | |
| RANDOMModel=QWEN3-4B, Data Budget=20%2026.05 | — | — | — | 56.2 | |
| RANDOMModel=QWEN3-1.7B, Data Budget=20%2026.05 | — | — | — | 46.5 | |
| RANDOMModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | — | — | — | 22.1 | |
| TOKEN-LENGTHModel=QWEN3-4B, Data Budget=20%2026.05 | — | — | — | 53.9 | |
| TOKEN-LENGTHModel=QWEN3-1.7B, Data Budget=20%2026.05 | — | — | — | 43.1 | |
| TOKEN-LENGTHModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | — | — | — | 21.7 |