Mathematical Reasoning on AMC 23 (Acc, P@N, Tok, CR)
95Accuracy4B-Instruct
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| 4B-InstructModel=4B-Instruct, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 95 | — | — | — | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 90.5 | 95 | 5,018 | 74.6 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 90.5 | 95 | 4,866 | 72.3 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 90.5 | 95 | 5,379 | 80 | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 90 | — | — | — | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 90 | — | — | — | |
| COTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 88.5 | 95 | 6,722 | 100 | |
| CRSTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT-based2026.02 | 88.5 | 92.5 | 6,337 | 94.2 | |
| LASERBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 88.5 | 95.5 | 3,137 | 46.6 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 88 | 95 | 3,397 | 50.5 | |
| ER-RLBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL-based2026.02 | 87.5 | 95 | 4,221 | 62.8 | |
| On-Policy SFTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT-based2026.02 | 87.5 | 97.5 | 1,961 | 29.2 | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 87.5 | — | — | — | |
| 4BModel=4B, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 85 | — | — | — | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=Base, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 85 | — | — | — | |
| L1Backbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 83.5 | 92.5 | 2,191 | 32.6 | |
| 4BModel=4B, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 77.5 | — | — | — | |
| L1Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 74.5 | 90 | 2,170 | 23.7 | |
| On-Policy SFTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=SFT-based2026.02 | 73.5 | 90 | 1,977 | 21.6 | |
| COTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 73 | 92.5 | 9,171 | 100 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 72.5 | 90 | 3,942 | 42.9 | |
| TokenSkipBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 72.5 | 72.5 | 9,459 | 140.7 | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 72.5 | — | — | — | |
| ER-RLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=RL-based2026.02 | 72.4 | 92.5 | 4,913 | 53.6 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 72 | 95 | 2,672 | 29.1 | |
| LASERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 72 | 90 | 4,262 | 46.4 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 71.5 | 87.5 | 8,518 | 92.8 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 71 | 92.5 | 6,908 | 75.3 | |
| CRSTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=SFT-based2026.02 | 70.5 | 92.5 | 7,410 | 80.8 | |
| 4BModel=4B, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 67.5 | — | — | — | |
| 4BModel=4B, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 67.5 | — | — | — | |
| 4BModel=4B, RL Algorithm=Base, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 65 | — | — | — | |
| HACPOModel Backbone=Qwen3-8B-Base2026.03 | 62.5 | — | — | — | |
| HACPOModel Backbone=Qwen3-4B-Base2026.03 | 60 | — | — | — | |
| 4BModel=4B, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 60 | — | — | — | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 60 | — | — | — | |
| ARE-GroupAModel=Qwen2.5 (7B-Instruct)2026.03 | 60 | — | — | — | |
| ARE-GroupBModel=Qwen2.5 (7B-Instruct)2026.03 | 57.7 | — | — | — | |
| 4B-BaseModel=4B-Base, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 57.5 | — | — | — | |
| 4B-BaseModel=4B-Base, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 55 | — | — | — | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 55 | — | — | — | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 55 | — | — | — | |
| 4B-BaseModel=4B-Base, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 52.5 | — | — | — | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 52.5 | — | — | — | |
| baseline-GroupBModel=Qwen2.5 (7B-Instruct)2026.03 | 52.5 | — | — | — | |
| baseline-GroupAModel=Qwen2.5 (7B-Instruct)2026.03 | 50 | — | — | — | |
| StepEntropyBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL-based2026.02 | 48.5 | 77.5 | 9,734 | 144.8 | |
| StepEntropyBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=RL-based2026.02 | 47.5 | 77.5 | 9,237 | 100.7 | |
| 4B-BaseModel=4B-Base, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 47.5 | — | — | — | |
| 4B-BaseModel=4B-Base, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 47.5 | — | — | — | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 47.5 | — | — | — | |
| HACPOModel Backbone=Qwen3-1.7B-Base2026.03 | 45 | — | — | — | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 45 | — | — | — | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 45 | — | — | — | |
| 4B-BaseModel=4B-Base, RL Algorithm=Base, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 40 | — | — | — | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=Base, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 40 | — | — | — | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 37.5 | — | — | — | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 37.5 | — | — | — | |
| Base ModelModel=Qwen2.5 (7B-Instruct)2026.03 | 37.5 | — | — | — | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 35 | — | — | — | |
| TokenSkipBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 32.5 | 32.5 | 17,452 | 190.3 | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 32.5 | — | — | — | |
| ARE-GroupAModel=Qwen2.5 (1.5B-Instruct)2026.03 | 32.5 | — | — | — | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=Base, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 30 | — | — | — | |
| Base ModelModel=Qwen2.5 (1.5B-Instruct)2026.03 | 30 | — | — | — | |
| HACPOModel Backbone=Llama3.2-3B-Instruct2026.03 | 27.5 | — | — | — | |
| ARE-GroupCModel=Qwen2.5 (1.5B-Instruct)2026.03 | 27.5 | — | — | — | |
| ARE-GroupCModel=Llama3.1 (8B-Instruct)2026.03 | 27.5 | — | — | — | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 25 | — | — | — | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 22.5 | — | — | — | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 22.5 | — | — | — | |
| baseline-GroupAModel=Qwen2.5 (1.5B-Instruct)2026.03 | 22.5 | — | — | — | |
| baseline-GroupCModel=Qwen2.5 (1.5B-Instruct)2026.03 | 22.5 | — | — | — | |
| baseline-GroupCModel=Llama3.1 (8B-Instruct)2026.03 | 22.5 | — | — | — | |
| ARE-GroupBModel=Llama3.1 (8B-Instruct)2026.03 | 22.5 | — | — | — | |
| HACPOModel Backbone=Llama3.2-1B-Instruct2026.03 | 20 | — | — | — | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=Base, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 20 | — | — | — | |
| baseline-GroupBModel=Llama3.1 (8B-Instruct)2026.03 | 20 | — | — | — | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 17.5 | — | — | — | |
| HACPOModel Backbone=Llama3.2-1B-Instruct, Experimental Context=Heterogeneous Setup2026.03 | 15 | — | — | — | |
| Base ModelModel=Llama3.1 (8B-Instruct)2026.03 | 5 | — | — | — |