Math Reasoning on MATH 500 (Acc., Tok., AES)
94.4AccuracyDEPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DEPOModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 94.4 | 2,318 | 0.43 | |
| TLMREModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 93.8 | 1,700 | 0.59 | |
| DECSModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 93 | 1,728 | 0.55 | |
| ATTNPOModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 92.8 | 1,300 | 0.66 | |
| S-GRPOModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 92.4 | 2,252 | 0.39 | |
| Laser-DModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 92.2 | 1,836 | 0.5 | |
| DIETModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 92.1 | 3,187 | 0.12 | |
| DS-7BModel Size=7B2026.02 | 92 | 3,593 | 0 | |
| AdaptThinkModel Size=7B, Learning Paradigm=adaptive-mode2026.02 | 92 | 1,875 | 0.48 | |
| Laser-DEModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 92 | 1,658 | 0.54 | |
| ACPOModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 91.6 | 1,405 | 0.59 | |
| AutoThinkModel Size=7B, Learning Paradigm=adaptive-mode2026.02 | 91.2 | 2,146 | 0.36 | |
| LC-R1Model Size=7B, Learning Paradigm=process-supervised RL2026.02 | 90.4 | 1,568 | 0.48 | |
| VSRM-R++Model Size=7B, Learning Paradigm=process-supervised RL2026.02 | 89.8 | 2,044 | 0.31 | |
| DEPOModel Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 87.2 | 2,762 | 0.69 | |
| TAB All-SubQBudget=10k2026.04 | 87.2 | 5,424 | — | |
| TABBudget=10k2026.04 | 86.6 | 6,350 | — | |
| TABModel Variant=4B, Budget=10k2026.04 | 86.2 | 6,032 | — | |
| ATTNPOModel Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 86 | 1,318 | 0.9 | |
| TLMREModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 85.8 | 1,915 | 0.79 | |
| StaticBudget=40962026.04 | 85.8 | 10,468 | — | |
| TABModel Variant=4B, Budget=8k2026.04 | 85.8 | 4,420 | — | |
| DECSModel Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 84.4 | 1,817 | 0.76 | |
| TABBudget=8k2026.04 | 84.4 | 4,987 | — | |
| Laser-DModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 84.2 | 1,872 | 0.74 | |
| AutoThinkModel Size=1.5B, Learning Paradigm=adaptive-mode2026.02 | 84 | 2,195 | 0.67 | |
| L-JProtocol=Multi-Turn, Strategy=All-SubQ2026.04 | 84 | 5,245 | — | |
| TAB All-SubQBudget=8k2026.04 | 84 | 5,224 | — | |
| TABModel Variant=4B, Budget=5k2026.04 | 83.8 | 3,315 | — | |
| Laser-DEModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 83.5 | 1,949 | 0.7 | |
| L-JProtocol=Individual2026.04 | 83.4 | 5,418 | — | |
| TAB All-SubQBudget=5k2026.04 | 83.4 | 2,742 | — | |
| ThinkPruneModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 83.2 | 1,938 | 0.69 | |
| StaticBudget=20482026.04 | 83.2 | 5,543 | — | |
| TABBudget=5k2026.04 | 83.2 | 3,018 | — | |
| DIETModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 83 | 3,061 | 0.48 | |
| L-JProtocol=Individual, Model Variant=4B2026.04 | 82.8 | 3,573 | — | |
| L-JProtocol=Multi-Turn, Model Variant=4B2026.04 | 82.8 | 3,686 | — | |
| LC-R1Model Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 82.5 | 2,233 | 0.61 | |
| DS-1.5BModel Size=1.5B2026.02 | 82.1 | 5,534 | 0 | |
| AdaptThinkModel Size=1.5B, Learning Paradigm=adaptive-mode2026.02 | 82 | 1,782 | 0.67 | |
| L-JProtocol=Multi-Turn2026.04 | 82 | 4,951 | — | |
| VSRM-R++Model Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 81.7 | 2,597 | 0.51 | |
| ACPOModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 81 | 1,679 | 0.63 | |
| StaticBudget=10242026.04 | 81 | 3,697 | — | |
| TAB All-SubQBudget=3k2026.04 | 81 | 2,326 | — | |
| TABModel Variant=4B, Budget=3k2026.04 | 81 | 2,229 | — | |
| TABBudget=3k2026.04 | 80.5 | 2,226 | — | |
| StaticBudget=5122026.04 | 80 | 2,322 | — | |
| StaticBudget=2562026.04 | 78.6 | 1,746 | — | |
| CoScale-RL2026.01 | 40.7 | — | — | |
| Qwen2.5-0.5B Instruct2026.01 | 24.7 | — | — | |
| SFTed (w/ Data Scaling)Data Scaling=Yes2026.01 | 23.2 | — | — | |
| Pretrain + RL2026.01 | 20.8 | — | — | |
| SpeedControl2026.01 | 20.6 | — | — | |
| SAPO2026.01 | 20.2 | — | — | |
| Scale-RL2026.01 | 19.1 | — | — | |
| SFTed (w/o Data Scaling)Data Scaling=No2026.01 | 17.9 | — | — | |
| COMPASS2026.01 | 17 | — | — | |
| GRPO2026.01 | 16.7 | — | — |