Math Reasoning on OlympiadBench (Acc, Tok, AES)
70.3AccuracyDECS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DECSModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 70.3 | 3,283 | 0.79 | |
| S-GRPOModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 69.7 | 3,914 | 0.68 | |
| TLMREModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 69.6 | 4,454 | 0.6 | |
| ATTNPOModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 68.7 | 2,912 | 0.77 | |
| Laser-DEModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 66.8 | 3,643 | 0.58 | |
| Laser-DModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 66.7 | 3,914 | 0.54 | |
| VSRM-R++Model Size=7B, Learning Paradigm=process-supervised RL2026.02 | 66.1 | 5,470 | 0.3 | |
| AutoThinkModel Size=7B, Learning Paradigm=adaptive-mode2026.02 | 65.5 | 5,133 | 0.32 | |
| AdaptThinkModel Size=7B, Learning Paradigm=adaptive-mode2026.02 | 65.5 | 5,574 | 0.26 | |
| DS-7BModel Size=7B2026.02 | 65.1 | 7,358 | 0 | |
| LC-R1Model Size=7B, Learning Paradigm=process-supervised RL2026.02 | 64.1 | 4,144 | 0.36 | |
| ATTNPOModel Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 57.1 | 3,133 | 1.13 | |
| TLMREModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 56.9 | 4,270 | 0.99 | |
| DECSModel Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 56.1 | 3,396 | 1.04 | |
| VSRM-R++Model Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 54.8 | 4,388 | 0.85 | |
| TABBudget=10k2026.04 | 54.7 | 7,668 | — | |
| TABModel Variant=4B, Budget=10k2026.04 | 54.6 | 7,314 | — | |
| Laser-DModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 54.4 | 4,700 | 0.79 | |
| Laser-DEModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 54.4 | 5,151 | 0.74 | |
| TAB All-SubQBudget=10k2026.04 | 53.9 | 6,705 | — | |
| StaticBudget=40962026.04 | 53.4 | 11,090 | — | |
| TABModel Variant=4B, Budget=8k2026.04 | 53.4 | 6,003 | — | |
| TAB All-SubQBudget=8k2026.04 | 52.5 | 6,309 | — | |
| AutoThinkModel Size=1.5B, Learning Paradigm=adaptive-mode2026.02 | 51.6 | 5,053 | 0.58 | |
| TABBudget=8k2026.04 | 51.5 | 5,680 | — | |
| ThinkPruneModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 51.4 | 3,535 | 0.74 | |
| AdaptThinkModel Size=1.5B, Learning Paradigm=adaptive-mode2026.02 | 50.8 | 3,708 | 0.68 | |
| TAB All-SubQBudget=5k2026.04 | 50.6 | 3,345 | — | |
| L-JProtocol=Multi-Turn2026.04 | 50.3 | 5,758 | — | |
| L-JProtocol=Multi-Turn, Strategy=All-SubQ2026.04 | 49.6 | 5,992 | — | |
| L-JProtocol=Multi-Turn, Model Variant=4B2026.04 | 49.5 | 4,719 | — | |
| DS-1.5BModel Size=1.5B2026.02 | 49.3 | 9,034 | 0 | |
| StaticBudget=20482026.04 | 48.8 | 6,097 | — | |
| L-JProtocol=Individual2026.04 | 48.8 | 6,139 | — | |
| TABModel Variant=4B, Budget=5k2026.04 | 48.8 | 3,793 | — | |
| TABBudget=5k2026.04 | 48.7 | 3,669 | — | |
| L-JProtocol=Individual, Model Variant=4B2026.04 | 48.5 | 4,686 | — | |
| LC-R1Model Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 48.1 | 4,546 | 0.38 | |
| TABModel Variant=4B, Budget=3k2026.04 | 46.6 | 2,730 | — | |
| StaticBudget=10242026.04 | 45.4 | 4,122 | — | |
| TAB All-SubQBudget=3k2026.04 | 45.4 | 2,761 | — | |
| TABBudget=3k2026.04 | 45.3 | 2,690 | — | |
| StaticBudget=5122026.04 | 43.3 | 2,717 | — | |
| StaticBudget=2562026.04 | 42.6 | 2,129 | — |