Mathematical Reasoning on OlympiadBench (accuracy (%))
68.8AccuracySTARE-C2
Evaluation Results
| Method | Links | |
|---|---|---|
| STARE-C2Scenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 68.8 | |
| JustRLScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 68 | |
| STARE-O1Scenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 67.8 | |
| GPT-o1-miniTool=✗2026.02 | 65.3 | |
| GRPO-dsScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 64.1 | |
| STAPOScenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 63 | |
| 80/20 RuleScenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 62.5 | |
| STARE-C2Scenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 62.3 | |
| STARE-O1Scenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 61.8 | |
| GRPOScenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 61.5 | |
| Lp-RegScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 61.2 | |
| Fast-MathData Volume=7.9K2026.03 | 61 | |
| STARE-C2Scenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 60.9 | |
| EAPOScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 60.8 | |
| GRPOScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 60.3 | |
| STARE-O1Scenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 60.1 | |
| Bidirectional Curriculum Generation (Round 4)Data Volume=5,8732026.03 | 60.08 | |
| KL-CovScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 59.9 | |
| Bidirectional Curriculum Generation (Round 3)Data Volume=4,5942026.03 | 59.35 | |
| EntroAdvScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 59.1 | |
| GRPO-dsScenario=Long CoT, Backbone Model=Qwen3-8B-Base, Model Scale=8B2026.06 | 59 | |
| Raiden-DeepSeek-R1Data Volume=62K2026.03 | 58.75 | |
| GRPOScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 58.7 | |
| DAPOScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 58.4 | |
| LaPha / sg@128Base model=Qwen2.5-Math-7B, Tool=✓2026.02 | 58 | |
| MegaScienceData Volume=1.25M2026.03 | 57.6 | |
| 80/20 RuleScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 57.6 | |
| EntroRegScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 56.2 | |
| W-REINFScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 55.9 | |
| GSPOScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 55.6 | |
| DAPOScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 55.6 | |
| TTSRBackbone Model=Qwen3-8B-Base2026.02 | 55.2 | |
| Base-1.5BScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 55.2 | |
| SimpleTIRScenario=Tool-Use Agent, Backbone Model=Qwen2.5-7B-Base, Model Scale=7B2026.06 | 54.8 | |
| QWQ-LongCoTData Volume=130K2026.03 | 54.15 | |
| GRPO-dsScenario=Short CoT, Backbone Model=Qwen2.5-32B-Base, Model Scale=32B2026.06 | 54 | |
| STARE-C2Scenario=Tool-Use Agent, Backbone Model=Qwen2.5-7B-Base, Model Scale=7B2026.06 | 53.6 | |
| STARE-O1Scenario=Tool-Use Agent, Backbone Model=Qwen2.5-7B-Base, Model Scale=7B2026.06 | 52.3 | |
| Bidirectional Curriculum Generation (Round 2)Data Volume=1,6332026.03 | 51.78 | |
| STARE-C2Scenario=Short CoT, Backbone Model=Qwen2.5-14B-Instruct, Model Scale=14B2026.06 | 51.4 | |
| DeepSeek-R1-7BModel Scale=7B, Decoding Strategy=Greedy2026.03 | 51 | |
| STARE-O1Scenario=Short CoT, Backbone Model=Qwen2.5-14B-Instruct, Model Scale=14B2026.06 | 50.9 | |
| TTRLBackbone Model=Qwen3-8B-Base2026.02 | 50.8 | |
| ToRLBase model=Qwen2.5-Math-7B, Tool=✓2026.02 | 49.9 | |
| ToRLScenario=Tool-Use Agent, Backbone Model=Qwen2.5-7B-Base, Model Scale=7B2026.06 | 49.9 | |
| TreePO / maj@16Base model=Qwen2.5-7B, Tool=✗2026.02 | 49.2 | |
| Bidirectional Curriculum Generation (Round 1)Data Volume=8502026.03 | 48.81 | |
| GRPO-dsScenario=Tool-Use Agent, Backbone Model=Qwen2.5-7B-Base, Model Scale=7B2026.06 | 48.8 | |
| R-ZeroBackbone Model=Qwen3-8B-Base2026.02 | 48.6 | |
| MATHFusionData Volume=74732026.03 | 48.22 | |
| DGPOScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 48 | |
| FIM-TIESModel Scale=7B, Decoding Strategy=Greedy2026.03 | 47.9 | |
| Qwen3-8B-baseData Volume=-2026.03 | 47.2 | |
| LIMO2Data Volume=8002026.03 | 46.74 | |
| HACPOModel Backbone=Qwen3-8B-Base2026.03 | 46.7 | |
| ACM-TAModel Scale=7B, Decoding Strategy=Greedy2026.03 | 46.7 | |
| ACM-TIESModel Scale=7B, Decoding Strategy=Greedy2026.03 | 46.4 | |
| HACPOModel Backbone=Qwen3-4B-Base2026.03 | 46.3 | |
| LaPha / sg@128Base model=Qwen2.5-7B, Tool=✓2026.02 | 46 | |
| TTRLBackbone Model=Qwen3-4B-Base2026.02 | 46 | |
| CISPOScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 45.8 | |
| CE-GPPO (Row 2)Scenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 45.6 | |
| 80/20 RuleScenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 45.5 | |
| TTSRBackbone Model=Qwen3-4B-Base2026.02 | 45.3 | |
| STARE-C2Scenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 45.3 | |
| EAPOScenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 45.1 | |
| SFTBase model=Qwen2.5-Math-7B, Tool=✓2026.02 | 45 | |
| Task ArithmeticModel Scale=7B, Decoding Strategy=Greedy2026.03 | 45 | |
| ASPOScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 44.9 | |
| STARE-O1Scenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 44.7 | |
| OpenO1-SFTData Volume=77K2026.03 | 44.51 | |
| EntroAdvScenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 44.5 | |
| FIM-TAModel Scale=7B, Decoding Strategy=Greedy2026.03 | 44.3 | |
| SPECSBeam Width (n)=16, Backbone=Qwen2.5-Math-Instruct2025.06 | 44.2 | |
| KL-CovScenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 44.2 | |
| ToRLBase model=Qwen2.5-Math-1.5B, Tool=✓2026.02 | 44 | |
| R-ZeroBackbone Model=Qwen3-4B-Base2026.02 | 44 | |
| Sens-MergingModel Scale=7B, Decoding Strategy=Greedy2026.03 | 43.9 | |
| DAPOScenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 43.9 | |
| CE-GPPOScenario=Long CoT, Backbone Model=DeepSeek-R1-Distill-Qwen-1.5B, Model Scale=1.5B2026.06 | 43.9 | |
| DAPOBase model=Qwen2.5-Math-7B, Tool=✗2026.02 | 43.5 | |
| GRPO-dsScenario=Short CoT, Backbone Model=Qwen2.5-14B-Instruct, Model Scale=14B2026.06 | 43.4 | |
| GPT-4oTool=✗2026.02 | 43.3 | |
| STEERScenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 43.3 | |
| TIES-MergingModel Scale=7B, Decoding Strategy=Greedy2026.03 | 43 | |
| GRPOScenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 42.8 | |
| EntroRegScenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 42.8 | |
| DAPOBase model=Qwen2.5-Math-1.5B, Tool=✗2026.02 | 42.7 | |
| GRPO-dsScenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 42.6 | |
| PrimeBase model=Qwen2.5-Math-7B, Tool=✗2026.02 | 42.1 | |
| SPECSBeam Width (n)=4, Backbone=Qwen2.5-Math-Instruct2025.06 | 41.7 | |
| SFTBase model=Qwen2.5-Math-1.5B, Tool=✓2026.02 | 41.3 | |
| Base ModelBackbone Model=Qwen3-8B-Base2026.02 | 41.2 | |
| GSIBeam Width (n)=16, Backbone=Qwen2.5-Math-Instruct2025.06 | 40.8 | |
| Base ModelBackbone Model=Qwen3-4B-Base2026.02 | 40.2 | |
| LaPha / sg@128Base model=Qwen2.5-Math-1.5B, Tool=✓2026.02 | 40 | |
| GSIBeam Width (n)=4, Backbone=Qwen2.5-Math-Instruct2025.06 | 39.7 | |
| W-REINFScenario=Short CoT, Backbone Model=Qwen2.5-Math-7B-Base, Model Scale=7B2026.06 | 38.9 | |
| DPPOModel=Qwen3-8B, Speedup=1.90×, rq=0.9, ro=0.92026.03 | 38.06 | |
| DPPOModel=Qwen3-4B, Speedup=2.37×, rq=0.9, ro=0.92026.03 | 38.02 |