Mathematical Reasoning on Minerva (Accuracy @avg1)
54.9Accuracy (@avg1)TTSR
Evaluation Results
| Method | Links | |
|---|---|---|
| TTSRBackbone Model=Qwen3-8B-Base2026.02 | 54.9 | |
| TTSRBackbone Model=Qwen3-4B-Base2026.02 | 53 | |
| TTRLBackbone Model=Qwen3-8B-Base2026.02 | 50.2 | |
| R-ZeroBackbone Model=Qwen3-8B-Base2026.02 | 47.8 | |
| TTRLBackbone Model=Qwen3-4B-Base2026.02 | 43.6 | |
| HACPOModel Backbone=Qwen3-8B-Base2026.03 | 42.3 | |
| R-ZeroBackbone Model=Qwen3-4B-Base2026.02 | 40.7 | |
| CAPO (Reinforce++)Backbone=Qwen2.5-7B-Math2025.12 | 40.1 | |
| Base ModelBackbone Model=Qwen3-8B-Base2026.02 | 39.6 | |
| GRPOBackbone=Qwen2.5-Math-7B2025.11 | 38.6 | |
| KL-CovBackbone=Qwen2.5-Math-7B2025.11 | 38.2 | |
| KL-CovBackbone=Qwen2.5-Base-7B2025.11 | 37.9 | |
| CAPO (PPO)Backbone=Qwen2.5-7B-Math2025.12 | 37.9 | |
| Forking TokensBackbone=Qwen2.5-Math-7B2025.11 | 37.8 | |
| LESSBackbone=Qwen2.5-Math-7B2025.11 | 37.8 | |
| Forking TokensBackbone=Qwen2.5-Base-7B2025.11 | 37.5 | |
| GRPOBackbone=Qwen2.5-Base-7B2025.11 | 37.1 | |
| LESSBackbone=Qwen2.5-Base-7B2025.11 | 37.1 | |
| Reinforce++Backbone=Qwen2.5-7B-Math2025.12 | 37.1 | |
| HACPOModel Backbone=Qwen3-4B-Base2026.03 | 36.4 | |
| CAPO (RLOO)Backbone=Qwen2.5-7B-Math2025.12 | 36 | |
| RLOOBackbone=Qwen2.5-7B-Math2025.12 | 35.5 | |
| PPOBackbone=Qwen2.5-7B-Math2025.12 | 34.2 | |
| CAPO (Reinforce++)Backbone=Qwen2.5-1.5B-Math2025.12 | 34.2 | |
| TTSRBackbone Model=OctoThinker-8B-Hybrid-Base2026.02 | 34.1 | |
| CAPO (RLOO)Backbone=Qwen2.5-1.5B-Math2025.12 | 33.8 | |
| CAPO (GRPO)Backbone=Qwen2.5-7B-Math2025.12 | 33.1 | |
| Base ModelBackbone Model=Qwen3-4B-Base2026.02 | 32.4 | |
| CAPO (GRPO)Backbone=Qwen2.5-1.5B-Math2025.12 | 32 | |
| Reinforce++Backbone=Qwen2.5-1.5B-Math2025.12 | 32 | |
| LESSBackbone=Qwen2.5-Math-1.5B2025.11 | 30.8 | |
| HACPOModel Backbone=Qwen3-1.7B-Base2026.03 | 30.5 | |
| GRPOBackbone=Qwen2.5-7B-Math2025.12 | 29.4 | |
| Forking TokensBackbone=Qwen2.5-Math-1.5B2025.11 | 29 | |
| Base LLMBackbone=Qwen2.5-Math-7B2025.11 | 28.7 | |
| RLOOBackbone=Qwen2.5-1.5B-Math2025.12 | 28.7 | |
| KL-CovBackbone=Qwen2.5-Math-1.5B2025.11 | 27.9 | |
| M_RLP + PostPre-training Condition=Reinforcement Learning from Pretraining, Post-training=SFT + RLVR2025.09 | 27.8 | |
| GRPOBackbone=Qwen2.5-Math-1.5B2025.11 | 27.2 | |
| GRPOBackbone=Qwen2.5-1.5B-Math2025.12 | 26.8 | |
| TTRLBackbone Model=OctoThinker-8B-Hybrid-Base2026.02 | 26.4 | |
| M_CPT + PostPre-training Condition=Continuous Pretraining, Post-training=SFT + RLVR2025.09 | 26.1 | |
| CAPO (PPO)Backbone=Qwen2.5-1.5B-Math2025.12 | 25.4 | |
| M_base + PostPre-training Condition=Base, Post-training=SFT + RLVR2025.09 | 25.3 | |
| PPOBackbone=Qwen2.5-1.5B-Math2025.12 | 24.6 | |
| CoTBackbone=Qwen2.5-1.5B-Math2025.12 | 24.3 | |
| R-ZeroBackbone Model=OctoThinker-8B-Hybrid-Base2026.02 | 22.9 | |
| CoTBackbone=Qwen2.5-7B-Math2025.12 | 22.5 | |
| M_RLPPre-training Condition=Reinforcement Learning from Pretraining, Post-training=None2025.09 | 21.19 | |
| HACPOModel Backbone=Llama3.2-3B-Instruct2026.03 | 19.9 | |
| M_CPTPre-training Condition=Continuous Pretraining, Post-training=None2025.09 | 19.03 | |
| Base LLMBackbone=Qwen2.5-Base-7B2025.11 | 18 | |
| Base LLMBackbone=Qwen2.5-Math-1.5B2025.11 | 15.8 | |
| M_basePre-training Condition=Base, Post-training=None2025.09 | 15.3 | |
| Base ModelBackbone Model=OctoThinker-8B-Hybrid-Base2026.02 | 15.2 | |
| HACPOModel Backbone=Llama3.2-1B-Instruct2026.03 | 8.1 | |
| HACPOModel Backbone=Llama3.2-1B-Instruct, Experimental Context=Heterogeneous Setup2026.03 | 6.6 |