Mathematical Reasoning on Olympiad (Accuracy)
73.2Accuracy4B-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| 4B-InstructModel=4B-Instruct, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 73.2 | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 72.6 | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=Base, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 72.2 | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 72 | |
| STAPOBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 71.62 | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 71.1 | |
| JustRLBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 68.81 | |
| STAPOBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 68.21 | |
| GRPOBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 64.76 | |
| 4BModel=4B, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 64.3 | |
| GRPOBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 64.28 | |
| 20-EntropyBase Model=Qwen3-14B, Evaluation Setting=JustRL2026.02 | 63.95 | |
| STAPOBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 63.32 | |
| STAPOBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 62.98 | |
| 20-EntropyBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 62.5 | |
| GRPOBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 61.5 | |
| 20-EntropyBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 61.3 | |
| 20-EntropyBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 60.39 | |
| 4BModel=4B, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 59.2 | |
| GRPOBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 58.34 | |
| 4BModel=4B, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 57.9 | |
| JustRLBase Model=Qwen3-14B, Evaluation Setting=Training-Aligned2026.02 | 57.01 | |
| JustRLBase Model=Qwen3-8B, Evaluation Setting=JustRL2026.02 | 56.57 | |
| 4BModel=4B, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 56.4 | |
| 4B-InstructModel=4B-Instruct, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 55.2 | |
| 4BModel=4B, RL Algorithm=Base, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 52.4 | |
| JustRLBase Model=Qwen3-8B, Evaluation Setting=Training-Aligned2026.02 | 51.26 | |
| BAPORollouts=733k, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 50.06 | |
| DAPORollouts=1921k, Type=on, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 48.48 | |
| 4B-BaseModel=4B-Base, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 46.7 | |
| 4B-BaseModel=4B-Base, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 46.3 | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 46.3 | |
| GRPO (v = 5)Rollouts=677k, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 46.18 | |
| 4B-BaseModel=4B-Base, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 46 | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 46 | |
| MoPPSRollouts=737k, Type=on, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 45.93 | |
| RePORollouts=677k, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 45.44 | |
| 4B-BaseModel=4B-Base, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 45.4 | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 45.4 | |
| GRPORollouts=677k, Type=on, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 45.33 | |
| DeepSeek R1 Distill Qwen 1.5BRollouts=N/A, Type=N/A2026.02 | 44.42 | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 44.2 | |
| Remix-GRPORollouts=N/A, Type=off, Backbone=DeepSeek R1 Distill Qwen 1.5B2026.02 | 43.55 | |
| CAPO (GRPO)Backbone=Qwen2.5-7B-Math2025.12 | 39.7 | |
| 4BModel=4B, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-4B + Qwen3-4B-Instruct2026.03 | 39.4 | |
| STAPOBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 38.54 | |
| STAPOBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 37.87 | |
| CAPO (PPO)Backbone=Qwen2.5-7B-Math2025.12 | 37.8 | |
| Reinforce++Backbone=Qwen2.5-7B-Math2025.12 | 37.2 | |
| CAPO (Reinforce++)Backbone=Qwen2.5-7B-Math2025.12 | 37.2 | |
| GRPOBackbone=Qwen2.5-7B-Math2025.12 | 36.9 | |
| RLOOBackbone=Qwen2.5-7B-Math2025.12 | 36 | |
| 20-EntropyBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 35.65 | |
| CAPO (RLOO)Backbone=Qwen2.5-7B-Math2025.12 | 35.6 | |
| 4B-BaseModel=4B-Base, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 35.4 | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 35.4 | |
| 4B-BaseModel=4B-Base, RL Algorithm=Base, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 34.7 | |
| qwen3-4BModel=qwen3-4B, RL Algorithm=Base, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 34.7 | |
| 20-EntropyBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 34.35 | |
| JustRLBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 34.16 | |
| PPOBackbone=Qwen2.5-7B-Math2025.12 | 34.1 | |
| CAPO (RLOO)Backbone=Qwen2.5-1.5B-Math2025.12 | 33.2 | |
| CAPO (PPO)Backbone=Qwen2.5-1.5B-Math2025.12 | 33 | |
| CAPO (GRPO)Backbone=Qwen2.5-1.5B-Math2025.12 | 32.9 | |
| RLOOBackbone=Qwen2.5-1.5B-Math2025.12 | 32 | |
| Reinforce++Backbone=Qwen2.5-1.5B-Math2025.12 | 31.7 | |
| CAPO (Reinforce++)Backbone=Qwen2.5-1.5B-Math2025.12 | 31.6 | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 31.4 | |
| GRPOBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 30.64 | |
| GRPOBase Model=Qwen3-1.7B, Evaluation Setting=JustRL2026.02 | 30.64 | |
| GRPOBackbone=Qwen2.5-1.5B-Math2025.12 | 30.1 | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 29.8 | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 29.3 | |
| JustRLBase Model=Qwen3-1.7B, Evaluation Setting=Training-Aligned2026.02 | 29.15 | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 28.7 | |
| CoTBackbone=Qwen2.5-7B-Math2025.12 | 27.8 | |
| CoTBackbone=Qwen2.5-1.5B-Math2025.12 | 27.6 | |
| PPOBackbone=Qwen2.5-1.5B-Math2025.12 | 27.1 | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 26.3 | |
| TARSEs2026.03 | 24.7 | |
| 1.7B-BaseModel=1.7B-Base, RL Algorithm=Base, Heterogeneity Setting=Qwen3-1.7B-Base + Qwen3-4B-Base2026.03 | 22.9 | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=HACPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 20.8 | |
| rStar-Qwen2Backbone=Qwen22026.03 | 20 | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=GRPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 17.4 | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=GSPO, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 17 | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=GSPO×2, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 15.9 | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=Base, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 15.8 | |
| llama3.2-3BModel=llama3.2-3B, RL Algorithm=Naive, Heterogeneity Setting=Qwen3-4B-Base + Llama3.2-3B-Instruct2026.03 | 10.7 | |
| Qwen2-7B-InstructType=Instruct, Parameters=7B2026.03 | 0.04 | |
| NuminaMath-7B-COTType=Chain-of-Thought, Parameters=7B2026.03 | 0.03 |