Mathematical Reasoning on AIME 2024 (Acc@16, Pass@16)
50.8Accuracy @16Teacher
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TeacherBackbone=JustRL-1.5B2026.06 | 50.8 | — | — | |
| OPRD2026.06 | 49.8 | — | — | |
| OPD top-162026.06 | 47.1 | — | — | |
| GRPOModel Size=Qwen3-8B, Training Domain=Physics2026.05 | 44.44 | — | — | |
| GRPOModel Size=Qwen3-8B, Training Domain=Chemistry2026.05 | 43.06 | — | — | |
| OPD top-1Variant=sampled-token2026.06 | 42.3 | — | — | |
| GRPOModel Size=Qwen3-8B, Training Domain=Material2026.05 | 39.58 | — | — | |
| GRPOModel Size=Qwen3-8B, Training Domain=Biology2026.05 | 38.89 | — | — | |
| GRPOModel Size=Qwen3-4B, Training Domain=Material2026.05 | 38.89 | — | — | |
| GRPOModel Size=Qwen3-8B, Training Domain=ToolUse2026.05 | 36.11 | — | — | |
| GRPOModel Size=Qwen3-4B, Training Domain=Chemistry2026.05 | 35.42 | — | — | |
| GRPOModel Size=Qwen3-4B, Training Domain=Physics2026.05 | 35.42 | — | — | |
| ROSDModel Size=Qwen3-8B, Training Domain=Chemistry2026.05 | 34.03 | — | — | |
| ROSDModel Size=Qwen3-8B, Training Domain=Material2026.05 | 34.03 | — | — | |
| SDPOModel Size=Qwen3-4B, Training Domain=Biology2026.05 | 33.33 | — | — | |
| ROSDModel Size=Qwen3-8B, Training Domain=Physics2026.05 | 33.33 | — | — | |
| GRPOModel Size=Qwen3-4B, Training Domain=ToolUse2026.05 | 33.33 | — | — | |
| ROSDModel Size=Qwen3-8B, Training Domain=ToolUse2026.05 | 33.33 | — | — | |
| StudentBackbone=R1-distill-1.5B2026.06 | 32.9 | — | — | |
| ROSDModel Size=Qwen3-8B, Training Domain=Biology2026.05 | 32.64 | — | — | |
| ROSDModel Size=Qwen3-4B, Training Domain=Biology2026.05 | 31.94 | — | — | |
| SDPOModel Size=Qwen3-8B, Training Domain=ToolUse2026.05 | 31.94 | — | — | |
| ROSDModel Size=Qwen3-4B, Training Domain=ToolUse2026.05 | 31.94 | — | — | |
| GRPOModel Size=Qwen3-4B, Training Domain=Biology2026.05 | 31.25 | — | — | |
| SDPOModel Size=Qwen3-8B, Training Domain=Biology2026.05 | 31.25 | — | — | |
| ROSDModel Size=Qwen3-4B, Training Domain=Chemistry2026.05 | 30.56 | — | — | |
| ROSDModel Size=Qwen3-4B, Training Domain=Material2026.05 | 29.86 | — | — | |
| SDPOModel Size=Qwen3-8B, Training Domain=Physics2026.05 | 29.17 | — | — | |
| ROSDModel Size=Qwen3-4B, Training Domain=Physics2026.05 | 28.47 | — | — | |
| GRPOBase Model=Qwen2.5-Math-7B2026.02 | 25.9 | 46.9 | — | |
| GRPOBase Model=Qwen3-8B2026.02 | 25.7 | 47.5 | — | |
| SDPOModel Size=Qwen3-8B, Training Domain=Material2026.05 | 25 | — | — | |
| PROF-POSModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 24.8 | — | — | |
| URSBase Model=Qwen3-8B2026.02 | 24.5 | 47.4 | — | |
| RPCBase Model=Qwen3-8B2026.02 | 23.6 | 44.2 | — | |
| PowerSamplingBackbone=Qwen2.5-Math-7B2026.03 | 23.3 | — | — | |
| Low-tempBackbone=Qwen2.5-Math-7B2026.03 | 23.1 | — | — | |
| GRPOBackbone=Qwen2.5-Math-7B2026.03 | 22.7 | — | — | |
| TTRLBackbone=Qwen2.5-Math-7B2026.03 | 21.7 | — | — | |
| GRPOModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 20.6 | — | — | |
| PowerFlowBackbone=Qwen2.5-Math-7B2026.03 | 20 | — | — | |
| URSBase Model=Qwen2.5-Math-7B2026.02 | 19 | 36 | — | |
| Det. Trunc.Base Model=Qwen3-8B2026.02 | 19 | 48.8 | — | |
| One-shot EMBackbone=Qwen2.5-Math-7B2026.03 | 18.1 | — | — | |
| PROF-BOTHModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 17.5 | — | — | |
| RPCBase Model=Qwen2.5-Math-7B2026.02 | 17 | 40.5 | — | |
| EMPOBackbone=Qwen2.5-Math-7B2026.03 | 15.8 | — | — | |
| BlendModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 15.2 | — | — | |
| Qwen2.5-32B-InstructBackbone=Qwen2.5-32B-Instruct2026.03 | 13.1 | — | — | |
| BaseModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 12.9 | — | — | |
| InstructBackbone=Qwen2.5-Math-7B2026.03 | 12.5 | — | — | |
| EMPOBackbone=Qwen2.5-Math-1.5B2026.03 | 12.3 | — | — | |
| BaseBackbone=Qwen2.5-Math-7B2026.03 | 12.3 | — | — | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.03 | 11.2 | — | — | |
| SDPOModel Size=Qwen3-4B, Training Domain=ToolUse2026.05 | 11.11 | — | — | |
| PowerFlowBackbone=Qwen2.5-Math-1.5B2026.03 | 10.8 | — | — | |
| PowerFlowBackbone=Llama-3.2-3B-Instruct2026.03 | 10.7 | — | — | |
| PROF-POSModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 10.6 | — | — | |
| InstructBackbone=Qwen2.5-Math-1.5B2026.03 | 10.2 | — | — | |
| Low-tempBackbone=Llama-3.2-3B-Instruct2026.03 | 9.6 | — | — | |
| PROF-BOTHModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 9.6 | — | — | |
| Low-tempBackbone=Qwen2.5-Math-1.5B2026.03 | 9.4 | — | — | |
| IntuitorBackbone=Llama-3.2-3B-Instruct2026.03 | 9.2 | — | — | |
| SDPOModel Size=Qwen3-8B, Training Domain=Chemistry2026.05 | 9.03 | — | — | |
| GRPOModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 9 | — | — | |
| SDPOModel Size=Qwen3-4B, Training Domain=Physics2026.05 | 8.33 | — | — | |
| GRPOBackbone=Qwen2.5-Math-1.5B2026.03 | 8.1 | — | — | |
| BlendModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 7.7 | — | — | |
| PROF-POSModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 6.7 | — | — | |
| Format-onlyBackbone=Qwen2.5-Math-1.5B2026.03 | 5.6 | — | — | |
| PROF-BOTHModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 5.4 | — | — | |
| GRPOModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 5 | — | — | |
| SDPOModel Size=Qwen3-4B, Training Domain=Material2026.05 | 4.86 | — | — | |
| BaseBackbone=Qwen2.5-Math-1.5B2026.03 | 4.6 | — | — | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.03 | 4 | — | — | |
| Det. Trunc.Base Model=Qwen2.5-Math-7B2026.02 | 3.7 | 7.2 | — | |
| BaseModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 3.5 | — | — | |
| BaseModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 2.3 | — | — | |
| IntuitorBackbone=Qwen2.5-1.5B2026.03 | 1.5 | — | — | |
| GRPOBackbone=Qwen2.5-1.5B2026.03 | 1 | — | — | |
| BlendModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 1 | — | — | |
| Low-tempBackbone=Qwen2.5-1.5B2026.03 | 0.8 | — | — | |
| PowerFlowBackbone=Qwen2.5-1.5B2026.03 | 0.8 | — | — | |
| InstructBackbone=Qwen2.5-1.5B2026.03 | 0.8 | — | — | |
| BaseBackbone=Qwen2.5-1.5B2026.03 | 0 | — | — | |
| SDPOModel Size=Qwen3-4B, Training Domain=Chemistry2026.05 | 0 | — | — | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-1.7B2026.06 | — | 71.72 | 56.87 | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-4B2026.06 | — | 83.6 | 77.5 | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-8B2026.06 | — | 86.37 | 77.7 | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-14B2026.06 | — | 88.1 | 81.25 | |
| Sparse with LoRA Distillation (DistillSparse)Model Backbone=Qwen3-1.7B2026.06 | — | 69.29 | 53.33 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-1.7B, Sparsity Level=0.862026.06 | — | 69.58 | 54.16 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-4B, Sparsity Level=0.862026.06 | — | 83.2 | 75.6 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-8B, Sparsity Level=0.862026.06 | — | 84.41 | 77.91 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-14B, Sparsity Level=0.862026.06 | — | 86.96 | 80.28 | |
| Sparsity setup (0.92) RolloutModel Backbone=Qwen3-1.7B, Sparsity Level=0.922026.06 | — | 71.55 | 57.7 | |
| Sparsity setup (0.92) RolloutModel Backbone=Qwen3-4B, Sparsity Level=0.922026.06 | — | 83.6 | 77.29 | |
| Sparsity setup (0.92) RolloutModel Backbone=Qwen3-8B, Sparsity Level=0.922026.06 | — | 84.56 | 78.15 |