Mathematical Reasoning on AIME 24 (Pass@1 accuracy)
82.7Pass@1 AccuracySRGen
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SRGenModel=Qwen3-32B2025.10 | 82.7 | — | |
| CL-EGRSDBackbone=Qwen3-8B2026.05 | 77.22 | — | |
| CoTModel=Qwen3-32B2025.10 | 76.7 | — | |
| Self-RefineModel=Qwen3-32B2025.10 | 76.7 | — | |
| EGRSDBackbone=Qwen3-8B2026.05 | 76.67 | — | |
| CRISPBackbone=Qwen3-8B2026.05 | 76.04 | — | |
| GRPOBackbone=Qwen3-8B2026.05 | 75.28 | — | |
| Baseline (no-train)Backbone=Qwen3-8B2026.05 | 75.11 | — | |
| OPSDBackbone=Qwen3-8B2026.05 | 73.75 | — | |
| SFTBackbone=Qwen3-8B2026.05 | 73.61 | — | |
| SRGenModel=DS-R1-Qwen-7B2025.10 | 61.3 | — | |
| LoRA-αModel=7B2026.06 | 55.52 | — | |
| PieceHint-Nemotron-1.5BModel Name=Nemotron-1.5B, Model Size=1.5B, Method Type=PieceHint2026.04 | 54.5 | — | |
| LoRA (10× LR)Model=7B2026.06 | 53.33 | — | |
| SRGenModel=DS-R1-Llama-8B2025.10 | 53.3 | — | |
| DeepSeek-R1-Distill-32BModel Name=DeepSeek-R1-Distill-32B, Model Size=32B, Method Type=Baseline2026.04 | 53.1 | — | |
| Self-RefineModel=DS-R1-Qwen-7B2025.10 | 52 | — | |
| Base modelModel=7B2026.06 | 51.82 | — | |
| LoRAModel=7B2026.06 | 51.82 | — | |
| CoTModel=DS-R1-Qwen-7B2025.10 | 49.3 | — | |
| Self-RefineModel=DS-R1-Llama-8B2025.10 | 48.7 | — | |
| CoTModel=DS-R1-Llama-8B2025.10 | 48 | — | |
| Qwen3-4BModel Name=Qwen3-4B, Model Size=4B, Method Type=Baseline2026.04 | 47.5 | — | |
| HmmBackbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 47.24 | — | |
| WaitBackbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 47.19 | — | |
| LearnedBackbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 46.82 | — | |
| Qwen3-4B +CASTModel Scale=4B, Method=+CAST2026.05 | 46.7 | — | |
| AlternativelyBackbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 46.46 | — | |
| CritiqueBackbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 46.41 | — | |
| Baseline (w/o BF)Backbone Model=DS-R1-Qwen-7B, Cmax=3, Bmax=92162025.06 | 46.09 | — | |
| o1-previewEvaluation Protocol=zero-shot pass@12026.05 | 44.6 | — | |
| Nemotron-1.5BModel Name=Nemotron-1.5B, Model Size=1.5B, Method Type=Baseline2026.04 | 44 | — | |
| DeepScaleR-1.5B-PreviewFine-tuning Samples=40,000, Evaluation Protocol=zero-shot pass@12026.05 | 43.1 | — | |
| PieceHint-Qwen3-1.7BModel Name=Qwen3-1.7B, Model Size=1.7B, Method Type=PieceHint2026.04 | 42.2 | — | |
| LearnedBackbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 41.3 | — | |
| Qwen3-8B +CASTModel Scale=8B, Method=+CAST2026.05 | 40 | — | |
| DeepSeek-R1-Distill-7BModel Name=DeepSeek-R1-Distill-7B, Model Size=7B, Method Type=Baseline2026.04 | 39.6 | — | |
| Full Fine-TuningModel=7B2026.06 | 38.95 | — | |
| WaitBackbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 38.39 | — | |
| HmmBackbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 38.23 | — | |
| Baseline ModelRollout Length=16K tokens2026.05 | 37.1 | — | |
| AlternativelyBackbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 36.93 | — | |
| Open-RScheckpoints=3, context size=10242026.06 | 36.6 | — | |
| PieceHint-DeepSeek-1.5BModel Name=DeepSeek-R1-Distill-1.5B, Model Size=1.5B, Method Type=PieceHint2026.04 | 35.8 | — | |
| CritiqueBackbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 35.73 | — | |
| Baseline (w/o BF)Backbone Model=DS-R1-Llama-8B, Cmax=3, Bmax=92162025.06 | 35.68 | — | |
| GRPOFine-tuning Samples=7000, Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Evaluation Protocol=zero-shot pass@12026.05 | 33.3 | — | |
| Clip-CovFine-tuning Samples=7000, Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Evaluation Protocol=zero-shot pass@12026.05 | 33.3 | — | |
| RREDCoT-Nanocheckpoints=2, context size=10242026.06 | 33.3 | — | |
| Still-3-1.5B-PreviewFine-tuning Samples=30,000, Evaluation Protocol=zero-shot pass@12026.05 | 32.5 | — | |
| Qwen2.5-7B-Math + SFT + RL-TCERBase Model=Qwen2.5-7B-Math, Training Strategy=SFT + RL-TCER2026.04 | 32.4 | — | |
| LoRA-αModel=1.5B2026.06 | 32.34 | — | |
| Qwen3-1.7BModel Name=Qwen3-1.7B, Model Size=1.7B, Method Type=Baseline2026.04 | 30.6 | — | |
| Qwen2.5-7B-Math + SFT + RL-EndoRBase Model=Qwen2.5-7B-Math, Training Strategy=SFT + RL-EndoR2026.04 | 30.5 | — | |
| Open-RS1Fine-tuning Samples=18,615, Evaluation Protocol=zero-shot pass@12026.05 | 30 | — | |
| GRPO + Gaussian ReweightFine-tuning Samples=7000, Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Evaluation Protocol=zero-shot pass@12026.05 | 30 | — | |
| Qwen3-4B +RLSDModel Scale=4B, Method=+RLSD2026.05 | 30 | — | |
| Qwen2.5-1.5B R1-Distilled (base)context size=10242026.06 | 30 | — | |
| Full Fine-TuningModel=1.5B2026.06 | 29.79 | — | |
| DeepSeek-R1-Distill-Qwen-1.5BConfig=Base Model, Evaluation Protocol=zero-shot pass@12026.05 | 28.8 | — | |
| rStar-Math-7BEvaluation Protocol=zero-shot pass@12026.05 | 26.7 | — | |
| Eurus-2-7B-PRIMEEvaluation Protocol=zero-shot pass@12026.05 | 26.7 | — | |
| Qwen2.5-7B-SimpleRLEvaluation Protocol=zero-shot pass@12026.05 | 26.7 | — | |
| Qwen3-8B +GRPO+OPSDModel Scale=8B, Method=+GRPO+OPSD2026.05 | 26.7 | — | |
| Qwen3-8B +RLRTModel Scale=8B, Method=+RLRT2026.05 | 26.7 | — | |
| HmmBackbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 24.48 | — | |
| DeepSeek-R1-Distill-1.5BModel Name=DeepSeek-R1-Distill-1.5B, Model Size=1.5B, Method Type=Baseline2026.04 | 24.4 | — | |
| LearnedBackbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 24.06 | — | |
| WaitBackbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 23.91 | — | |
| Baseline (w/o BF)Backbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 23.85 | — | |
| AlternativelyBackbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 23.49 | — | |
| Seed-GRPOBackbone=Qwen-2.5-1.5B-Instruct2026.05 | 23.3 | — | |
| VeriGateBase Model=Qwen2.5-Math-1.5B2026.05 | 23.3 | — | |
| Qwen3-4B +GRPO+OPSDModel Scale=4B, Method=+GRPO+OPSD2026.05 | 23.3 | — | |
| Qwen3-8B BaseModel Scale=8B, Method=Base2026.05 | 23.3 | — | |
| Qwen3-8B +GRPOModel Scale=8B, Method=+GRPO2026.05 | 23.3 | — | |
| Qwen3-8B +RLSDModel Scale=8B, Method=+RLSD2026.05 | 23.3 | — | |
| CritiqueBackbone Model=DS-R1-Qwen-1.5B, Cmax=3, Bmax=92162025.06 | 23.12 | — | |
| LoRAModel=1.5B2026.06 | 22.29 | — | |
| LoRA (10× LR)Model=1.5B2026.06 | 22.29 | — | |
| Qwen2.5-7B-Math + SFTBase Model=Qwen2.5-7B-Math, Training Strategy=SFT2026.04 | 22.2 | — | |
| SRGenModel=Qwen2.5-Math-7B2025.10 | 22 | — | |
| Base modelModel=1.5B2026.06 | 21.45 | — | |
| Qwen3-1.7B +CASTModel Scale=1.7B, Method=+CAST2026.05 | 20 | — | |
| Qwen3-4B BaseModel Scale=4B, Method=Base2026.05 | 20 | — | |
| Qwen3-4B +RLRTModel Scale=4B, Method=+RLRT2026.05 | 20 | — | |
| GRPO + CDBackbone=Qwen-2.5-1.5B-Instruct, Uncertainty Signal=Cosine Dispersion2026.05 | 17.8 | — | |
| GRPO (clip avg)Rollout Length=4K tokens, Clipping Parameter (epsilon)=∈ {0.2, 0.4, 0.6}2026.05 | 17.6 | — | |
| FP8 Rollout P3ORollout Length=16K tokens, Training Iteration=30, Rollout Precision=FP8, Training Precision=BF162026.05 | 17.3 | — | |
| TreeRPOBase Model=Qwen2.5-Math-1.5B2026.05 | 16.8 | — | |
| StableDRLArchitecture=Block Diffusion, Sampling Mode=Static, Backbone=SDAR-8B2026.03 | 16.7 | — | |
| MTTeacher Model=Qwen2.5-Math-7B-Instruct2026.04 | 16.7 | — | |
| Llama-3.1-70B-InstructEvaluation Protocol=zero-shot pass@12026.05 | 16.7 | — | |
| Qwen2.5-Math-1.5BBackbone=Qwen-2.5-1.5B-Instruct2026.05 | 16.7 | — | |
| Qwen3-4B +GRPOModel Scale=4B, Method=+GRPO2026.05 | 16.7 | — | |
| P3ORollout Length=4K tokens, Clipping Parameter (epsilon)=∈ {0.2, 0.4, 0.6}2026.05 | 16.5 | — | |
| FP8 Rollout P3ORollout Length=16K tokens, Training Iteration=15, Rollout Precision=FP8, Training Precision=BF162026.05 | 15.8 | — | |
| GRPO + SEBackbone=Qwen-2.5-1.5B-Instruct2026.05 | 15.57 | — | |
| GRPO + BoTBackbone=Qwen-2.5-1.5B-Instruct, Uncertainty Signal=Barycentric Transport2026.05 | 15.57 | — | |
| FP8 Rollout GRPORollout Length=16K tokens, Training Iteration=15, Rollout Precision=FP8, Training Precision=BF162026.05 | 15.4 | — |