Mathematical Reasoning on AMC (Pass@1 Accuracy, Average Pass@1 Accuracy)
79.5Pass@1 AccuracyPMPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PMPOModel Scale=7B, Base Architecture=R1-Distill-Qwen-7B, Training Phase/Objective=RL Post-Trained2026.05 | 79.5 | — | |
| HölderPOModel Scale=7B, Base Architecture=R1-Distill-Qwen-7B, Training Phase/Objective=RL Post-Trained, p-Scheduling Strategy=Linear Des: 2 → -22026.05 | 79.5 | — | |
| GMPOModel Scale=7B, Base Architecture=R1-Distill-Qwen-7B, Training Phase/Objective=RL Post-Trained, p-Scheduling Strategy=p → 02026.05 | 78.3 | — | |
| Dr.GRPOModel Scale=7B, Base Architecture=R1-Distill-Qwen-7B, Training Phase/Objective=RL Post-Trained2026.05 | 74.7 | — | |
| PMPOModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 68.7 | — | |
| HölderPOModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained, p-Scheduling Strategy=Linear Des: 2 → -22026.05 | 68.7 | — | |
| GRPOModel Scale=7B, Base Architecture=R1-Distill-Qwen-7B, Training Phase/Objective=RL Post-Trained, Hölder Parameter (p)=12026.05 | 67.5 | — | |
| CoT Cold-Start + Solver FeedbackBackbone=Qwen3-8B-Base, # Train=68012025.11 | 67.42 | — | |
| GPG-7BModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 65 | — | |
| CoT Cold-Start + RLMTBackbone=Qwen3-8B-Base, # Train=63822025.11 | 64.97 | — | |
| Self-Instruct + Solver FeedbackBackbone=Qwen3-8B-Base, # Train=63332025.11 | 64.78 | — | |
| Seed SetBackbone=Qwen3-8B-Base, # Train=40002025.11 | 64.7 | — | |
| Self-InstructBackbone=Qwen3-8B-Base, # Train=59902025.11 | 64.52 | — | |
| Self-Instruct + RLMTBackbone=Qwen3-8B-Base, # Train=71282025.11 | 63.95 | — | |
| CoT Cold-Start + R-ZeroBackbone=Qwen3-8B-Base, # Train=64342025.11 | 62.84 | — | |
| PRIME-Zero-7BModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 62.7 | — | |
| Eurus-7BModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 62.7 | — | |
| Oat-Zero-7BModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 62.7 | — | |
| CoT Cold-StartBackbone=Qwen3-8B-Base, # Train=67232025.11 | 62.22 | — | |
| Baseline ModelRollout Length=16K tokens2026.05 | 61.8 | — | |
| GMPOModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained, p-Scheduling Strategy=p → 02026.05 | 61.4 | — | |
| HölderPOModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained, Hölder Parameter (p)=3, p-Scheduling Strategy=static2026.05 | 61.4 | — | |
| Self-Instruct + R-ZeroBackbone=Qwen3-8B-Base, # Train=71422025.11 | 61 | — | |
| Self-Instruct + Solver FeedbackBackbone=Qwen3-4B-Base, # Train=54892025.11 | 60.93 | — | |
| CoT Cold-Start + Solver FeedbackBackbone=Qwen3-4B-Base, # Train=67222025.11 | 60.52 | — | |
| Self-Instruct + R-ZeroBackbone=Qwen3-4B-Base, # Train=64612025.11 | 60.26 | — | |
| SimpleRL-Zero-7BModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 60.2 | — | |
| GRPOModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained, Hölder Parameter (p)=12026.05 | 59 | — | |
| HölderPOModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained, Hölder Parameter (p)=-1, p-Scheduling Strategy=static2026.05 | 59 | — | |
| Self-Instruct + CoT-Self-InstructBackbone=Qwen3-8B-Base, # Train=63882025.11 | 58.99 | — | |
| HölderPOModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained, Hölder Parameter (p)=p → 0, p-Scheduling Strategy=dynamic2026.05 | 57.8 | — | |
| HölderPOModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained, Hölder Parameter (p)=1, p-Scheduling Strategy=static2026.05 | 57.8 | — | |
| CoT Cold-StartBackbone=Qwen3-4B-Base, # Train=66162025.11 | 57.7 | — | |
| CoT Cold-Start + RLMTBackbone=Qwen3-4B-Base, # Train=67032025.11 | 57.64 | — | |
| Seed SetBackbone=Qwen3-4B-Base, # Train=40002025.11 | 56.35 | — | |
| Self-Instruct + CoT-Self-InstructBackbone=Qwen3-4B-Base, # Train=70512025.11 | 56 | — | |
| Self-Instruct + RLMTBackbone=Qwen3-4B-Base, # Train=68592025.11 | 55.8 | — | |
| CoT Cold-Start + R-ZeroBackbone=Qwen3-4B-Base, # Train=68652025.11 | 55.73 | — | |
| Self-InstructBackbone=Qwen3-4B-Base, # Train=53752025.11 | 55.49 | — | |
| HölderPOModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained, Hölder Parameter (p)=2, p-Scheduling Strategy=static2026.05 | 55.4 | — | |
| OpenReasoner-Zero-7B @ 8kModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 54.2 | — | |
| Oat-Zero-1.5BModel Scale=1.5B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 53 | — | |
| GMPO-1.5BModel Scale=1.5B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 53 | — | |
| HölderPOModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained, Hölder Parameter (p)=-2, p-Scheduling Strategy=static2026.05 | 53 | — | |
| DDRLBackbone=Qwen2.5-Math-1.5B2026.04 | 52.9 | — | |
| FP8 Rollout P3ORollout Length=16K tokens, Training Iteration=30, Rollout Precision=FP8, Training Precision=BF162026.05 | 52.9 | — | |
| Vocabulary DropoutBackbone=Qwen3-8B, Vocabulary Dropout (alpha)=0.752026.04 | 51.7 | — | |
| ETMRBackbone=Qwen2.5-Math-1.5B2026.04 | 50.8 | — | |
| Vocabulary DropoutBackbone=Qwen3-4B, Vocabulary Dropout (alpha)=0.852026.04 | 50 | — | |
| FP8 Rollout GRPORollout Length=16K tokens, Training Iteration=15, Rollout Precision=FP8, Training Precision=BF162026.05 | 49.9 | — | |
| P3ORollout Length=4K tokens, Clipping Parameter (epsilon)=∈ {0.2, 0.4, 0.6}2026.05 | 49.3 | — | |
| Vocabulary Dropout (gen-only)Backbone=Qwen3-8B, Vocabulary Dropout (alpha)=0.75, Phase=gen-only2026.04 | 49.2 | — | |
| TTRLBackbone=Qwen2.5-Math-1.5B2026.04 | 48.9 | — | |
| Qwen2.5-Math-1.5B-InstructModel Scale=1.5B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=Instruct2026.05 | 48.2 | — | |
| HölderPO-1.5BModel Scale=1.5B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 48.1 | — | |
| FP8 Rollout P3ORollout Length=16K tokens, Training Iteration=15, Rollout Precision=FP8, Training Precision=BF162026.05 | 47.8 | — | |
| OpenReasoner-Zero-7B @ 3kModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=RL Post-Trained2026.05 | 47 | — | |
| Base ModelBackbone=Qwen3-8B-Base, # Train=-2025.11 | 46.03 | — | |
| Base (no training)Backbone=Qwen3-8B2026.04 | 45.8 | — | |
| Vocabulary DropoutBackbone=Qwen3-8B, Vocabulary Dropout (alpha)=0.852026.04 | 45.8 | — | |
| Base ModelBackbone=Qwen3-4B-Base, # Train=-2025.11 | 44.68 | — | |
| Vocabulary Dropout (train-only)Backbone=Qwen3-8B, Vocabulary Dropout (alpha)=0.75, Phase=train-only2026.04 | 44.2 | — | |
| Qwen2.5-Math-1.5BModel Scale=1.5B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=Base2026.05 | 43.4 | — | |
| Vocabulary Dropout (gen-only)Backbone=Qwen3-4B, Vocabulary Dropout (alpha)=0.75, Phase=gen-only2026.04 | 42.5 | — | |
| DDRLBackbone=Qwen2.5-Base-3B2026.04 | 42.2 | — | |
| BaselineBackbone=Qwen3-4B, Vocabulary Dropout (alpha)=1.02026.04 | 41.7 | — | |
| ETMRBackbone=Qwen2.5-Base-3B2026.04 | 41.7 | — | |
| BaselineBackbone=Qwen3-8B, Vocabulary Dropout (alpha)=1.02026.04 | 40.8 | — | |
| TTRLBackbone=Qwen2.5-Base-3B2026.04 | 40.7 | — | |
| RESTRAINBackbone=Llama-3.1-8B-Instruct2026.03 | 40 | 28.4 | |
| DDRLBackbone=Llama-3.1-8B-Instruct2026.04 | 38.6 | — | |
| Qwen2.5-Math-7BModel Scale=7B, Base Architecture=Qwen2.5-Math, Training Phase/Objective=Base2026.05 | 38.6 | — | |
| GRPO (clip avg)Rollout Length=4K tokens, Clipping Parameter (epsilon)=∈ {0.2, 0.4, 0.6}2026.05 | 38.1 | — | |
| SCRLBackbone=Llama-3.1-8B-Instruct2026.03 | 36.1 | 29 | |
| Vocabulary DropoutBackbone=Qwen3-4B, Vocabulary Dropout (alpha)=0.752026.04 | 35.8 | — | |
| ETMRBackbone=Llama-3.1-8B-Instruct2026.03 | 35.4 | 26.2 | |
| ETMRBackbone=Llama-3.1-8B-Instruct2026.04 | 35.4 | — | |
| TTRLBackbone=Llama-3.1-8B-Instruct2026.03 | 32.3 | 21.2 | |
| TTRLBackbone=Llama-3.1-8B-Instruct2026.04 | 32.3 | — | |
| Vocabulary Dropout (train-only)Backbone=Qwen3-4B, Vocabulary Dropout (alpha)=0.75, Phase=train-only2026.04 | 31.7 | — | |
| Base (no training)Backbone=Qwen3-4B2026.04 | 29.2 | — | |
| No AdaptationBackbone=Qwen2.5-Math-1.5B2026.04 | 28.6 | — | |
| AUTOSKILLBackbone=Qwen2.5-3B, SFT examples=10k, Temperature=0.12026.04 | 28.01 | — | |
| STAT-SynBackbone=Qwen2.5-3B, SFT examples=10k, Temperature=0.12026.04 | 25 | — | |
| No AdaptationBackbone=Qwen2.5-Base-3B2026.04 | 24.5 | — | |
| AUTOSKILLBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 23.64 | — | |
| Llama-3.1-8B-InstructBackbone=Llama-3.1-8B-Instruct2026.03 | 23.3 | 14 | |
| No AdaptationBackbone=Llama-3.1-8B-Instruct2026.04 | 23.3 | — | |
| DeduplicationBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 22.25 | — | |
| Difficulty-lowBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 22.25 | — | |
| Correctness-highBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 22 | — | |
| ReasonFlux-PRMBackbone=Qwen2.5-3B, SFT examples=10k, Temperature=0.12026.04 | 21.98 | — | |
| Difficulty-highBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 21.75 | — | |
| Baseline ModelRollout Length=4K tokens2026.05 | 21.7 | — | |
| Remove-outliersBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 21.5 | — | |
| Correctness-lowBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 21 | — | |
| Long-examplesBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 20.75 | — | |
| Best HeuristicBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 20.75 | — | |
| +25k SFT (Random)Backbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 20.25 | — | |
| +10k SFT (Random)Backbone=Qwen2.5-3B, SFT examples=10k, Temperature=0.12026.04 | 20 | — |