Mathematical Reasoning on AMC 2023
96.02AccuracyJustRL-Nemotron
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| JustRL-NemotronBackbone=OpenMath-Nemotron-1.5B, Sampling Strategy (@k)=@32, Dynamic Sampling=false, Training Steps=3440, Train Batch Size=256, Rollout N=8, Max Context Length=16k, Token Budget=1.1x10^8k2025.12 | 96.02 | — | — | — | — | |
| QuestABackbone=OpenMath-Nemotron-1.5B, Sampling Strategy (@k)=@32, Dynamic Sampling=true, Training Steps=2000, Train Batch Size=128, Rollout N=16, Max Context Length=32k, Token Budget=2.6x10^8k2025.12 | 93.44 | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-7B + DAPOModel Backbone=Qwen-7B, Training Algorithm=DAPO2025.12 | 92.3 | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-7B + ERC-DAPOModel Backbone=Qwen-7B, Training Algorithm=ERC-DAPO2025.12 | 91.9 | — | — | — | — | |
| JustRL-DeepSeekSampling strategy=@32, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 91.02 | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-7BModel Backbone=Qwen-7B, Training Algorithm=Baseline2025.12 | 90.6 | — | — | — | — | |
| BackboneBackbone=OpenMath-Nemotron-1.5B, Sampling Strategy (@k)=@322025.12 | 90.55 | — | — | — | — | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Qwen-7B2025.06 | 90 | — | 1,229.25 | — | — | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Llama-8B2025.06 | 90 | — | 1,942.4 | — | — | |
| ARLCPModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 89.69 | — | 3,260 | — | — | |
| LASERModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 89.45 | — | 2,894 | — | — | |
| DeepSeek-Distill-Qwen-7BBackbone=DeepSeek-Distill-Qwen-7B2025.06 | 89.3 | — | — | — | — | |
| SPIRALBackbone=DeepSeek-Distill-Qwen-7B, Training Data=Multi-game2025.06 | 89.3 | — | — | — | — | |
| DeepSeek-Distill-Qwen-7BFamily=DeepSeek-Distill-Qwen-7B Family2025.06 | 89.3 | — | — | — | — | |
| SPIRALFamily=DeepSeek-Distill-Qwen-7B Family, Game=Multi-Game2025.06 | 89.3 | — | — | — | — | |
| R1-Distill-Qwen-7BFT data=R1*, LoRA=-2026.03 | 89 | — | — | — | — | |
| Qwen-7BFT data=OT3, LoRA=-2026.03 | 89 | — | — | — | — | |
| DPOShortestModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 88.9 | — | 5,295 | — | — | |
| DeepSeek-R1-Distill-Qwen-7B + GRPOModel Backbone=Qwen-7B, Training Algorithm=GRPO2025.12 | 88.8 | — | — | — | — | |
| ProRL-V2Sampling strategy=@32, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 88.75 | — | — | — | — | |
| SFTBackbone=DeepSeek-Distill-Qwen-7B, Training Data=Multi-game2025.06 | 88.2 | — | — | — | — | |
| TLMREModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 88.12 | — | 3,560 | — | — | |
| CyclicReflexBackbone=Qwen3-14B, Decoding Strategy=CyclicReflex2025.06 | 88 | — | — | — | — | |
| O1-PrunerModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 87.66 | — | 5,509 | — | — | |
| VanillaModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 87.5 | — | 5,980 | — | — | |
| AdaptThinkModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 86.88 | — | 3,641 | — | — | |
| RLCERScale=8B2026.02 | 86.41 | — | — | — | — | |
| GSPOBackbone=DS-R1-Distill-Qwen-1.5B, RL Mitigation Strategy=GSPO2025.09 | 85.9 | — | — | — | — | |
| CE-GPPOBackbone=DS-R1-Distill-Qwen-1.5B, RL Mitigation Strategy=CE-GPPO, Beta coefficients (β1, β2)=β1 = 0.5, β2 = 12025.09 | 85.9 | — | — | — | — | |
| SFTShortestModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 85.8 | — | 6,005 | — | — | |
| TIPBase Model=DeepSeek-R1-Distill-Qwen-7B2025.06 | 85 | — | 1,267.83 | — | — | |
| S1Base Model=DeepSeek-R1-Distill-Qwen-7B2025.06 | 85 | — | 2,158 | — | — | |
| TIPBase Model=DeepSeek-R1-Distill-Llama-8B2025.06 | 85 | — | 1,932.63 | — | — | |
| RLVRScale=8B2026.02 | 84.53 | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-1.5B + ERC-DAPOModel Backbone=Qwen-1.5B, Training Algorithm=ERC-DAPO2025.12 | 84.3 | — | — | — | — | |
| CyclicReflexBackbone=Qwen3-8B, Decoding Strategy=CyclicReflex2025.06 | 84 | — | — | — | — | |
| OriginalBackbone=Qwen3-14B, Decoding Strategy=Original2025.06 | 83 | — | — | — | — | |
| Qwen-3BFT data=OT3, LoRA=-2026.03 | 83 | — | — | — | — | |
| Qwen-7BFT data=OT3 + MoT, LoRA=rk 1282026.03 | 83 | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-1.5B + DAPOModel Backbone=Qwen-1.5B, Training Algorithm=DAPO2025.12 | 82.3 | — | — | — | — | |
| OPEFOBackbone=Qwen2.5-Math-7B2026.05 | 82.2 | — | — | — | — | |
| TIPBackbone=Qwen3-14B, Decoding Strategy=TIP2025.06 | 82 | — | — | — | — | |
| Qwen-7BFT data=OT3, LoRA=rk 1282026.03 | 82 | — | — | — | — | |
| RLCERScale=4B2026.02 | 81.88 | — | — | — | — | |
| GRPO (Strict on-policy)Backbone=Qwen2.5-Math-7B2026.05 | 81.8 | — | — | — | — | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-7B2025.06 | 81 | — | 1,300.53 | — | — | |
| OriginalBase Model=DeepSeek-R1-Distill-Llama-8B2025.06 | 81 | — | 1,951.88 | — | — | |
| CISPOBackbone=DS-R1-Distill-Qwen-1.5B, RL Mitigation Strategy=CISPO2025.09 | 80.9 | — | — | — | — | |
| TIPBackbone=Qwen3-8B, Decoding Strategy=TIP2025.06 | 80 | — | — | — | — | |
| RLVRScale=4B2026.02 | 79.53 | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-1.5B + GRPOModel Backbone=Qwen-1.5B, Training Algorithm=GRPO2025.12 | 79.3 | — | — | — | — | |
| OriginalBackbone=Qwen3-8B, Decoding Strategy=Original2025.06 | 79 | — | — | — | — | |
| Clip-higherBackbone=Qwen2.5-Math-7B2026.05 | 78.5 | — | — | — | — | |
| KL–CovBackbone=Qwen2.5-Math-7B2026.05 | 78.3 | — | — | — | — | |
| Qwen-7BFT data=MoT, LoRA=-2026.03 | 78 | — | — | — | — | |
| Qwen-7BFT data=OT3, LoRA=rk 642026.03 | 78 | — | — | — | — | |
| Clip–CovBackbone=Qwen2.5-Math-7B2026.05 | 77.9 | — | — | — | — | |
| LASERModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 75.94 | — | 3,899 | — | — | |
| S1Base Model=DeepSeek-R1-Distill-Llama-8B2025.06 | 75 | — | 2,812.75 | — | — | |
| Entropy-RegBackbone=Qwen2.5-Math-7B2026.05 | 74.4 | — | — | — | — | |
| DeepScaleR-1.5BSampling strategy=@32, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 73.83 | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-1.5BModel Backbone=Qwen-1.5B, Training Algorithm=Baseline2025.12 | 73.7 | — | — | — | — | |
| DS-R1-Distill-Qwen-1.5BBackbone=DS-R1-Distill-Qwen-1.5B, RL Mitigation Strategy=None2025.09 | 73.7 | — | — | — | — | |
| ARLCPModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 73.28 | — | 3,037 | — | — | |
| OPEFOBackbone=Qwen3-Base-4B2026.05 | 73.1 | — | — | — | — | |
| KL–CovBackbone=Qwen3-Base-4B2026.05 | 72.3 | — | — | — | — | |
| TLMREModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 72.1 | — | 2,798 | — | — | |
| Clip–CovBackbone=Qwen3-Base-4B2026.05 | 71.9 | — | — | — | — | |
| GRPO (Strict on-policy)Backbone=Qwen3-Base-4B2026.05 | 71.5 | — | — | — | — | |
| Entropy-RegBackbone=Qwen3-Base-4B2026.05 | 70.9 | — | — | — | — | |
| O1-PrunerModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 70.47 | — | 7,046 | — | — | |
| Clip-higherBackbone=Qwen3-Base-4B2026.05 | 70.3 | — | — | — | — | |
| GRPOBackbone=Qwen2.5-Math-7B2026.05 | 69.8 | — | — | — | — | |
| DPOShortestModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 69.53 | — | 7,091 | — | — | |
| SFTShortestModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 67.66 | — | 7,657 | — | — | |
| AdaptThinkModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 67.19 | — | 3,342 | — | — | |
| VanillaModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 66.72 | — | 7,742 | — | — | |
| SFTScale=8B2026.02 | 66.41 | — | — | — | — | |
| GRPOBackbone=Qwen3-Base-4B2026.05 | 66.1 | — | — | — | — | |
| SPIRALBackbone=Qwen3-8B, Training Data=Multi-game2025.06 | 65.2 | — | — | — | — | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 65 | — | 1,839.23 | — | — | |
| Backbone (DeepSeek-R1-Distill-Qwen-1.5B)Sampling strategy=@32, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 63.82 | — | — | — | — | |
| SFTBackbone=Qwen3-8B, Training Data=Multi-game2025.06 | 63.5 | — | — | — | — | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 63 | — | 1,855.85 | — | — | |
| TIPBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 63 | — | 1,890.35 | — | — | |
| SPIRALBackbone=Qwen3-4B, Training Data=Multi-game2025.06 | 61.6 | — | — | — | — | |
| SPIRALFamily=Qwen3-4B-Base Family, Game=Multi-Game2025.06 | 61.6 | — | — | — | — | |
| NoThinkingModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 61.25 | — | 1,179 | — | — | |
| SPIRALBackbone=Qwen3-4B, Training Data=Kuhn Poker2025.06 | 61.2 | — | — | — | — | |
| Qwen-3BFT data=MoT, LoRA=-2026.03 | 61 | — | — | — | — | |
| Qwen-7BFT data=-, LoRA=-2026.03 | 60 | — | — | — | — | |
| SFTScale=4B2026.02 | 59.53 | — | — | — | — | |
| FastMCTSParameter Count=7B2025.02 | 57.5 | — | — | — | — | |
| SPELLBase Model=Qwen2.5-32B2025.09 | 55.62 | — | — | — | — | |
| Qwen-3BFT data=OT3, LoRA=rk 1282026.03 | 55 | — | — | — | — | |
| CyclicReflexBackbone=Qwen3-4B, Decoding Strategy=CyclicReflex2025.06 | 53 | — | — | — | — | |
| SFTBackbone=Qwen3-4B, Training Data=Multi-game2025.06 | 51.1 | — | — | — | — | |
| Qwen3-Base-4BBackbone=Qwen3-Base-4B2026.05 | 51.1 | — | — | — | — | |
| Qwen3-8B-BaseBackbone=Qwen3-8B2025.06 | 50.6 | — | — | — | — | |
| SPELLBase Model=Qwen2.5-14B2025.09 | 50.31 | — | — | — | — |