Mathematical Reasoning on AMC23 (PASS@1 Accuracy and Output Length)
100PASS@1 AccuracyTIP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TIPBase Model=QwQ-32B2026.05 | 100 | 6,454 | — | |
| CyclicReflexBase Model=QwQ-32B2026.05 | 100 | 7,076 | — | |
| PathCalBase Model=QwQ-32B2026.05 | 100 | 6,608 | — | |
| Qwen3-4B (Ours)Backbone=Qwen3-4B2026.04 | 97.5 | — | — | |
| S1Base Model=QwQ-32B2026.05 | 97.5 | 7,295 | — | |
| OriginalBase Model=QwQ-32B2026.05 | 95 | 7,524 | — | |
| DS-Llama-8B (Ours)Backbone=DS-Llama-8B2026.04 | 92.5 | — | — | |
| Pass@k†Backbone=Qwen2.5-7B-Instruct, N=322026.05 | 90.5 | 27,979 | — | |
| PathCalBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 90 | 3,166 | — | |
| PieceHint-Nemotron-1.5BModel Name=Nemotron-1.5B, Model Size=1.5B, Method Type=PieceHint2026.04 | 89.1 | — | — | |
| DeepSeek-R1-Distill-32BModel Name=DeepSeek-R1-Distill-32B, Model Size=32B, Method Type=Baseline2026.04 | 87.3 | — | — | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 85 | 3,695 | — | |
| Pass@kk=16, Model=Qwen2.5-7B2026.06 | 84.2 | — | — | |
| MixedFramework=TD-Grokking2026.06 | 83.33 | — | — | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 83.1 | 3,388.5 | — | |
| Nemotron-1.5BModel Name=Nemotron-1.5B, Model Size=1.5B, Method Type=Baseline2026.04 | 82.7 | — | — | |
| CoDModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 82.5 | 3,217 | 2.56 | |
| TIPBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82.5 | 2,893 | — | |
| S1Base Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82.5 | 3,335 | — | |
| PathCalBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82.5 | 2,244 | — | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 82.5 | 3,733 | — | |
| TIPBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 82.5 | 3,733 | — | |
| ExpThinkBackbone=Qwen3-8B2026.05 | 82.4 | 2,232 | — | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82.2 | 5,573.4 | — | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 81.6 | 4,579.3 | — | |
| DynamicFramework=TD-Grokking2026.06 | 80.83 | — | — | |
| TRiMSBackbone=Qwen3-4B2026.03 | 80.7 | 1,046.2 | — | |
| PieceHint-Qwen3-1.7BModel Name=Qwen3-1.7B, Model Size=1.7B, Method Type=PieceHint2026.04 | 80.4 | — | — | |
| ExpThinkBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 80.4 | 2,775.1 | — | |
| Qwen3-4BModel Name=Qwen3-4B, Model Size=4B, Method Type=Baseline2026.04 | 80 | — | — | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 80 | 2,806 | — | |
| Sub-onlyFramework=TD-Grokking2026.06 | 79.58 | — | — | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 79.1 | 4,754.1 | — | |
| Pass@k†Backbone=Phi-4-mini-Instruct, N=322026.05 | 79 | 25,003 | — | |
| VanillaBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 78.9 | 6,907.2 | — | |
| DeepSeek-R1-Distill-7BModel Name=DeepSeek-R1-Distill-7B, Model Size=7B, Method Type=Baseline2026.04 | 78.8 | — | — | |
| TALEModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 77.5 | 4,128 | 1.73 | |
| CRISPModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 77.5 | 2,180 | 3.56 | |
| GRPO + Gaussian ReweightFine-tuning Samples=7000, Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Evaluation Protocol=zero-shot pass@12026.05 | 77.5 | — | — | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 77.5 | 2,750 | — | |
| S1Base Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 77.5 | 3,980 | — | |
| TIPBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 77.5 | 3,310 | — | |
| VanillaFramework=GRPO2026.06 | 77.5 | — | — | |
| QuestAFramework=GRPO2026.06 | 77.5 | — | — | |
| VanillaBackbone=Qwen3-8B2026.05 | 77.4 | 9,139.1 | — | |
| VanillaBackbone=Qwen3-4B2026.03 | 77.1 | 9,060 | — | |
| LC-R1Backbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 76.4 | 3,678.1 | — | |
| Scaf-GRPOFramework=GRPO2026.06 | 76.25 | — | — | |
| OriginalBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 75 | 3,937 | — | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 75 | 3,937 | — | |
| PathCalBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 75 | 3,064 | — | |
| AblationFramework=GRPO2026.06 | 75 | — | — | |
| SFTFramework=GRPO2026.06 | 75 | — | — | |
| Base2026.06 | 73.75 | — | — | |
| DeepScaleR-1.5B-PreviewFine-tuning Samples=40,000, Evaluation Protocol=zero-shot pass@12026.05 | 73.6 | — | — | |
| LEADBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Max Response Length=8K2026.05 | 73.5 | 4,368 | — | |
| OriginalModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 72.5 | 4,483 | 1.62 | |
| TokenSkipModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 72.5 | 3,676 | 1.97 | |
| LUFFYFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Non-comparable Baselines2025.08 | 72.5 | — | — | |
| S1Base Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 72.5 | 4,291 | — | |
| Re-Schedule_linearBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@32, Weighting Scheme=linear2025.10 | 72.4 | — | — | |
| Re-Schedule_sigmoidBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@32, Weighting Scheme=sigmoid2025.10 | 72.3 | — | — | |
| OPOBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 71.5 | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Max Response Length=8K2026.05 | 71.5 | 2,607 | — | |
| PieceHint-DeepSeek-1.5BModel Name=DeepSeek-R1-Distill-1.5B, Model Size=1.5B, Method Type=PieceHint2026.04 | 71.2 | — | — | |
| Seed-GRPOBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 71 | — | — | |
| ACC_sigmoidBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@32, Weighting Scheme=sigmoid2025.10 | 70.9 | — | — | |
| DRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Max Response Length=8K2026.05 | 70 | 3,665 | — | |
| Open-RS1Fine-tuning Samples=18,615, Evaluation Protocol=zero-shot pass@12026.05 | 70 | — | — | |
| Clip-CovFine-tuning Samples=7000, Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Evaluation Protocol=zero-shot pass@12026.05 | 70 | — | — | |
| BaseBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Max Response Length=8K2026.05 | 69.25 | 7,472 | — | |
| Re-Schedule_sigmoidBackbone=Qwen2.5-7B, Weight Function=sigmoid2025.10 | 69.2 | — | — | |
| Qwen3-1.7BModel Name=Qwen3-1.7B, Model Size=1.7B, Method Type=Baseline2026.04 | 69 | — | — | |
| ACC_sigmoidBackbone=Qwen2.5-7B, Category=Scheduling Methods2025.10 | 68.6 | — | — | |
| Re-Schedule_linearBackbone=Qwen2.5-7B, Weight Function=linear2025.10 | 68.6 | — | — | |
| GRPOFine-tuning Samples=7000, Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Evaluation Protocol=zero-shot pass@12026.05 | 67.5 | — | — | |
| SPSModel=Qwen2.5-7B-Instruct, N=82026.05 | 67.5 | 22,446 | — | |
| SPSBackbone=Qwen2.5-7B-Instruct, N=82026.05 | 67.5 | 22,446 | — | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 67.2 | 5,671.4 | — | |
| GDPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Max Response Length=8K2026.05 | 67 | 2,795 | — | |
| Still-3-1.5B-PreviewFine-tuning Samples=30,000, Evaluation Protocol=zero-shot pass@12026.05 | 66.7 | — | — | |
| PB-SMCModel=Qwen2.5-7B-Instruct, N=82026.05 | 66.5 | 17,637 | — | |
| PB-SMCBackbone=Qwen2.5-7B-Instruct, N=82026.05 | 66.5 | 17,637 | — | |
| GRPOBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 66.2 | — | — | |
| ExpThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 65.8 | 2,921.2 | — | |
| CGSk=16, L=20, Base Model=Qwen2.5-7B, Guidance Model=Qwen2.5-72B2026.06 | 65.8 | — | — | |
| SimpleRL-ZooBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 65.4 | — | — | |
| Eurus-PRIMEBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 65.2 | — | — | |
| TruncationModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 65 | 3,035 | 2.14 | |
| Best-of-NBackbone=Qwen2.5-7B-Instruct, N=322026.05 | 65 | 27,564 | — | |
| Large greedyModel=Qwen2.5-72B2026.06 | 65 | — | — | |
| PRM-72B guided searchk=16, L=20, Base Model=Qwen2.5-7B, Guidance Model=Qwen2.5-72B2026.06 | 65 | — | — | |
| SimpleRL-ZooBackbone=Qwen2.5-7B, Category=Classical RLVR Methods2025.10 | 64.7 | — | — | |
| OPOBackbone=Qwen2.5-7B, Category=Classical RLVR Methods2025.10 | 64.6 | — | — | |
| LPPOBackbone=Qwen2.5-7B, Category=Scheduling Methods2025.10 | 64 | — | — | |
| DeepSeek-R1-Distill-1.5BModel Name=DeepSeek-R1-Distill-1.5B, Model Size=1.5B, Method Type=Baseline2026.04 | 63.6 | — | — | |
| LPPOBackbone=Qwen2.5-Math-7B, Evaluation Protocol=avg@322025.10 | 63.3 | — | — | |
| Seed-GRPOBackbone=Qwen2.5-7B, Category=Scheduling Methods2025.10 | 63.3 | — | — | |
| SPSModel=Qwen2.5-3B-Instruct, N=82026.05 | 63 | 16,644 | — | |
| DVTSBackbone=Qwen2.5-7B-Instruct, N=322026.05 | 63 | 34,670 | — |