Mathematical Reasoning on AMC 23 (Pass@1, Avg Tokens)
100Pass@1 AccuracyBaseline
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BaselineBackbone=Qwen3-4B-Thinking-25072026.06 | 100 | 11,073 | |
| CoDBackbone=Qwen3-4B-Thinking-25072026.06 | 100 | 8,973 | |
| DEERBackbone=Qwen3-4B-Thinking-25072026.06 | 100 | 9,521 | |
| DyConBackbone=Qwen3-4B-Thinking-25072026.06 | 100 | 9,162 | |
| NoWaitBackbone=QwQ-32B2026.06 | 100 | 4,536 | |
| DyConBackbone=QwQ-32B2026.06 | 100 | 5,654 | |
| NothinkingBackbone=Qwen3-4B-Thinking-25072026.06 | 97.5 | 7,738 | |
| BaselineBackbone=QwQ-32B2026.06 | 97.5 | 7,166 | |
| NothinkingBackbone=QwQ-32B2026.06 | 97.5 | 7,472 | |
| SEALBackbone=QwQ-32B2026.06 | 97.5 | 6,448 | |
| BaselineBackbone=Qwen3-14B2026.06 | 97.5 | 6,671 | |
| NoWaitBackbone=Qwen3-14B2026.06 | 97.5 | 4,935 | |
| DyConBackbone=Qwen3-14B2026.06 | 97.5 | 5,240 | |
| Qwen3-4B (GRPO)Student Model=Qwen3-4B, Teacher Model=-, Method=GRPO2026.05 | 95.93 | — | |
| DEERBackbone=QwQ-32B2026.06 | 95 | 5,782 | |
| Dynasor-CoTBackbone=Qwen3-14B2026.06 | 95 | 6,582 | |
| DEERBackbone=Qwen3-14B2026.06 | 95 | 4,763 | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Qwen3-32B, Method=OmniOPD2026.05 | 93.44 | — | |
| Gemini-2.5-flashStudent Model=-, Teacher Model=Gemini-2.5-flash, Method=Base2026.05 | 93.13 | — | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Gemini-2.5-flash, Method=OmniOPD2026.05 | 92.96 | — | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B-Inst., Method=OmniOPD2026.05 | 92.65 | — | |
| NoWaitBackbone=Qwen3-4B-Thinking-25072026.06 | 92.5 | 8,204 | |
| CoDBackbone=QwQ-32B2026.06 | 92.5 | 6,321 | |
| FlashThinkBackbone=QwQ-32B2026.06 | 92.5 | 6,702 | |
| CoDBackbone=Qwen3-14B2026.06 | 92.5 | 6,371 | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Claude-4.5-haiku, Method=OmniOPD2026.05 | 91.25 | — | |
| SFTStudent Model=Qwen3-4B, Teacher Model=Gemini-2.5-flash, Method=SFT2026.05 | 90.44 | — | |
| DyConBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 90 | 3,801 | |
| TrimRBackbone=QwQ-32B2026.06 | 90 | 6,055 | |
| Critique-GRPO (CoT)Optimization Policy=Critique-Driven RL, Base Model=Qwen3-8B2025.09 | 90 | — | |
| CLPOOptimization Policy=Restructuring-Aware RL, Base Model=Qwen3-8B2025.09 | 90 | — | |
| Qwen3-32BStudent Model=-, Teacher Model=Qwen3-32B, Method=Base2026.05 | 87.81 | — | |
| Claude-4.5-haikuStudent Model=-, Teacher Model=Claude-4.5-haiku, Method=Base2026.05 | 87.5 | — | |
| BaselineBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 87.5 | 6,193 | |
| Manifold SteeringBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 87.5 | 4,440 | |
| DAPOOptimization Policy=Dynamic Sampling, Base Model=Qwen3-8B2025.09 | 87.5 | — | |
| Critique-GRPO (Simple)Optimization Policy=Critique-Driven RL, Base Model=Qwen3-8B2025.09 | 87.5 | — | |
| SFTStudent Model=Qwen3-4B, Teacher Model=Claude-4.5-haiku, Method=SFT2026.05 | 85.16 | — | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 85 | 4,451 | |
| NoWaitBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 85 | 4,376 | |
| LUFFYOptimization Policy=Off-Policy Imitation, Base Model=Qwen3-8B2025.09 | 85 | — | |
| Qwen3-1.7B (GRPO)Student Model=Qwen3-1.7B, Teacher Model=-, Method=GRPO2026.05 | 84.06 | — | |
| SFTStudent Model=Qwen3-4B, Teacher Model=Qwen3-32B, Method=SFT2026.05 | 83.59 | — | |
| OPDStudent Model=Qwen3-4B, Teacher Model=Qwen3-32B, Method=OPD2026.05 | 82.65 | — | |
| Controlling Thinking SpeedBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 82.5 | 5,433 | |
| GRPOOptimization Policy=Group-Based RL, Base Model=Qwen3-8B2025.09 | 82.5 | — | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 80 | 4,810 | |
| OmniOPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B, Method=OmniOPD2026.05 | 79.68 | — | |
| OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B, Method=OPD2026.05 | 79.06 | — | |
| Qwen3-30B-A3B-Inst.Student Model=-, Teacher Model=Qwen3-30B-A3B-Inst., Method=Base2026.05 | 78.59 | — | |
| SEALBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 77.5 | 5,267 | |
| OPDStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B-Inst., Method=OPD2026.05 | 75.78 | — | |
| Qwen3-4BStudent Model=Qwen3-4B, Teacher Model=-, Method=Base2026.05 | 75.47 | — | |
| Qwen3-1.7BStudent Model=Qwen3-1.7B, Teacher Model=-, Method=Base2026.05 | 75.16 | — | |
| ThinkpilotBackbone=Qwen3-4B-Thinking-25072026.06 | 75 | 5,085 | |
| NothinkingBackbone=Qwen3-14B2026.06 | 75 | 1,818 | |
| NothinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 72.5 | 1,141 | |
| ThinkpilotBackbone=Qwen3-14B2026.06 | 72.5 | 1,561 | |
| SFTStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B, Method=SFT2026.05 | 71.09 | — | |
| SFTStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B-Inst., Method=SFT2026.05 | 70.16 | — | |
| Refinement-FTOptimization Policy=Guided Refinement, Base Model=Qwen3-8B2025.09 | 70 | — | |
| Critique-FTOptimization Policy=Learning to Critique, Base Model=Qwen3-8B2025.09 | 67.5 | — | |
| CITL-FTOptimization Policy=Mixed-Data SFT, Base Model=Qwen3-8B2025.09 | 62.5 | — | |
| ThinkpilotBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 60 | 1,042 | |
| PROGRS-8rollout_budget=82026.02 | 59 | 918.64 | |
| PROGRS-8 (No Centering)rollout_budget=8, centering=none2026.02 | 54 | 911.98 | |
| DAPO-16rollout_budget=162026.02 | 52 | 873.95 | |
| PROGRS-8 (αcoh = 0)rollout_budget=8, coherence_penalty=disabled2026.02 | 50.5 | 858.91 | |
| PROGRS-4rollout_budget=42026.02 | 50.25 | 950.66 | |
| RAFTOptimization Policy=Ranking-Based Imitation, Base Model=Qwen3-8B2025.09 | 50 | — | |
| DAPO-8rollout_budget=82026.02 | 48.75 | 831.9 |