Mathematical Reasoning on AIME 25 (Acc, Tok, CR)
92.6AccuracyVanilla
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VanillaBackbone=Ministral-3-8B-Reasoning-25122026.03 | 92.6 | 22,124 | 100 | — | |
| VanillaBackbone=Ministral-3-14B-Reasoning-25122026.03 | 88.1 | 23,694 | 100 | — | |
| DynasorBackbone=Ministral-3-8B-Reasoning-25122026.03 | 87.6 | 15,407 | 66.3 | — | |
| Thought-CalibBackbone=Ministral-3-8B-Reasoning-25122026.03 | 83.7 | 20,358 | 91.2 | — | |
| DynasorBackbone=Ministral-3-14B-Reasoning-25122026.03 | 83.2 | 17,920 | 70.6 | — | |
| VanillaBackbone=Qwen3-14B2026.03 | 79.9 | 14,255 | 100 | — | |
| VanillaBackbone=Qwen3-8B2026.03 | 74.4 | 14,499 | 100 | — | |
| TERMINATORBackbone=Qwen3-14B2026.03 | 74.2 | 10,787 | 71 | — | |
| TERMINATORBackbone=Qwen3-8B2026.03 | 69.4 | 10,970 | 70.7 | — | |
| DEERBackbone=Ministral-3-8B-Reasoning-25122026.03 | 67.1 | 17,481 | 77 | — | |
| Thought-CalibBackbone=Qwen3-8B2026.03 | 65.8 | 11,014 | 81.5 | — | |
| TERMINATORBackbone=Ministral-3-14B-Reasoning-25122026.03 | 65.8 | 15,898 | 68.7 | — | |
| Thought-CalibBackbone=Qwen3-14B2026.03 | 63.3 | 9,429 | 71.3 | — | |
| DynasorBackbone=Qwen3-14B2026.03 | 61.8 | 7,937 | 52.8 | — | |
| Thought-CalibBackbone=Ministral-3-14B-Reasoning-25122026.03 | 59.4 | 17,763 | 79.8 | — | |
| TERMINATORBackbone=Ministral-3-8B-Reasoning-25122026.03 | 57.4 | 15,239 | 67.1 | — | |
| DEERBackbone=Ministral-3-14B-Reasoning-25122026.03 | 55.9 | 20,049 | 84.9 | — | |
| DynasorBackbone=Qwen3-8B2026.03 | 48 | 7,479 | 48.8 | — | |
| NoThinkingBackbone=Ministral-3-8B-Reasoning-25122026.03 | 43.6 | 7,711 | 36.5 | — | |
| Qwen3-14B + GRPOBackbone=Qwen3-14B, Training=GRPO2026.05 | 33.1 | — | — | 6,638 | |
| Qwen3-14B + SLATBackbone=Qwen3-14B, Training=SLAT2026.05 | 31.6 | — | — | 4,477 | |
| DEERBackbone=Qwen3-14B2026.03 | 27.6 | 10,497 | 71 | — | |
| NoThinkingBackbone=Qwen3-14B2026.03 | 26.3 | 2,472 | 19.9 | — | |
| Qwen2.5-7B-Math + SFT + RL-TCERBase Model=Qwen2.5-7B-Math, Training Strategy=SFT + RL-TCER2026.04 | 26.1 | — | — | — | |
| Qwen2.5-7B-Math + SFT + RL-EndoRBase Model=Qwen2.5-7B-Math, Training Strategy=SFT + RL-EndoR2026.04 | 25.4 | — | — | — | |
| DyJR (M = 16)Backbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@256, M=162026.03 | 23.6 | — | — | — | |
| DyJRBackbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@256, alpha_JS=0.05, M=82026.03 | 23.1 | — | — | — | |
| RLEPBackbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@2562026.03 | 23 | — | — | — | |
| DPH-RLBackbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@2562026.03 | 22.8 | — | — | — | |
| DyJR (Forward KL)Backbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@256, Divergence Type=Forward KL2026.03 | 22.8 | — | — | — | |
| DyJR (alpha_JS = 0.01)Backbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@256, alpha_JS=0.012026.03 | 22.5 | — | — | — | |
| Qwen2.5-7B-Math + SFTBase Model=Qwen2.5-7B-Math, Training Strategy=SFT2026.04 | 22.3 | — | — | — | |
| NoThinkingBackbone=Qwen3-8B2026.03 | 22 | 2,355 | 18.6 | — | |
| DyJR (M = 32)Backbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@256, M=322026.03 | 22 | — | — | — | |
| Ex-GRPOBackbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@2562026.03 | 21.7 | — | — | — | |
| DAPOBackbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@2562026.03 | 21.5 | — | — | — | |
| DEERBackbone=Qwen3-8B2026.03 | 21.4 | 10,349 | 67.8 | — | |
| DyJR (alpha_JS = 0.2)Backbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@256, alpha_JS=0.22026.03 | 21.4 | — | — | — | |
| DyJR (M = 64)Backbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@256, M=642026.03 | 21.3 | — | — | — | |
| NoThinkingBackbone=Ministral-3-14B-Reasoning-25122026.03 | 20.5 | 2,413 | 13.8 | — | |
| GRPOBackbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@2562026.03 | 19.1 | — | — | — | |
| Llama3.1-8B-Instruct + SFT + RL-TCERBase Model=Llama3.1-8B-Instruct, Training Strategy=SFT + RL-TCER2026.04 | 15 | — | — | — | |
| Llama3.1-8B-Instruct + SFT + RL-EndoRBase Model=Llama3.1-8B-Instruct, Training Strategy=SFT + RL-EndoR2026.04 | 13.2 | — | — | — | |
| Llama3.1-8B-Instruct + SFTBase Model=Llama3.1-8B-Instruct, Training Strategy=SFT2026.04 | 9.5 | — | — | — | |
| Base ModelBackbone=Qwen3-4B-Base, Evaluation Protocol (Mean@k)=Mean@2562026.03 | 8.2 | — | — | — | |
| Qwen3-14BBackbone=Qwen3-14B2026.05 | 7.5 | — | — | 1,835 | |
| Qwen2.5-7B-MathBase Model=Qwen2.5-7B-Math, Training Strategy=None2026.04 | 4.4 | — | — | — | |
| Llama3.1-8B-InstructBase Model=Llama3.1-8B-Instruct, Training Strategy=None2026.04 | 0.2 | — | — | — | |
| AdaCoTModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | — | 6,271 | — | — | |
| AdaCoTModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | — | 7,648 | — | — | |
| AdaptThinkModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | — | 6,513 | — | — | |
| AdaptThinkModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | — | 7,842 | — | — | |
| DeepSeek-R1-DistillModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | — | 11,239 | — | — | |
| DeepSeek-R1-DistillModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | — | 10,833 | — | — | |
| LHRMsModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | — | 3,257 | — | — | |
| LHRMsModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | — | 4,217 | — | — | |
| S-GRPOModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | — | 6,640 | — | — | |
| S-GRPOModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | — | 5,259 | — | — | |
| SuCoModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | — | 3,484 | — | — | |
| SuCoModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | — | 2,679 | — | — |