Mathematics on AIME24
77.3AccuracyDSMoE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DSMoEModel=GPT-OSS-20B2026.04 | 77.3 | — | — | |
| Primitives-based MASBackbone=Qwen3-14B2026.02 | 76.7 | — | 13.4 | |
| VotingBackbone=Qwen3-14B2026.02 | 70 | — | 6.7 | |
| DSMoEModel=Qwen3-30B-Instruct2026.04 | 70 | — | — | |
| Primitives-based MASBackbone=Qwen3-4B2026.02 | 66.7 | — | 23.4 | |
| LatentMASBackbone=Qwen3-14B2026.02 | 66.7 | — | 3.4 | |
| ReviewBackbone=Qwen3-14B2026.02 | 66.7 | — | 3.4 | |
| Qwen3-8BInference Mode=think2026.03 | 66.67 | — | — | |
| SSA-LLM-8BInference Mode=think2026.03 | 66.67 | — | — | |
| Qwen3.5Params=4B, Sampling mode=AR2026.06 | 63.33 | — | — | |
| VotingBackbone=Qwen3-4B2026.02 | 63.3 | — | 20 | |
| SingleBackbone=Qwen3-14B2026.02 | 63.3 | — | — | |
| TextMASBackbone=Qwen3-14B2026.02 | 63.3 | — | 0 | |
| PlanningBackbone=Qwen3-14B2026.02 | 63.3 | — | 0 | |
| RICEModel=Qwen3-30B-Instruct2026.04 | 63.3 | — | — | |
| SFTModel=Qwen3-30B-Instruct2026.04 | 63.3 | — | — | |
| AdaRASCategory=Steering2026.01 | 60.87 | — | — | |
| FLAREParams=4B, Sampling mode=AR-Trust2026.06 | 58.89 | — | — | |
| LatentMASBackbone=Qwen3-4B2026.02 | 56.7 | — | 13.4 | |
| ReviewBackbone=Qwen3-4B2026.02 | 56.7 | — | 13.4 | |
| PlanningBackbone=Qwen3-4B2026.02 | 56.7 | — | 13.4 | |
| Orig.Model=Qwen3-30B-Instruct2026.04 | 56.7 | — | — | |
| RICEModel=GPT-OSS-20B2026.04 | 56.7 | — | — | |
| SFTModel=GPT-OSS-20B2026.04 | 56.7 | — | — | |
| FLAREParams=4B, Sampling mode=Diffusion-Trust2026.06 | 55.56 | — | — | |
| Orig.Model=GPT-OSS-20B2026.04 | 50 | — | — | |
| CoTPrompting=Vanilla CoT, Base Model=Qwen3-1.7B2026.01 | 47.83 | — | — | |
| TextMASBackbone=Qwen3-4B2026.02 | 46.7 | — | 3.4 | |
| ProbingCategory=Steering2026.01 | 43.48 | — | — | |
| SingleBackbone=Qwen3-4B2026.02 | 43.3 | — | — | |
| OpenReasoning-Nemotron-1.5BCategory=Post-training2026.01 | 39.13 | — | — | |
| DeepSeek-R1-Distill-Qwen-1.5BCategory=Post-training2026.01 | 34.78 | — | — | |
| Qwen3-8BInference Mode=no-think2026.03 | 33.33 | — | — | |
| FLAREParams=2B, Sampling mode=AR-Trust2026.06 | 31.11 | — | — | |
| FLAREParams=2B, Sampling mode=Diffusion-Trust2026.06 | 31.11 | — | — | |
| DARE + TIESGroup=Qwen3-4B-Base, Category=Merged Models2026.06 | 30 | — | — | |
| LLaDA2.1-minigeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 26.67 | — | — | |
| General-ReasonerGroup=Qwen3-4B-Base, Category=Base and Expert Models2026.06 | 26.67 | — | — | |
| OpenThinker-3-1.5BCategory=Post-training2026.01 | 26.08 | — | — | |
| SSA-LLM-8BInference Mode=no-think2026.03 | 23.33 | — | — | |
| GRPOGroup=Qwen3-4B-Base, Category=Base and Expert Models2026.06 | 23.33 | — | — | |
| TIESGroup=Qwen3-4B-Base, Category=Merged Models2026.06 | 23.33 | — | — | |
| RAMGroup=Qwen3-4B-Base, Category=Merged Models2026.06 | 23.33 | — | — | |
| RESMERGEGroup=Qwen3-4B-Base, Category=Merged Models2026.06 | 23.33 | — | — | |
| TAGroup=Qwen3-4B-Base, Category=Merged Models2026.06 | 20 | — | — | |
| TSV-MergeGroup=Qwen3-4B-Base, Category=Merged Models2026.06 | 20 | — | — | |
| LLaDA2.0-minigeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 16.67 | — | — | |
| SDAR-8B-Chatgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 13.33 | — | — | |
| SDAR-30B-A3Bgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 13.33 | — | — | |
| Qwen3-4BGroup=Qwen3-4B-Base, Category=Base and Expert Models2026.06 | 13.33 | — | — | |
| SpiralGroup=Qwen3-4B-Base, Category=Base and Expert Models2026.06 | 13.33 | — | — | |
| SDARParams=1.7B, Sampling mode=Diffusion2026.06 | 10 | — | — | |
| SDARParams=4B, Sampling mode=Diffusion2026.06 | 10 | — | — | |
| SDARParams=8B, Sampling mode=Diffusion2026.06 | 10 | — | — | |
| Qwen3.5Params=2B, Sampling mode=AR2026.06 | 8.89 | — | — | |
| LLaDA-8B-Instructgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 2.08 | — | — | |
| Dream-7B-Instructgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 0.83 | — | — | |
| AMPOModel Category=Base and Expert Models2026.06 | — | 15 | — | |
| BaseBackbone=olmo-3-7b-it-sft2026.04 | — | 7.5 | — | |
| BaseBackbone=olmo-3.1-32b-it-sft2026.04 | — | 14.2 | — | |
| DARE + TIESModel Category=Merged Models2026.06 | — | 16.67 | — | |
| DPOBackbone=olmo-3-7b-it-sft2026.04 | — | 25.2 | — | |
| DPOBackbone=olmo-3.1-32b-it-sft2026.04 | — | 32.1 | — | |
| Falcon-H1R# Param.=7B2026.02 | — | 86.67 | — | |
| FLARE-2BModel Size=2B, Training Protocol=FLARE, Decoding Strategy=AR-Trust sampling2026.06 | — | 31.11 | — | |
| FLARE-4BModel Size=4B, Training Protocol=FLARE, Decoding Strategy=AR-Trust sampling2026.06 | — | 58.89 | — | |
| FLARE-9BModel Size=9B, Training Protocol=FLARE, Decoding Strategy=AR-Trust sampling2026.06 | — | 63.33 | — | |
| ISO-CModel Category=Merged Models2026.06 | — | 13.33 | — | |
| ISO-CTSModel Category=Merged Models2026.06 | — | 16.67 | — | |
| Mag+Backbone=olmo-3-7b-it-sft2026.04 | — | 29.6 | — | |
| Mag+Backbone=olmo-3.1-32b-it-sft2026.04 | — | 40.8 | — | |
| MemoryAgentModel Category=Base and Expert Models2026.06 | — | 8.67 | — | |
| MiniCPM-4.1# Param.=8B2026.02 | — | 80.83 | — | |
| MiniCPM-SALA# Param.=9B2026.02 | — | 83.75 | — | |
| Ministral-3-R# Param.=8B2026.02 | — | 81.46 | — | |
| MPO+Backbone=olmo-3-7b-it-sft2026.04 | — | 32.1 | — | |
| MPO+Backbone=olmo-3.1-32b-it-sft2026.04 | — | 46 | — | |
| Nemotron-Nano-v2# Param.=9B2026.02 | — | 71.67 | — | |
| Pair+Backbone=olmo-3-7b-it-sft2026.04 | — | 32.1 | — | |
| Pair+Backbone=olmo-3.1-32b-it-sft2026.04 | — | 46.7 | — | |
| Qwen2.5-7B-InstructModel Category=Base and Expert Models2026.06 | — | 13 | — | |
| Qwen3# Param.=8B2026.02 | — | 73.33 | — | |
| Qwen3.5-2B (released)Model Size=2B, Training Protocol=Released, Decoding Strategy=Native AR decoding2026.06 | — | 8.89 | — | |
| Qwen3.5-2B + AR-SFTModel Size=2B, Training Protocol=AR-SFT, Decoding Strategy=Native AR decoding2026.06 | — | 27.78 | — | |
| Qwen3.5-4B (released)Model Size=4B, Training Protocol=Released, Decoding Strategy=Native AR decoding2026.06 | — | 63.33 | — | |
| Qwen3.5-4B + AR-SFTModel Size=4B, Training Protocol=AR-SFT, Decoding Strategy=Native AR decoding2026.06 | — | 62.22 | — | |
| Qwen3.5-9B (released)Model Size=9B, Training Protocol=Released, Decoding Strategy=Native AR decoding2026.06 | — | 65.56 | — | |
| Qwen3.5-9B + AR-SFTModel Size=9B, Training Protocol=AR-SFT, Decoding Strategy=Native AR decoding2026.06 | — | 66.67 | — | |
| RAMModel Category=Merged Models2026.06 | — | 13 | — | |
| RESMERGEModel Category=Merged Models2026.06 | — | 16.67 | — | |
| RFTBackbone=olmo-3-7b-it-sft2026.04 | — | 15.8 | — | |
| RFTBackbone=olmo-3.1-32b-it-sft2026.04 | — | 27.1 | — | |
| Soft+Backbone=olmo-3-7b-it-sft2026.04 | — | 31.9 | — | |
| Soft+Backbone=olmo-3.1-32b-it-sft2026.04 | — | 44.2 | — | |
| TAModel Category=Merged Models2026.06 | — | 13.33 | — | |
| TIESModel Category=Merged Models2026.06 | — | 15.33 | — | |
| ToolRLModel Category=Base and Expert Models2026.06 | — | 13.67 | — | |
| TSV-MergeModel Category=Merged Models2026.06 | — | 12.67 | — |