Accuracy on MATH
92AccuracyDS-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DS-7BModel Version=DeepSeek-R1-Distill-Qwen-7B2025.07 | 92 | — | |
| ARMOR-ThinkAbbreviation=AR-Think2025.07 | 84 | — | |
| MENTORBackbone=Qwen2.5-7B-Base2025.10 | 81.4 | — | |
| Qwen-2.5Model Version=Qwen2.5-7B-Instruct2025.07 | 79 | — | |
| QuestABackbone=Qwen2.5-7B-Base2025.10 | 78.8 | — | |
| LUFFYBackbone=Qwen2.5-7B-Base2025.10 | 77 | — | |
| On-policy RLBackbone=Qwen2.5-7B-Base2025.10 | 76.8 | — | |
| ARMOR2025.07 | 76 | — | |
| MENTORBackbone=Qwen2.5-3B-Base2025.10 | 69.8 | — | |
| QuestABackbone=Qwen2.5-3B-Base2025.10 | 66.4 | — | |
| On-policy RLBackbone=Qwen2.5-3B-Base2025.10 | 65.8 | — | |
| ScoreFlow2026.06 | 64.4 | — | |
| LUFFYBackbone=Qwen2.5-3B-Base2025.10 | 64 | — | |
| BaseBackbone=Qwen2.5-7B-Base2025.10 | 62.4 | — | |
| MetaFlowgeneration_mode=single-inference generation2026.06 | 61 | — | |
| HRM-Text 1BArchitecture=Recurrent, FLOPs ($10^{21}$)=1, Tokens (T)=0.062026.05 | 56.2 | — | |
| AFlow2026.06 | 55.8 | — | |
| CoT SC2026.06 | 53.8 | — | |
| MedPrompt2026.06 | 53.7 | — | |
| CoT2026.06 | 53.4 | — | |
| IO2026.06 | 52.2 | — | |
| MultiPersona2026.06 | 51.9 | — | |
| ADAS2026.06 | 51.7 | — | |
| Self Refine2026.06 | 50 | — | |
| Llama3.2 3BArchitecture=Dense, FLOPs ($10^{21}$)=162, Tokens (T)=92026.05 | 48 | — | |
| BaseBackbone=Qwen2.5-3B-Base2025.10 | 47.4 | — | |
| Olmo3 7BArchitecture=Dense, FLOPs ($10^{21}$)=252, Tokens (T)=62026.05 | 40 | — | |
| Qwen3.5 2BArchitecture=Dense, FLOPs ($10^{21}$)=432, Tokens (T)=362026.05 | 34.2 | — | |
| MENTORBackbone=LLaMa3.1-8B-Base2025.10 | 30.2 | — | |
| LUFFYBackbone=LLaMa3.1-8B-Base2025.10 | 25.2 | — | |
| Gemma3 4BArchitecture=Dense, FLOPs ($10^{21}$)=96, Tokens (T)=42026.05 | 24.2 | — | |
| On-policy RLBackbone=LLaMa3.1-8B-Base2025.10 | 24 | — | |
| Ouro 1.4BArchitecture=Recurrent, FLOPs ($10^{21}$)=259, Tokens (T)=72026.05 | 22.4 | — | |
| FRAMEBackbone=LLaMA-3.1-8B2026.06 | 21.4 | — | |
| QuestABackbone=LLaMa3.1-8B-Base2025.10 | 20.6 | — | |
| MoABackbone=LLaMA-3.1-8B2026.06 | 20.3 | — | |
| FourierMoEBackbone=LLaMA-3.1-8B2026.06 | 20.1 | — | |
| FlyLoRABackbone=LLaMA-3.1-8B2026.06 | 20 | — | |
| HMoRABackbone=LLaMA-3.1-8B2026.06 | 19.8 | — | |
| MixLoRABackbone=LLaMA-3.1-8B2026.06 | 19.4 | — | |
| HydraLoRABackbone=LLaMA-3.1-8B2026.06 | 19 | — | |
| DoRABackbone=LLaMA-3.1-8B2026.06 | 18.6 | — | |
| FourierFTBackbone=LLaMA-3.1-8B2026.06 | 18.3 | — | |
| LoRABackbone=LLaMA-3.1-8B2026.06 | 18.2 | — | |
| MERGEvolveSetting=single-task, Number of runs=52026.06 | 15.45 | — | |
| LoraHubSetting=single-task, Number of runs=52026.06 | 14.9 | — | |
| Model SwarmsSetting=single-task, Number of runs=52026.06 | 14.7 | — | |
| Best Single ExpertSetting=single-task, Number of runs=52026.06 | 14.3 | — | |
| EMMSetting=single-task, Number of runs=52026.06 | 14.16 | — | |
| Expert FusionSetting=single-task, Number of runs=52026.06 | 13.1 | — | |
| Huginn 3.5BArchitecture=Recurrent, FLOPs ($10^{21}$)=127, Tokens (T)=0.82026.05 | 12.6 | — | |
| TIESSetting=single-task, Number of runs=52026.06 | 12.5 | — | |
| Data MergeSetting=single-task, Number of runs=52026.06 | 12.2 | — | |
| Pack of LLMsSetting=single-task, Number of runs=52026.06 | 11.96 | — | |
| BaseBackbone=LLaMa3.1-8B-Base2025.10 | 10.6 | — | |
| GRPO BaselineModel=Qwen3-4B, Rollout Quantization=FP82026.06 | — | 89.34 | |
| GRPO BaselineModel=Qwen3-1.7B, Rollout Quantization=FP82026.06 | — | 83.1 | |
| LR-decayModel=Qwen3-4B, Rollout Quantization=FP82026.06 | — | 90.34 | |
| LR-decayModel=Qwen3-1.7B, Rollout Quantization=FP82026.06 | — | 82.09 | |
| MIPUModel=Qwen3-4B, Rollout Quantization=FP82026.06 | — | 91.15 | |
| MIPUModel=Qwen3-1.7B, Rollout Quantization=FP82026.06 | — | 86.52 | |
| MISModel=Qwen3-4B, Rollout Quantization=FP82026.06 | — | 90.95 | |
| MISModel=Qwen3-1.7B, Rollout Quantization=FP82026.06 | — | 81.29 |