Mathematical Reasoning on AIME24 (Accuracy, Length)
67.5AccuracyQwen3-8B + ICR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-8B + ICRBackbone=Qwen3-8B, Method=ICR2026.05 | 67.5 | 7,109 | |
| Qwen3-4B + ICRBackbone=Qwen3-4B, Method=ICR2026.05 | 66.97 | 6,588 | |
| Qwen3-8B + GRPOBackbone=Qwen3-8B, Method=GRPO2026.05 | 66.35 | 8,825 | |
| Qwen3-8BBackbone=Qwen3-8B, Method=Base2026.05 | 64.38 | 12,611 | |
| Qwen3-8B + ICR /w LP-FBackbone=Qwen3-8B, Method=ICR /w LP-F2026.05 | 62.6 | 6,171 | |
| Qwen3-4BBackbone=Qwen3-4B, Method=Base2026.05 | 61.88 | 12,354 | |
| Qwen3-4B + GRPOBackbone=Qwen3-4B, Method=GRPO2026.05 | 61.87 | 8,636 | |
| Qwen3-8B + LP-FBackbone=Qwen3-8B, Method=LP-F2026.05 | 60.72 | 6,603 | |
| PACTBase Model=Qwen3-32B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 59.2 | 25,574 | |
| Multi-Agent DebateBase Model=Qwen3-32B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 58.4 | 134,679 | |
| PACTBase Model=Qwen3-8B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 57.5 | 31,414 | |
| CoABase Model=Qwen3-32B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 57.3 | 29,593 | |
| Qwen3-8B + LC-R1Backbone=Qwen3-8B, Method=LC-R12026.05 | 56.87 | 7,035 | |
| Multi-Agent DebateBase Model=Qwen3-8B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 56.4 | 140,863 | |
| Qwen3-4B + ICR /w LP-FBackbone=Qwen3-4B, Method=ICR /w LP-F2026.05 | 55.83 | 5,783 | |
| PACTBase Model=Qwen3-14B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 55.4 | 26,994 | |
| Multi-Agent DebateBase Model=Qwen3-14B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 55.2 | 138,081 | |
| CoABase Model=Qwen3-8B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 55 | 38,072 | |
| CoABase Model=Qwen3-14B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 54.9 | 28,368 | |
| Qwen3-4B + LP-FBackbone=Qwen3-4B, Method=LP-F2026.05 | 54.79 | 6,674 | |
| Qwen3-8B + LP-G (Kimi)Backbone=Qwen3-8B, Method=LP-G (Kimi)2026.05 | 54.58 | 6,282 | |
| Qwen3-8B + ShorterBetterBackbone=Qwen3-8B, Method=ShorterBetter2026.05 | 53.64 | 6,224 | |
| TextMASBase Model=Qwen3-32B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 52.1 | 45,867 | |
| TextMASBase Model=Qwen3-14B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 50.8 | 34,066 | |
| DSQW-7B + ICRBackbone=DSQW-7B, Method=ICR2026.05 | 50.52 | 8,399 | |
| DSQW-7B + ICR /w LP-FBackbone=DSQW-7B, Method=ICR /w LP-F2026.05 | 49.89 | 7,714 | |
| TextMASBase Model=Qwen3-8B, Pipeline Setting=four-agent sequential pipeline (Setting B)2026.06 | 48.3 | 36,911 | |
| DSQW-7B + ShorterBetterBackbone=DSQW-7B, Method=ShorterBetter2026.05 | 47.91 | 7,543 | |
| DSQW-7B + GRPOBackbone=DSQW-7B, Method=GRPO2026.05 | 47.7 | 10,119 | |
| DSQW-7B + LP-FBackbone=DSQW-7B, Method=LP-F2026.05 | 47.7 | 8,203 | |
| DSQW-7B + LC-R1Backbone=DSQW-7B, Method=LC-R12026.05 | 46.97 | 8,460 | |
| DeepSeek-R1-Distill-Qwen-14BModel Scale=14B, Merging Strategy=Distilled Model2026.04 | 46.7 | 7,814.4 | |
| Qwen3-4B + ShorterBetterBackbone=Qwen3-4B, Method=ShorterBetter2026.05 | 46.25 | 4,891 | |
| DSQW-7B + LP-G (Kimi)Backbone=DSQW-7B, Method=LP-G (Kimi)2026.05 | 46.04 | 8,559 | |
| Qwen3-4B + LP-G (Kimi)Backbone=Qwen3-4B, Method=LP-G (Kimi)2026.05 | 43.75 | 4,444 | |
| Qwen3-4B + LC-R1Backbone=Qwen3-4B, Method=LC-R12026.05 | 41.35 | 6,882 | |
| DSQW-7BBackbone=DSQW-7B, Method=Base2026.05 | 41.25 | 10,836 | |
| Task ArithmeticModel Scale=14B, Merging Strategy=Arithmetic Merging2026.04 | 36.7 | 7,814.2 | |
| Average MergingModel Scale=14B, Merging Strategy=Arithmetic Merging2026.04 | 33.3 | 5,837.3 | |
| Evo-L2S (Accuracy)Model Scale=14B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 33.3 | 7,570.7 | |
| Evo-L2S-01Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 33.3 | 7,797.2 | |
| TIES-MergingModel Scale=14B, Merging Strategy=Arithmetic Merging2026.04 | 26.7 | 6,002.2 | |
| ACM-AverageModel Scale=14B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 26.7 | 4,273 | |
| ACM-TAModel Scale=14B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 26.7 | 7,965.4 | |
| ACM-TIESModel Scale=14B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 26.7 | 5,069.6 | |
| Evo-L2S-02Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 26.7 | 7,589.9 | |
| Evo-L2S-03Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 26.7 | 7,301.5 | |
| Evo-L2S-05Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 20 | 1,299.9 | |
| Evo-L2S-04Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 16.7 | 4,090.9 | |
| Evo-L2S (Length)Model Scale=14B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 13.3 | 1,246.2 | |
| Qwen2.5-14BModel Scale=14B, Merging Strategy=Base Model2026.04 | 0 | 1,770 |