Reasoning on ARC-c
96.3Accuracy (ARC-c)Ref. SOTA
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Ref. SOTAModel Type=Proprietary2026.03 | 96.3 | — | — | — | — | — | — | — | |
| Ouro2.6B-Thinking + RLTT2026.02 | 94.4 | — | — | — | — | — | — | — | |
| Ouro2.6B-Thinking + GRPO2026.02 | 93.7 | — | — | — | — | — | — | — | |
| Ouro2.6B-Thinking2026.02 | 93.6 | — | — | — | — | — | — | — | |
| Ouro2.6B-Thinking + SFT2026.02 | 93.5 | — | — | — | — | — | — | — | |
| EcoThink2026.03 | 93.1 | — | — | -3.2 | 0.015 | — | — | — | |
| Qwen3 – 4B2026.02 | 90.5 | — | — | — | — | — | — | — | |
| Molmo2-8BParameters=8B2026.01 | 89.6 | — | — | — | — | — | — | — | |
| Molmo2-4BParameters=4B2026.01 | 89.3 | — | — | — | — | — | — | — | |
| SKillWeave (Ours)#Params=10B2026.05 | 88.6 | — | — | — | — | — | — | — | |
| SkillWeave (Delta-Come replacement)#Params=10B2026.05 | 88.4 | — | — | — | — | — | — | — | |
| Qwen3-8BParameters=8B2026.01 | 88.3 | — | — | — | — | — | — | — | |
| Sequentially MTL#Params=8B2026.05 | 88.2 | — | — | — | — | — | — | — | |
| LLaDA-8B-Instructgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 87.8 | — | — | — | — | — | — | — | |
| Twin-Merging r1024#Params=21B2026.05 | 87.4 | — | — | — | — | — | — | — | |
| SkillWeave (ASVD replacement)#Params=10B2026.05 | 87.2 | — | — | — | — | — | — | — | |
| EMR-Merging#Params=16.7B2026.05 | 86.9 | — | — | — | — | — | — | — | |
| SkillWeave (PEFT replacement)#Params=10B2026.05 | 86.9 | — | — | — | — | — | — | — | |
| SDAR-8B-Chatgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 86.78 | — | — | — | — | — | — | — | |
| Twin-Merging r512#Params=14.1B2026.05 | 86.7 | — | — | — | — | — | — | — | |
| Qwen2-57BA14B-it#Params=52B2026.05 | 86.6 | — | — | — | — | — | — | — | |
| Routed LoRA r1024#Params=21B2026.05 | 86.5 | — | — | — | — | — | — | — | |
| TALL-Mask#Params=16.7B2026.05 | 86.4 | — | — | — | — | — | — | — | |
| LLaDA2.0-minigeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 85.76 | — | — | — | — | — | — | — | |
| Routed LoRA r512#Params=14.1B2026.05 | 85.7 | — | — | — | — | — | — | — | |
| SkillWeave (Self-Specialize replacement)#Params=10B2026.05 | 85.7 | — | — | — | — | — | — | — | |
| PCB-Merge+DARE#Params=8B2026.05 | 84.6 | — | — | — | — | — | — | — | |
| Self-MoE#Params=9B2026.05 | 84.6 | — | — | — | — | — | — | — | |
| SkillWeave (Self-Rewarding replacement)#Params=10B2026.05 | 84.3 | — | — | — | — | — | — | — | |
| PCB-Merging#Params=8B2026.05 | 84.2 | — | — | — | — | — | — | — | |
| Qwen3 – 1.7BDecode Budget=2048-token, Decoding Method=Deterministic, Evaluation Protocol=Zero-shot2026.02 | 84 | — | — | — | — | — | — | — | |
| Ties-Merging#Params=8B2026.05 | 84 | — | — | — | — | — | — | — | |
| Task Arithmetic#Params=8B2026.05 | 83.6 | — | — | — | — | — | — | — | |
| Self-Rewarding#Params=8B2026.05 | 83.6 | — | — | — | — | — | — | — | |
| FuseLLM#Params=8B2026.05 | 83.5 | — | — | — | — | — | — | — | |
| LLaDA2.1-minigeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 83.39 | — | — | — | — | — | — | — | |
| Qwen3-4BParameters=4B2026.01 | 83.3 | — | — | — | — | — | — | — | |
| Jointly MTL#Params=8B2026.05 | 83.2 | — | — | — | — | — | — | — | |
| Self-Align#Params=8B2026.05 | 83 | — | — | — | — | — | — | — | |
| DeepSeekR1 – 7B2026.02 | 82.5 | — | — | — | — | — | — | — | |
| Llama3.1-8B-Instruct#Params=8B2026.05 | 82.4 | — | — | — | — | — | — | — | |
| FuseChat3.0#Params=8B2026.05 | 82.2 | — | — | — | — | — | — | — | |
| Dream-7B-Instructgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 81.36 | — | — | — | — | — | — | — | |
| Molmo2-O-7BParameters=7B2026.01 | 79.9 | — | — | — | — | — | — | — | |
| SDAR-30B-A3Bgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 78.98 | — | — | — | — | — | — | — | |
| Qwen2.5-14B#Params=14B2026.05 | 78.3 | — | — | — | — | — | — | — | |
| FuseChat3.0#Params=1.48B, Backbone=Llama-3.2-1B-Instruct2026.05 | 77.5 | — | — | — | — | — | — | — | |
| Gemma2-27B-it#Params=27B2026.05 | 77.4 | — | — | — | — | — | — | — | |
| Qwen1.5-72B-Chat#Params=72B2026.05 | 75.8 | — | — | — | — | — | — | — | |
| SkillWeave#Params=1.42B, Backbone=Llama-3.2-1B-Instruct2026.05 | 72.9 | — | — | — | — | — | — | — | |
| OLMo3-7B-InstructParameters=7B, Type=Instruct2026.01 | 72.2 | — | — | — | — | — | — | — | |
| self-rewarding#Params=1.15B, Backbone=Llama-3.2-1B-Instruct2026.05 | 71.1 | — | — | — | — | — | — | — | |
| PEFT#Params=1.42B, Backbone=Llama-3.2-1B-Instruct2026.05 | 70.8 | — | — | — | — | — | — | — | |
| Twin-merging#Params=1.48B, Backbone=Llama-3.2-1B-Instruct2026.05 | 70.1 | — | — | — | — | — | — | — | |
| Llama3.2-1B-Instruct#Params=1.15B, Backbone=Llama-3.2-1B-Instruct2026.05 | 69.4 | — | — | — | — | — | — | — | |
| USMoEModel=Qwen3-30B-A3B-Instruct, Evaluation Protocol=0-shot2025.03 | 64.6 | — | — | — | — | — | — | — | |
| OriginalModel=Qwen3-30B-A3B-Instruct, Selection Strategy=Token Choice (TC), Evaluation Protocol=0-shot2025.03 | 63.1 | — | — | — | — | — | — | — | |
| UM-187kBackbone=Apertus-8B-SFT, Evaluation Protocol=25-shot2025.11 | 60.87 | — | — | — | — | — | — | — | |
| UM-190kBackbone=Apertus-8B-SFT, Evaluation Protocol=25-shot2025.11 | 60.7 | — | — | — | — | — | — | — | |
| USMoEModel=Qwen3-30B-A3B-Thinking, Evaluation Protocol=0-shot2025.03 | 60 | — | — | — | — | — | — | — | |
| UM-170kBackbone=Apertus-8B-SFT, Evaluation Protocol=25-shot2025.11 | 59.87 | — | — | — | — | — | — | — | |
| TuluDPOBackbone=Apertus-8B-SFT, Evaluation Protocol=25-shot2025.11 | 59.59 | — | — | — | — | — | — | — | |
| ORPOBackbone=Apertus-8B-SFT, Evaluation Protocol=25-shot2025.11 | 58.83 | — | — | — | — | — | — | — | |
| OriginalModel=Qwen3-30B-A3B-Thinking, Selection Strategy=Token Choice (TC), Evaluation Protocol=0-shot2025.03 | 58.4 | — | — | — | — | — | — | — | |
| UltraFBBackbone=Apertus-8B-SFT, Evaluation Protocol=25-shot2025.11 | 58.17 | — | — | — | — | — | — | — | |
| SFTBackbone=Apertus-8B-SFT, Evaluation Protocol=25-shot2025.11 | 57.68 | — | — | — | — | — | — | — | |
| HelpSteerBackbone=Apertus-8B-SFT, Evaluation Protocol=25-shot2025.11 | 56.97 | — | — | — | — | — | — | — | |
| Ground TruthTransfer Direction=1B -> 7B, Mode=Zero-shot2025.09 | 56.911 | — | — | — | — | — | — | — | |
| DeepSeekR1 – 1.5B2026.02 | 55.5 | — | — | — | — | — | — | — | |
| CodePrefBackbone=Apertus-8B-SFT, Evaluation Protocol=25-shot2025.11 | 52.73 | — | — | — | — | — | — | — | |
| R^phiTransfer Direction=1B -> 7B, Mode=Zero-shot2025.09 | 52.558 | — | — | — | — | — | — | 1.022 | |
| RBRIDGETransfer Direction=1B -> 7B, Mode=Zero-shot2025.09 | 52.254 | — | — | — | — | — | — | 0.718 | |
| Expert Choice (EC)Model=Qwen3-30B-A3B-Instruct, Evaluation Protocol=0-shot2025.03 | 51.2 | — | — | — | — | — | — | — | |
| TuluDPOshots=25-shot2025.11 | 50.94 | — | — | — | — | — | — | — | |
| UM-190kshots=25-shot2025.11 | 50.48 | — | — | — | — | — | — | — | |
| UM-187kshots=25-shot2025.11 | 49.82 | — | — | — | — | — | — | — | |
| ORPOshots=25-shot2025.11 | 49.32 | — | — | — | — | — | — | — | |
| UltraFBshots=25-shot2025.11 | 48.98 | — | — | — | — | — | — | — | |
| SFTshots=25-shot2025.11 | 48.89 | — | — | — | — | — | — | — | |
| UM-170kshots=25-shot2025.11 | 48.62 | — | — | — | — | — | — | — | |
| Expert Choice (EC)Model=Qwen3-30B-A3B-Thinking, Evaluation Protocol=0-shot2025.03 | 47 | — | — | — | — | — | — | — | |
| HelpSteershots=25-shot2025.11 | 46.84 | — | — | — | — | — | — | — | |
| CodePrefshots=25-shot2025.11 | 46.84 | — | — | — | — | — | — | — | |
| BaseBackbone=LLaMA-2-7B, Compression Ratio=0%2025.10 | 43.34 | — | — | — | — | — | — | — | |
| LLM-PrunerBackbone=LLaMA-2-7B, Compression Ratio=20%2025.10 | 39.93 | — | — | — | — | — | — | — | |
| Gen-SSD2026.04 | 39.68 | — | — | — | — | — | — | — | |
| MoRSD2026.04 | 38.91 | — | — | — | — | — | — | — | |
| Standard KD2026.04 | 38.65 | — | — | — | — | — | — | — | |
| MCC-KD2026.04 | 38.14 | — | — | — | — | — | — | — | |
| PGSVDBackbone=LLaMA-2-7B, Compression Ratio=20%2025.10 | 36.52 | — | — | — | — | — | — | — | |
| SmolLM-1.7B + OursNumber of Parameters=~ 1.7B, Zero-shot=true2026.04 | 33 | — | — | — | — | — | — | — | |
| SmolLM-360M + OursNumber of Parameters=~ 360M, Zero-shot=true2026.04 | 31.5 | — | — | — | — | — | — | — | |
| Pythia-2.8BNumber of Parameters=~ 1.7B, Zero-shot=true2026.04 | 28.8 | — | — | — | — | — | — | — | |
| SliceGPTBackbone=LLaMA-2-7B, Compression Ratio=20%2025.10 | 28.41 | — | — | — | — | — | — | — | |
| MoEEModel=Qwen3-30B-A3B-Thinking, Selection Strategy=Token Choice (TC), Evaluation Protocol=0-shot2025.03 | 27.5 | — | — | — | — | — | — | — | |
| SmolLM-135M + OursNumber of Parameters=~ 135M, Zero-shot=true2026.04 | 27 | — | — | — | — | — | — | — | |
| MoEEModel=Qwen3-30B-A3B-Instruct, Selection Strategy=Token Choice (TC), Evaluation Protocol=0-shot2025.03 | 27 | — | — | — | — | — | — | — | |
| OPT-2.7BNumber of Parameters=~ 1.7B, Zero-shot=true2026.04 | 26.8 | — | — | — | — | — | — | — | |
| Galactica-125MNumber of Parameters=~ 135M, Zero-shot=true2026.04 | 26.2 | — | — | — | — | — | — | — | |
| LaMini-GPT-124MNumber of Parameters=~ 135M, Zero-shot=true2026.04 | 26 | — | — | — | — | — | — | — |