Multiple-choice Question Answering on MMLU
97.5AccuracyM2CL
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| M2CLBackbone=Qwen-72B, Number of LLMs=322026.02 | 97.5 | — | — | — | — | — | — | |
| M2CLBackbone=Llama-70B, Number of LLMs=322026.02 | 97 | — | — | — | — | — | — | |
| GPTSwarmBackbone=Llama-70B, Number of LLMs=322026.02 | 96.4 | — | — | — | — | — | — | |
| M2CLBackbone=Qwen-14B, Number of LLMs=322026.02 | 96.1 | — | — | — | — | — | — | |
| M2CLBackbone=Qwen-7B, Number of LLMs=322026.02 | 96 | — | — | — | — | — | — | |
| M2CLBackbone=Llama-14B, Number of LLMs=322026.02 | 95.8 | — | — | — | — | — | — | |
| DyLANBackbone=Llama-70B, Number of LLMs=322026.02 | 94.5 | — | — | — | — | — | — | |
| GPTSwarmBackbone=Qwen-72B, Number of LLMs=322026.02 | 93.1 | — | — | — | — | — | — | |
| DyLANBackbone=Qwen-72B, Number of LLMs=322026.02 | 92.8 | — | — | — | — | — | — | |
| MacNetBackbone=Qwen-72B, Number of LLMs=322026.02 | 92.5 | — | — | — | — | — | — | |
| MacNetBackbone=Llama-14B, Number of LLMs=322026.02 | 90.7 | — | — | — | — | — | — | |
| MacNetBackbone=Llama-70B, Number of LLMs=322026.02 | 90 | — | — | — | — | — | — | |
| ARMOR-MADAgents=gpt-4o-mini, deepseek-v3, qwen-plus2026.06 | 90 | — | — | — | — | — | — | |
| DyLANBackbone=Qwen-14B, Number of LLMs=322026.02 | 89.3 | — | — | — | — | — | — | |
| GPTSwarmBackbone=Qwen-14B, Number of LLMs=322026.02 | 89 | — | — | — | — | — | — | |
| MoA2026.06 | 89 | — | — | — | — | — | — | |
| MacNetBackbone=Qwen-14B, Number of LLMs=322026.02 | 87.8 | — | — | — | — | — | — | |
| Hetero-Vote-onlyAgents=gpt-4o-mini, deepseek-v3, qwen-plus2026.06 | 87.5 | — | — | — | — | — | — | |
| DebateBackbone=Qwen-72B, Number of LLMs=322026.02 | 86.5 | — | — | — | — | — | — | |
| DebateBackbone=Llama-70B, Number of LLMs=322026.02 | 85.7 | — | — | — | — | — | — | |
| Hetero-MADAgents=gpt-4o-mini, deepseek-v3, qwen-plus2026.06 | 84.5 | — | — | — | — | — | — | |
| BoNBackbone=Qwen-72B, Number of LLMs=322026.02 | 84.2 | — | — | — | — | — | — | |
| Self-ConsistencyAgents=gpt-4o-mini2026.06 | 84 | — | — | — | — | — | — | |
| DyLANBackbone=Llama-14B, Number of LLMs=322026.02 | 83.6 | — | — | — | — | — | — | |
| BoNBackbone=Llama-70B, Number of LLMs=322026.02 | 83 | — | — | — | — | — | — | |
| DebateBackbone=Qwen-14B, Number of LLMs=322026.02 | 82.7 | — | — | — | — | — | — | |
| Single-CoTAgents=gpt-4o-mini2026.06 | 82 | — | — | — | — | — | — | |
| MacNetBackbone=Qwen-7B, Number of LLMs=322026.02 | 80.6 | — | — | — | — | — | — | |
| Full modelSparsity=0%, Backbone=Qwen3-30B-A3B, Evaluation Protocol=Zero-shot2026.05 | 80.2 | — | — | — | — | — | — | |
| BoNBackbone=Qwen-14B, Number of LLMs=322026.02 | 79.7 | — | — | — | — | — | — | |
| GPTSwarmBackbone=Qwen-7B, Number of LLMs=322026.02 | 79.6 | — | — | — | — | — | — | |
| M2CLBackbone=Llama-7B, Number of LLMs=322026.02 | 79.1 | — | — | — | — | — | — | |
| GPT-4o2026.02 | 79.09 | — | — | — | — | — | — | |
| DyLANBackbone=Qwen-7B, Number of LLMs=322026.02 | 78.2 | — | — | — | — | — | — | |
| DebateBackbone=Qwen-7B, Number of LLMs=322026.02 | 76.8 | — | — | — | — | — | — | |
| BoNBackbone=Qwen-7B, Number of LLMs=322026.02 | 74.2 | — | — | — | — | — | — | |
| RCOSparsity=25%, Backbone=Qwen3-30B-A3B, Evaluation Protocol=Zero-shot2026.05 | 73.3 | — | — | — | — | — | — | |
| DebateBackbone=Llama-14B, Number of LLMs=322026.02 | 73.1 | — | — | — | — | — | — | |
| DPOBackbone=Qwen3-8B2026.03 | 72.6 | — | — | — | — | — | — | |
| SingleBackbone=Qwen-72B, Number of LLMs=322026.02 | 72.5 | — | — | — | — | — | — | |
| l-MoEaccActive Params=8.02B, Total Params=72.8B2026.01 | 72.11 | — | — | — | — | — | — | |
| STL-augBase Model=Qwen2.5-7B2026.02 | 72 | — | — | — | — | — | — | |
| l-MoEeffActive Params=5.91B, Total Params=72.8B2026.01 | 71.34 | — | — | — | — | — | — | |
| DSPABackbone=Qwen3-8B2026.03 | 71.2 | — | — | — | — | — | — | |
| RepEBackbone=Qwen3-8B2026.03 | 71.2 | — | — | — | — | — | — | |
| Static-SAEBackbone=Qwen3-8B2026.03 | 71.2 | — | — | — | — | — | — | |
| Base ModelBackbone=Qwen3-8B2026.03 | 71.1 | — | — | — | — | — | — | |
| GTCABackbone Model=Qwen-2.5-7B, Evaluation Protocol=0-shot2026.01 | 71.02 | — | — | — | — | — | — | |
| BoNBackbone=Llama-14B, Number of LLMs=322026.02 | 71 | — | — | — | — | — | — | |
| STLBase Model=Qwen2.5-7B2026.02 | 71 | — | — | — | — | — | — | |
| SurgicalBase Model=Qwen2.5-7B2026.02 | 71 | — | — | — | — | — | — | |
| Prompt EngBackbone=Qwen3-8B2026.03 | 71 | — | — | — | — | — | — | |
| LoRA-onlyBackbone Model=Qwen-2.5-7B, Evaluation Protocol=0-shot2026.01 | 70.12 | — | — | — | — | — | — | |
| BaselineActive Params=8.09B, Total Params=72.6B2026.01 | 70.1 | — | — | — | — | — | — | |
| SCANSBase Model=Qwen2.5-7B2026.02 | 70 | — | — | — | — | — | — | |
| DCRBase Model=Qwen2.5-7B2026.02 | 70 | — | — | — | — | — | — | |
| BackboneBackbone Model=Qwen-2.5-7B, Evaluation Protocol=0-shot2026.01 | 69.98 | — | — | — | — | — | — | |
| Direct-JointBackbone Model=Qwen-2.5-7B, Evaluation Protocol=0-shot2026.01 | 69.55 | — | — | — | — | — | — | |
| SingleBackbone=Llama-70B, Number of LLMs=322026.02 | 68.9 | — | — | — | — | — | — | |
| Mistral Large2026.02 | 68.76 | — | — | — | — | — | — | |
| TopoPrior+ARGBase model=Llama3-8B-Instruct, Trainable Parameters (M)=3.3+3.8=7.1, Δ (%)=0.092026.05 | 68.53 | — | — | — | — | — | — | |
| SingleBackbone=Qwen-14B, Number of LLMs=322026.02 | 67.2 | — | — | — | — | — | — | |
| Homo-MADAgents=gpt-4o-mini2026.06 | 66.5 | — | — | — | — | — | — | |
| D-MAD2026.06 | 66.5 | — | — | — | — | — | — | |
| Qwen-14Brole=Teacher model, shot=5-shot2024.07 | 66.3 | — | — | — | — | — | — | |
| EvoESAPSparsity=25%, Backbone=Qwen3-30B-A3B, Evaluation Protocol=Zero-shot2026.05 | 66.2 | — | — | — | — | — | — | |
| FlashNormModel=Llama-3.1-8B, Few-shot setting=5-shot, Context window=4096-token, Precision=fp16, Hardware=NVIDIA A100, Evaluation framework=lm-evaluation-harness2024.07 | 65.62 | — | — | — | — | 0.0006 | — | |
| SourceModel=Llama-3.1-8B, Few-shot setting=5-shot, Context window=4096-token, Precision=fp16, Hardware=NVIDIA A100, Evaluation framework=lm-evaluation-harness2024.07 | 65.56 | — | — | — | — | — | — | |
| Jet-Nemotron-4BSearch=N/R, Train=400B2026.05 | 65.24 | — | — | — | — | — | — | |
| DASH-3Budget=17.75, Search=12.3M / run, Train=700M2026.05 | 63.95 | — | — | — | — | — | — | |
| MacNetBackbone=Llama-7B, Number of LLMs=322026.02 | 62.7 | — | — | — | — | — | — | |
| DASH-3Budget=9.0, Search=12.3M / run, Train=700M2026.05 | 62.55 | — | — | — | — | — | — | |
| 16-bit BaselineModel Variant=LLaMA-3-8B2024.11 | 62 | — | — | — | — | — | — | |
| FP16 (no compression)error budget (epsilon)=N/A, KV cache (rel.)=1, Zero-shot protocol=true, Base Model=Llama-3-8B2026.01 | 62 | — | — | — | — | — | — | |
| Llama3.1-8BBase Model=Llama3.1-8B, Evaluation Protocol=zero-shot2026.02 | 61.8 | — | — | — | — | — | — | |
| SingleBackbone=Qwen-7B, Number of LLMs=322026.02 | 61.2 | — | — | — | — | — | — | |
| STLBase Model=LLaMA-3-8B2026.02 | 61 | — | — | — | — | — | — | |
| Llama3.1-8B + ODESTEERBase Model=Llama3.1-8B, Steering Method=ODESTEER, Evaluation Protocol=zero-shot2026.02 | 60.9 | — | — | — | — | — | — | |
| Jet-Nemotron-2BSearch=200B, Train=400B2026.05 | 60.87 | — | — | — | — | — | — | |
| DSPABackbone=Gemma-2-9B2026.03 | 60.6 | — | — | — | — | — | — | |
| Static-SAEBackbone=Gemma-2-9B2026.03 | 60.6 | — | — | — | — | — | — | |
| DPOBackbone=Gemma-2-9B2026.03 | 60.4 | — | — | — | — | — | — | |
| RepEBackbone=Gemma-2-9B2026.03 | 60.4 | — | — | — | — | — | — | |
| MoDEBase model=Llama3-8B-Instruct, Trainable Parameters (M)=2,376, Δ (%)=29.702026.05 | 60.12 | — | — | — | — | — | — | |
| StiefAttentionerror budget (epsilon)=0.015, KV cache (rel.)=0.85, Zero-shot protocol=true, Base Model=Llama-3-8B2026.01 | 60 | — | — | — | — | — | — | |
| STL-augBase Model=LLaMA-3-8B2026.02 | 60 | — | — | — | — | — | — | |
| SurgicalBase Model=LLaMA-3-8B2026.02 | 60 | — | — | — | — | — | — | |
| SCANSBase Model=LLaMA-3-8B2026.02 | 60 | — | — | — | — | — | — | |
| Prompt EngBackbone=Gemma-2-9B2026.03 | 60 | — | — | — | — | — | — | |
| Base ModelBackbone=Gemma-2-9B2026.03 | 60 | — | — | — | — | — | — | |
| Llama3-70B-InstructSize=70B, Type=Instruct2026.02 | 59.67 | — | — | — | — | — | — | |
| DES-MoEBase model=Llama3-8B-Instruct, Trainable Parameters (M)=1,585, Δ (%)=19.812026.05 | 59.1 | — | — | — | — | — | — | |
| STLBase Model=Qwen2.5-1.5B2026.02 | 59 | — | — | — | — | — | — | |
| STL-augBase Model=Qwen2.5-1.5B2026.02 | 59 | — | — | — | — | — | — | |
| SurgicalBase Model=Qwen2.5-1.5B2026.02 | 59 | — | — | — | — | — | — | |
| SCANSBase Model=Qwen2.5-1.5B2026.02 | 59 | — | — | — | — | — | — | |
| DCRBase Model=LLaMA-3-8B2026.02 | 59 | — | — | — | — | — | — | |
| RCOSparsity=50%, Backbone=Qwen3-30B-A3B, Evaluation Protocol=Zero-shot2026.05 | 58.7 | — | — | — | — | — | — | |
| DCRBase Model=Qwen2.5-1.5B2026.02 | 58 | — | — | — | — | — | — | |
| EvoESAPSparsity=50%, Backbone=Qwen3-30B-A3B, Evaluation Protocol=Zero-shot2026.05 | 57.6 | — | — | — | — | — | — |