Multitask Language Understanding on MMLU (Accuracy)
91.5AccuracyGoAgent
Evaluation Results
| Method | Links | |
|---|---|---|
| GoAgent2026.03 | 91.5 | |
| Average human expert performance2021.12 | 89.8 | |
| ARG-Designer2026.03 | 89.54 | |
| EIB-LEARNER2026.03 | 88.9 | |
| G-Designer2026.03 | 86.92 | |
| AgentReviveVar. NS=True, Flex. State=True, Base model=Qwen2.5-72B-Instruct2026.05 | 86.09 | |
| DenseSparsity=0, Model Scale=72B, Model Family=Qwen 2.52025.10 | 86.06 | |
| AgentDropout2026.03 | 85.62 | |
| AgentPrune2026.03 | 85.07 | |
| AgentDropoutVar. NS=True, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 84.97 | |
| LLM-Debate2026.03 | 84.96 | |
| CoFiCotBackbone=Qwen2.5-Math-7B2026.03 | 84.9 | |
| Random2026.03 | 84.31 | |
| MASround=TVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 84.31 | |
| ARG-DesignerVar. NS=True, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 84.15 | |
| SC (CoT)Var. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 83.7 | |
| SC2026.03 | 83.66 | |
| CoTVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 83.66 | |
| AgentPruneVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 83.66 | |
| DenseSparsity=0, Model Scale=32B, Model Family=Qwen 2.52025.10 | 83.24 | |
| Chain2026.03 | 83.01 | |
| Best-of-kBackbone=Qwen2.5-Math-7B, k=1202026.03 | 82.6 | |
| ARMORSparsity=2:4+2.4%, Model Scale=72B, Model Family=Qwen 2.52025.10 | 82.4 | |
| Complete2026.03 | 82.35 | |
| VanillaVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 82.35 | |
| MASround=1Var. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 82.35 | |
| AutogenVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 82.34 | |
| k-way SCBackbone=Qwen2.5-Math-7B, k=1202026.03 | 82 | |
| CoT2026.03 | 81.69 | |
| AgentVerseVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 81.57 | |
| k-way SCBackbone=Qwen2.5-Math-7B, k=402026.03 | 81.3 | |
| Tree2026.03 | 81.04 | |
| G-DesignerVar. NS=False, Flex. State=False, Base model=Qwen2.5-72B-Instruct2026.05 | 81.02 | |
| Vanilla2026.03 | 80.39 | |
| DenseSparsity=0, Model Scale=14B, Model Family=Qwen 2.52025.10 | 79.8 | |
| WandaSparsity=2:4, Model Scale=72B, Model Family=Qwen 2.52025.10 | 79.61 | |
| NoWag-PSparsity=2:4, Model Scale=72B, Model Family=Qwen 2.52025.10 | 78.93 | |
| SparseGPTSparsity=2:4, Model Scale=72B, Model Family=Qwen 2.52025.10 | 78.71 | |
| ARMORSparsity=2:4+3.44%, Model Scale=32B, Model Family=Qwen 2.52025.10 | 78.18 | |
| Qwen3-30B-A3BPruning ratio=0%, Backbone=Qwen3-30B-A3B, Evaluation protocol=Zero-shot, Calibration samples=100, Calibration dataset=Zyda22025.07 | 77.82 | |
| Qwen3-30B-A3BPruning ratio=0%, Base Model=Qwen3-30B-A3B, Evaluation protocol=Zero-shot, Calibration samples=100, Calibration dataset=Zyda22025.07 | 77.82 | |
| Qwen3 14B BaseClassifier=Self-labeled2026.01 | 77 | |
| Qwen3 14B BaseClassifier=Majority-labeled2026.01 | 76.9 | |
| Qwen3 14BClassifier=Self-labeled2026.01 | 76.5 | |
| Qwen3 14BClassifier=Majority-labeled2026.01 | 76.2 | |
| WandaSparsity=2:4, Model Scale=32B, Model Family=Qwen 2.52025.10 | 75.45 | |
| SparseGPTSparsity=2:4, Model Scale=32B, Model Family=Qwen 2.52025.10 | 75.26 | |
| NoWag-PSparsity=2:4, Model Scale=32B, Model Family=Qwen 2.52025.10 | 74.89 | |
| RSPruning ratio=25%, Backbone=Qwen3-30B-A3B, Evaluation protocol=Zero-shot, Calibration samples=100, Calibration dataset=Zyda22025.07 | 74.6 | |
| C32A2Base Model=Qwen2.5-7B, #P/B=184.42, #AP/B=13.332026.03 | 74.6 | |
| PTBase Model=Qwen2.5-7B, #P/B=7.62, #AP/B=7.622026.03 | 74.28 | |
| CASTBase Model=Qwen 2.5 (7B)2025.12 | 74.27 | |
| Qwen2.5-7BModel=Qwen2.5-7B2026.06 | 74.2 | |
| None (original model)Base Model=Qwen 2.5 (7B)2025.12 | 74.19 | |
| DenseSparsity=0, Model Scale=7B, Model Family=Qwen 2.52025.10 | 74.19 | |
| LinEAS+E2E-DSAS (R)Base Model=Qwen 2.5 (7B)2025.12 | 74.16 | |
| Qwen2-57B-A14BPruning ratio=0%, Backbone=Qwen2-57B-A14B, Evaluation protocol=Zero-shot, Calibration samples=100, Calibration dataset=Zyda22025.07 | 74.06 | |
| Qwen2-57B-A14BPruning ratio=0%, Base Model=Qwen2-57B-A14B, Evaluation protocol=Zero-shot, Calibration samples=100, Calibration dataset=Zyda22025.07 | 74.06 | |
| MoNEPruning ratio=25%, Backbone=Qwen3-30B-A3B, Evaluation protocol=Zero-shot, Calibration samples=100, Calibration dataset=Zyda22025.07 | 74.04 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B2026.03 | 73.9 | |
| LinEAS+DSASBase Model=Qwen 2.5 (7B)2025.12 | 73.81 | |
| LinEAS+E2E-DSAS (S)Base Model=Qwen 2.5 (7B)2025.12 | 73.61 | |
| LinEASBase Model=Qwen 2.5 (7B)2025.12 | 73.59 | |
| Qwen3 8B BaseClassifier=Self-labeled2026.01 | 73.5 | |
| Qwen3 8B BaseClassifier=Majority-labeled2026.01 | 73.5 | |
| CoFiCotBase Model=GPT-3.5-Turbo2026.03 | 73.5 | |
| Dream BaseModel=Dream Base, TPS=9.10, Speed=1.00×, Memory=15.642025.05 | 73.49 | |
| FLAMODEL=4B, Precision=W4A162026.06 | 73.34 | |
| Multiplication-Only Matrix Inversion ApproximationMODEL=4B, Precision=W4A162026.06 | 73.29 | |
| dLLM-CacheModel=Dream Base, TPS=31.07, Speed=3.41×, Memory=16.372025.05 | 73.2 | |
| FineRMoEBase Model=Qwen2.5-7B, #P/B=26.65, #AP/B=7.942026.03 | 73.08 | |
| CAABase Model=Qwen 2.5 (7B)2025.12 | 73.05 | |
| CAA+DSASBase Model=Qwen 2.5 (7B)2025.12 | 73.02 | |
| CTBase Model=Qwen2.5-7B, #P/B=7.62, #AP/B=7.622026.03 | 72.97 | |
| I-DPO + MaPPOModel=Qwen2.5-7B-Instruct2025.07 | 72.9 | |
| dKV-CacheModel=Dream Base, TPS=12.80, Speed=1.41×, Memory=15.922025.05 | 72.77 | |
| ITI+DSASBase Model=Qwen 2.5 (7B)2025.12 | 72.74 | |
| ITIBase Model=Qwen 2.5 (7B)2025.12 | 72.72 | |
| Fast-dLLMModel=Dream Base, TPS=23.69, Speed=2.60×, Memory=18.322025.05 | 72.69 | |
| DIRBackbone=Llama3.1-8B-Instruct2025.12 | 72.64 | |
| ALBMBackbone=Llama3.1-8B-Instruct2025.12 | 72.55 | |
| SKBackbone=Llama3.1-8B-Instruct2025.12 | 72.33 | |
| BaseBackbone=Llama3.1-8B-Instruct2025.12 | 72.31 | |
| MC-SMoEPruning ratio=25%, Backbone=Qwen3-30B-A3B, Evaluation protocol=Zero-shot, Calibration samples=100, Calibration dataset=Zyda22025.07 | 72.25 | |
| InfoRMBackbone=Llama3.1-8B-Instruct2025.12 | 72.22 | |
| MERABase Model=Qwen 2.5 (7B)2025.12 | 72.06 | |
| DPO + MaPPOModel=Qwen2.5-7B-Instruct2025.07 | 72 | |
| PoEBackbone=Llama3.1-8B-Instruct2025.12 | 71.97 | |
| DPOModel=Qwen2.5-7B-Instruct2025.07 | 71.9 | |
| I-DPOModel=Qwen2.5-7B-Instruct2025.07 | 71.9 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B, Stage=Instruct2025.06 | 71.85 | |
| ITModel=Qwen2.5-7B-Instruct2025.07 | 71.8 | |
| MoNEPruning ratio=25%, Backbone=Qwen2-57B-A14B, Evaluation protocol=Zero-shot, Calibration samples=100, Calibration dataset=Zyda22025.07 | 71.64 | |
| Qwen3 8BClassifier=Self-labeled2026.01 | 71.6 | |
| Qwen3 8BClassifier=Majority-labeled2026.01 | 71.4 | |
| RSPruning ratio=25%, Backbone=Qwen2-57B-A14B, Evaluation protocol=Zero-shot, Calibration samples=100, Calibration dataset=Zyda22025.07 | 70.99 | |
| ARMORSparsity=2:4+4.17%, Model Scale=14B, Model Family=Qwen 2.52025.10 | 70.55 | |
| k-way SCBase Model=GPT-3.5-Turbo, k=1202026.03 | 70.4 | |
| Flash Linear AttentionModel scale=9B2026.06 | 70.26 | |
| Multiplication-Only Matrix Inversion ApproximationModel scale=9B2026.06 | 70.23 |