Multitask Language Understanding on MMLU (Accuracy only)
86.3AccuracyHCP-MAD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HCP-MADBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 86.3 | — | |
| Heter-MADBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 84.3 | — | |
| DOWNBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 84.06 | — | |
| MADBase Model=Qwen2.5-32b-instruct2026.04 | 83.85 | — | |
| Qwen3-32BModel Size=32B2026.04 | 83.61 | — | |
| Linear-AcTBackbone=Qwen2.5-32B2026.04 | 83.42 | — | |
| ITIBackbone=Qwen2.5-32B2026.04 | 83.02 | — | |
| OriginalBackbone=Qwen2.5-32B2026.04 | 82.83 | — | |
| SCBase Model=Qwen2.5-32b-instruct2026.04 | 82.56 | — | |
| SRBase Model=Qwen2.5-32b-instruct2026.04 | 82.43 | — | |
| Full PrecisionModel=Qwen-30B-A3B2026.05 | 81.93 | — | |
| Mean-AcTBackbone=Qwen-2.5-14B2026.04 | 80.28 | — | |
| PID-AcTBackbone=Qwen-2.5-14B2026.04 | 80.16 | — | |
| HCInferModel=Qwen-30B-A3B2026.05 | 79.92 | — | |
| S-PIDBackbone=Qwen2.5-32B2026.04 | 79.24 | — | |
| SCBase Model=Llama-3.1-70b-instruct2026.04 | 79.1 | — | |
| ITIBackbone=Qwen-2.5-14B2026.04 | 79.04 | — | |
| OriginalBackbone=Qwen-2.5-14B2026.04 | 78.8 | — | |
| Linear-AcTBackbone=Qwen-2.5-14B2026.04 | 78.64 | — | |
| MARSBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 78.63 | — | |
| ODESteerBackbone=Qwen-2.5-14B2026.04 | 78.08 | — | |
| MADBase Model=Llama-3.1-70b-instruct2026.04 | 77.95 | — | |
| CoTBase Model=Qwen2.5-32b-instruct2026.04 | 77.61 | — | |
| SRBase Model=Llama-3.1-70b-instruct2026.04 | 77.2 | — | |
| Qwen3-8BModel Size=8B2026.04 | 76.89 | — | |
| Llama.cpp INT4Model=Qwen-30B-A3B2026.05 | 76.85 | — | |
| CoTBase Model=Llama-3.1-70b-instruct2026.04 | 76.8 | — | |
| GPTQ INT4Model=Qwen-30B-A3B2026.05 | 76.4 | — | |
| Gemma2-27BParams=27B, Tokens=13T, Complexity Type=Quadratic, Evaluation Framework=vLLM, Evaluation Method=perplexity-based2025.09 | 75.94 | — | |
| S-PIDBackbone=Qwen-2.5-14B2026.04 | 75.9 | — | |
| A-LQRBackbone=Qwen2.5-32B2026.04 | 75.4 | — | |
| Qwen2.5 (base)Params=7B, Tokens=18T, Complexity Type=Quadratic, Evaluation Framework=vLLM, Evaluation Method=perplexity-based2025.09 | 75.31 | — | |
| OPD-Qwen3-1.7BBase Model=Qwen3-1.7B, Training Mode=OPD2026.04 | 74.31 | — | |
| Qwen2.5-7B2026.04 | 74.3 | — | |
| Qwen2.5 (base)Params=7B, Tokens=18T, Complexity Type=Quadratic, Evaluation Framework=HuggingFace, Evaluation Protocol=perplexity-based2025.09 | 74.21 | — | |
| Qwen2.5-7B + MathAgentTraining Type=SFT, Data Size=1K2026.04 | 74.1 | — | |
| Qwen2.5-7B + NuminaMathTraining Type=SFT, Data Size=1K2026.04 | 73.8 | — | |
| Qwen2.5-7B + LIMOTraining Type=SFT, Data Size=0.8K2026.04 | 73.8 | — | |
| Qwen2.5-7B + MagpieTraining Type=SFT, Data Size=1K2026.04 | 73.6 | — | |
| SpikingBrain-76B (76B-A12B)Params=12B/76B, Tokens=+160B, Complexity Type=Hybrid, Evaluation Framework=vLLM, Evaluation Method=perplexity-based2025.09 | 73.58 | — | |
| SFT-Qwen3-1.7BBase Model=Qwen3-1.7B, Training Mode=SFT2026.04 | 73.28 | — | |
| Qwen2.5-7B + S1KTraining Type=SFT, Data Size=1K2026.04 | 73.2 | — | |
| Qwen3-4BModel Size=4B2026.04 | 72.99 | — | |
| ITIBackbone=Gemma-2-9B2026.04 | 72.68 | — | |
| PID-AcTBackbone=Gemma-2-9B2026.04 | 72.32 | — | |
| Linear-AcTBackbone=Gemma-2-9B2026.04 | 72.24 | — | |
| Mean-AcTBackbone=Gemma-2-9B2026.04 | 71.8 | — | |
| OriginalBackbone=Gemma-2-9B2026.04 | 71.73 | — | |
| A-LQRBackbone=Qwen-2.5-14B2026.04 | 71.66 | — | |
| Mixtral-8*7B (47B-A13B)Params=13B/47B, Complexity Type=Quadratic, Evaluation Framework=vLLM, Evaluation Method=perplexity-based2025.09 | 71.23 | — | |
| ODESteerBackbone=Gemma-2-9B2026.04 | 70.56 | — | |
| Qwen3-4BBase Model=Qwen3-4B, Evaluation Protocol=5-shot2026.04 | 70.2 | — | |
| S-PIDBackbone=Gemma-2-9B2026.04 | 70.12 | — | |
| A-LQRBackbone=Gemma-2-9B2026.04 | 70.12 | — | |
| LoopQModel=Ouro 2.6B, Quantization=W4A82026.05 | 70.07 | — | |
| LLama2-70bParams=70B, Tokens=2T, Complexity Type=Quadratic, Evaluation Framework=vLLM, Evaluation Method=perplexity-based2025.09 | 69.57 | — | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 69 | — | |
| OriginalModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 69 | — | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.9 | — | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.9 | — | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.9 | — | |
| SafeMERGEModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.8 | — | |
| SafeInstructModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.8 | — | |
| SafeMERGEModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.8 | — | |
| Fine-tunedModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.7 | — | |
| OriginalModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.7 | — | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.7 | — | |
| OriginalModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.7 | — | |
| SafeInstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.7 | — | |
| SafeLoRAModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.6 | — | |
| Fine-tunedModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.6 | — | |
| SafeLoRAModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.6 | — | |
| SafeLoRAModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.5 | — | |
| Fine-tunedModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.5 | — | |
| SafeLoRAModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.4 | — | |
| Fine-tunedModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.4 | — | |
| RESTA-InstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.4 | — | |
| RESTA-InstructModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.3 | — | |
| RESTA-InstructModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 68.3 | — | |
| RESTA-InstructModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 68.2 | — | |
| RESTAModel=Qwen-2-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 67.9 | — | |
| Full PrecisionModel=Llama-3.1-8B2026.05 | 67.9 | — | |
| OriginalBackbone=Qwen-2.5-3B2026.04 | 67.84 | — | |
| ITIBackbone=Qwen-2.5-3B2026.04 | 67.84 | — | |
| RESTAModel=Qwen-2-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 67.8 | — | |
| RESTAModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=PubMedQA2025.03 | 67.8 | — | |
| RESTAModel=Qwen-2.5-7B-Instruct, Fine-tuning Context=GSM8K2025.03 | 67.7 | — | |
| ITIBackbone=Llama-3-8B2026.04 | 67.22 | — | |
| Linear-AcTBackbone=Qwen-2.5-3B2026.04 | 67.2 | — | |
| Jamba (52B-A12B)Params=12B/52B, Complexity Type=Hybrid, Evaluation Framework=vLLM, Evaluation Method=perplexity-based2025.09 | 67.17 | — | |
| Mean-AcTBackbone=Qwen-2.5-3B2026.04 | 67.1 | — | |
| PID-AcTBackbone=Qwen-2.5-3B2026.04 | 66.98 | — | |
| Mean-AcTBackbone=Llama-3-8B2026.04 | 66.98 | — | |
| HCInferModel=Llama-3.1-8B2026.05 | 66.74 | — | |
| PID-AcTBackbone=Llama-3-8B2026.04 | 66.42 | — | |
| Linear-AcTBackbone=Llama-3-8B2026.04 | 66.22 | — | |
| SpikingBrain-7BParams=7B, Tokens=+150B, Complexity Type=Linear, Evaluation Framework=HuggingFace, Evaluation Protocol=perplexity-based2025.09 | 65.84 | — | |
| Llama3.1Params=8B, Tokens=15T, Complexity Type=Quadratic, Evaluation Framework=HuggingFace, Evaluation Protocol=perplexity-based2025.09 | 65.74 | — | |
| A-LQRBackbone=Qwen-2.5-3B2026.04 | 65.38 | — | |
| Llama-3-8BBase Model=Llama-3-8B, Evaluation Protocol=5-shot2026.04 | 65.3 | — |