Language Understanding on MMLU (Score)
88.6MMLU Scoregpt-oss-120b
Evaluation Results
| Method | Links | |
|---|---|---|
| gpt-oss-120bNumber of Parameters=117B, Optimization Level=high2026.01 | 88.6 | |
| Solar OpenNumber of Parameters=102B2026.01 | 88.2 | |
| gpt-oss-120bNumber of Parameters=117B, Optimization Level=medium2026.01 | 87.9 | |
| GLM-4.5-AirNumber of Parameters=110B2026.01 | 83.3 | |
| Qwen2-72B-InstructType=Instruction-tuned2024.07 | 82.3 | |
| Llama-3-70B-InstructType=Instruction-tuned2024.07 | 82 | |
| DenseModel=Qwen-3 14B, Sparsity=02025.10 | 80.47 | |
| DenseModel=Qwen-3 8B, Sparsity=02025.10 | 76.82 | |
| Qwen1.5-110B-ChatType=Instruction-tuned2024.07 | 76.5 | |
| Qwen1.5-72B-ChatType=Instruction-tuned2024.07 | 75.6 | |
| Mixtral-8x22B-InstructType=Instruction-tuned2024.07 | 74 | |
| ARMORModel=Qwen-3 14B, Sparsity=2:4+3.89%2025.10 | 71.43 | |
| SGDPOBase model=Qwen-2 instruct 7B2025.05 | 70.69 | |
| SamPOBase model=Qwen-2 instruct 7B2025.05 | 70.67 | |
| DPOBase model=Qwen-2 instruct 7B2025.05 | 70.65 | |
| BCOBase model=Qwen-2 instruct 7B2025.05 | 70.65 | |
| SFTBase model=Qwen-2 instruct 7B2025.05 | 70.6 | |
| NCABase model=Qwen-2 instruct 7B2025.05 | 70.57 | |
| TDPOBase model=Qwen-2 instruct 7B2025.05 | 70.55 | |
| IPOBase model=Qwen-2 instruct 7B2025.05 | 70.39 | |
| System PromptBase Model=Llama-3.1-8B2026.03 | 67 | |
| ARMORModel=Qwen-3 8B, Sparsity=2:4+5.03%2025.10 | 66.22 | |
| Llama-3.1-8B-SFTBase Model=Llama-3.1-8B2026.03 | 66 | |
| VCLBase Model=Llama-3.1-8B2026.03 | 65 | |
| SparseGPTModel=Qwen-3 14B, Sparsity=2:42025.10 | 64.73 | |
| DROBase Model=Llama-3.1-8B2026.03 | 64 | |
| Self-CDBase Model=Llama-3.1-8B2026.03 | 63 | |
| WandaModel=Qwen-3 14B, Sparsity=2:42025.10 | 62.93 | |
| Vector AblationBase Model=Llama-3.1-8B2026.03 | 62 | |
| NoWag-PModel=Qwen-3 14B, Sparsity=2:42025.10 | 61.69 | |
| NPO+KLBase Model=Llama 3.1 8B, Variant=12025.05 | 61.4 | |
| Unilogit+KLBase Model=Llama 3.1 8B, Variant=22025.05 | 61.4 | |
| BaselineBase Model=Llama 3.1 8B2025.05 | 60.8 | |
| ME+GDBase Model=Llama 3.1 8B2025.05 | 60.8 | |
| NPO+KLBase Model=Llama 3.1 8B, Variant=22025.05 | 60.4 | |
| NPOBase Model=Llama 3.1 8B2025.05 | 60.2 | |
| UnDIAL+KLBase Model=Llama 3.1 8B, Variant=12025.05 | 60.2 | |
| GABase Model=Llama 3.1 8B2025.05 | 59.6 | |
| SimNPO+KLBase Model=Llama 3.1 8B, Variant=22025.05 | 59.6 | |
| RKLD+KLBase Model=Llama 3.1 8B2025.05 | 59.5 | |
| SimNPO+KLBase Model=Llama 3.1 8B, Variant=12025.05 | 59.1 | |
| GA+KLBase Model=Llama 3.1 8B2025.05 | 58.7 | |
| UnDIAL+KLBase Model=Llama 3.1 8B, Variant=22025.05 | 58.5 | |
| SparseGPTModel=Qwen-3 8B, Sparsity=2:42025.10 | 55.77 | |
| WandaModel=Qwen-3 8B, Sparsity=2:42025.10 | 55.75 | |
| VanillaTarget Model=LLaMA2-13B-Chat2024.06 | 54.9 | |
| Unilogit+KLBase Model=Llama 3.1 8B, Variant=12025.05 | 54.4 | |
| NoWag-PModel=Qwen-3 8B, Sparsity=2:42025.10 | 54.1 | |
| PaCETarget Model=LLaMA2-13B-Chat2024.06 | 53.1 | |
| Qwen2-1.5Bnumber of parameters=1.5B2024.07 | 52.4 | |
| PromptingTarget Model=LLaMA2-13B-Chat2024.06 | 52.4 | |
| OrthoProjTarget Model=LLaMA2-13B-Chat2024.06 | 51.1 | |
| VecAddTarget Model=LLaMA2-13B-Chat2024.06 | 50.9 | |
| Qwen1.5-1.8Bnumber of parameters=1.8B2024.07 | 43.7 | |
| VanillaTarget Model=LLaMA2-7B-Chat2024.06 | 43.4 | |
| PaCETarget Model=LLaMA2-7B-Chat2024.06 | 38.4 | |
| Qwen2-0.5Bnumber of parameters=0.5B2024.07 | 37.9 | |
| Qwen1.5-0.5Bnumber of parameters=0.5B2024.07 | 35 | |
| OrthoProjTarget Model=LLaMA2-7B-Chat2024.06 | 34.1 | |
| MoEModel Size=15B-A1.5B, Training Strategy=Baseline2026.02 | 33.24 | |
| Expert Divergence LearningModel Size=15B-A1.5B, Scheme=49-class2026.02 | 33.21 | |
| Expert Divergence LearningModel Size=15B-A1.5B, Scheme=3-class2026.02 | 32.98 | |
| MoEModel Size=8B-A0.8B, Training Strategy=Baseline2026.02 | 32.54 | |
| Expert Divergence LearningModel Size=8B-A0.8B, Scheme=49-class2026.02 | 32.05 | |
| Expert Divergence LearningModel Size=8B-A0.8B, Scheme=3-class2026.02 | 31.69 | |
| Expert Divergence LearningModel Size=3B-A0.3B, Scheme=3-class2026.02 | 31.47 | |
| Expert Divergence LearningModel Size=3B-A0.3B, Scheme=49-class2026.02 | 31.41 | |
| MoEModel Size=3B-A0.3B, Training Strategy=Baseline2026.02 | 31.16 | |
| VecAddTarget Model=LLaMA2-7B-Chat2024.06 | 30.6 | |
| PromptingTarget Model=LLaMA2-7B-Chat2024.06 | 16.3 |