General Reasoning on MMLU (Accuracy)
96.2MMLU General Reasoning AccuracyCOSE
Evaluation Results
| Method | Links | |
|---|---|---|
| COSEModel=Qwen3-4B2026.05 | 96.2 | |
| COSEModel=Qwen3-0.6B2026.05 | 95 | |
| MAEModel=Llama-3.2-3B-Instruct2026.05 | 95 | |
| COSEModel=Llama-3.2-3B-Instruct2026.05 | 94.8 | |
| MAEModel=Qwen3-4B2026.05 | 94.2 | |
| R-ZeroModel=Qwen3-4B2026.05 | 93.8 | |
| AZRModel=Qwen3-4B2026.05 | 93.4 | |
| BaseModel=Qwen3-4B2026.05 | 93 | |
| COSEModel=Qwen2.5-3B-Instruct2026.05 | 67.5 | |
| SUBFITModel=Llama-3.1-8B-Instruct, Sparsity=25%2026.06 | 67.27 | |
| SUBFITModel=Qwen3-4B-Instruct, Sparsity=25%2026.06 | 64.23 | |
| BaseModel=Qwen2.5-3B-Instruct2026.05 | 63.4 | |
| AZRModel=Qwen2.5-3B-Instruct2026.05 | 63.4 | |
| R-ZeroModel=Qwen2.5-3B-Instruct2026.05 | 62.8 | |
| MAEModel=Qwen2.5-3B-Instruct2026.05 | 61.4 | |
| SUBFITModel=Llama-3.2-3B-Instruct, Sparsity=25%2026.06 | 60.69 | |
| R-ZeroModel=Llama-3.2-3B-Instruct2026.05 | 58.2 | |
| AZRModel=Llama-3.2-3B-Instruct2026.05 | 57.6 | |
| MAEModel=Qwen3-0.6B2026.05 | 55.2 | |
| BaseModel=Llama-3.2-3B-Instruct2026.05 | 54 | |
| R-ZeroModel=Qwen3-0.6B2026.05 | 53.6 | |
| AZRModel=Qwen3-0.6B2026.05 | 52.4 | |
| SUBFITModel=DeepSeek-7B-chat, Sparsity=25%2026.06 | 49.96 | |
| BaseModel=Qwen3-0.6B2026.05 | 44 | |
| SUBFITModel=Qwen2.5-7B-Instruct, Sparsity=25%2026.06 | 35.59 |