Knowledge on CMMLU
84.72Knowledge ScoreMiniCPM-4.1
Evaluation Results
| Method | Links | |
|---|---|---|
| MiniCPM-4.1# Param.=8B2026.02 | 84.72 | |
| Qwen3# Param.=8B2026.02 | 81.68 | |
| MiniCPM-SALA# Param.=9B2026.02 | 81.55 | |
| Ministral-3-R# Param.=8B2026.02 | 71.74 | |
| DSRMidtraining Schedule=DSR2026.05 | 68.59 | |
| WSDMidtraining Schedule=WSD2026.05 | 67.61 | |
| Cosine-decayMidtraining Schedule=Cos2026.05 | 67.43 | |
| Unified 15B MoEMidtraining Corpus=1k→8k2026.05 | 67.01 | |
| Unified 15B MoEMidtraining Corpus=4k→8k2026.05 | 66.07 | |
| Unified 15B MoEMidtraining Corpus=4k2026.05 | 66.02 | |
| Falcon-H1R# Param.=7B2026.02 | 63.55 | |
| Nemotron-Nano-v2# Param.=9B2026.02 | 61.59 | |
| Unified 15B MoEPretraining Corpus=4k→8k2026.05 | 60.57 | |
| Unified 15B MoEPretraining Corpus=1k→8k2026.05 | 60 | |
| Unified 15B MoEPretraining Corpus=4k2026.05 | 59.25 | |
| Teacher (Qwen3-0.6B)Role=Teacher, Model=Qwen3-0.6B, Evaluation Protocol=generation-based evaluation2026.03 | 45.2 | |
| ADGSelector=ADG, Model=LLaMA3-8B-Instruct, Training Pool=Alpaca-GPT4-ZH, Selection Size=10K, Fine-tuning=Yes, Number of Runs=52026.04 | 45.09 | |
| SuperFilteringSelector=SuperFiltering, Model=LLaMA3-8B-Instruct, Training Pool=Alpaca-GPT4-ZH, Selection Size=10K, Fine-tuning=Yes, Number of Runs=52026.04 | 44.02 | |
| RethinkingSelector=Rethinking, Model=LLaMA3-8B-Instruct, Training Pool=Alpaca-GPT4-ZH, Selection Size=10K, Fine-tuning=Yes, Number of Runs=52026.04 | 42.53 | |
| RandomSelector=Random, Model=LLaMA3-8B-Instruct, Training Pool=Alpaca-GPT4-ZH, Selection Size=10K, Fine-tuning=Yes, Number of Runs=52026.04 | 42.08 | |
| All DataSelector=All Data, Model=LLaMA3-8B-Instruct, Training Pool=Alpaca-GPT4-ZH, Selection Size=42,677, Fine-tuning=Yes, Number of Runs=52026.04 | 41.11 | |
| Hybrid KDASequence Mixer=KDA, Attention Layers=7, Evaluation Protocol=generation-based evaluation2026.03 | 38.7 | |
| Hybrid MambaSequence Mixer=Mamba2, Attention Layers=7, Evaluation Protocol=generation-based evaluation2026.03 | 37.1 | |
| Pure KDASequence Mixer=KDA, Attention Layers=0, Evaluation Protocol=generation-based evaluation2026.03 | 35.1 | |
| Pure MambaSequence Mixer=Mamba2, Attention Layers=0, Evaluation Protocol=generation-based evaluation2026.03 | 25.2 |