Knowledge on C-Eval (accuracy)
0.6824C-Eval Knowledge AccuracyDSR
Evaluation Results
| Method | Links | |
|---|---|---|
| DSRMidtraining Schedule=DSR2026.05 | 0.6824 | |
| WSDMidtraining Schedule=WSD2026.05 | 0.6809 | |
| Cosine-decayMidtraining Schedule=Cos2026.05 | 0.6784 | |
| Unified 15B MoEMidtraining Corpus=1k→8k2026.05 | 0.6737 | |
| Unified 15B MoEMidtraining Corpus=4k→8k2026.05 | 0.6671 | |
| Unified 15B MoEMidtraining Corpus=4k2026.05 | 0.6561 | |
| Unified 15B MoEPretraining Corpus=1k→8k2026.05 | 0.5999 | |
| Unified 15B MoEPretraining Corpus=4k→8k2026.05 | 0.5996 | |
| Qwen3-1.7B-ALLMEMModel Size=1.7B, Architecture=ALLMEM, Sliding window length=2048, Attention sinks=128, Few-shot setting=5-shot, Max tokens=327682026.02 | 0.589 | |
| Qwen3-1.7BModel Size=1.7B, Architecture=Standard, Few-shot setting=5-shot, Max tokens=327682026.02 | 0.58 | |
| Unified 15B MoEPretraining Corpus=4k2026.05 | 0.5789 | |
| Teacher (Qwen3-0.6B)Role=Teacher, Model=Qwen3-0.6B, Evaluation Protocol=generation-based evaluation2026.03 | 0.429 | |
| Qwen3-0.6B-ALLMEMModel Size=0.6B, Architecture=ALLMEM, Sliding window length=2048, Attention sinks=128, Few-shot setting=5-shot, Max tokens=327682026.02 | 0.422 | |
| Qwen3-0.6BModel Size=0.6B, Architecture=Standard, Few-shot setting=5-shot, Max tokens=327682026.02 | 0.406 | |
| Hybrid KDASequence Mixer=KDA, Attention Layers=7, Evaluation Protocol=generation-based evaluation2026.03 | 0.382 | |
| Hybrid MambaSequence Mixer=Mamba2, Attention Layers=7, Evaluation Protocol=generation-based evaluation2026.03 | 0.378 | |
| Pure KDASequence Mixer=KDA, Attention Layers=0, Evaluation Protocol=generation-based evaluation2026.03 | 0.262 | |
| Pure MambaSequence Mixer=Mamba2, Attention Layers=0, Evaluation Protocol=generation-based evaluation2026.03 | 0.179 |