Chinese General Knowledge Question Answering on C-Eval
91.82AccuracyDeepSeek-R1
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-R1Model Size=671B, Mode=Thinking2026.02 | 91.82 | |
| Qwen3Model Size=32B, Mode=Thinking2026.02 | 87.33 | |
| Qwen3Model Size=14B, Mode=Thinking2026.02 | 86.26 | |
| Qwen3Model Size=8B, Mode=Thinking2026.02 | 83.45 | |
| Qwen3Model Size=32B, Mode=No-Thinking2026.02 | 83.32 | |
| Teacher-30BInference Mode=thinking2026.06 | 83.28 | |
| MirrorModel Size=8B, Mode=Thinking2026.02 | 82.17 | |
| Teacher-8BInference Mode=thinking2026.06 | 81.73 | |
| Qwen3Model Size=14B, Mode=No-Thinking2026.02 | 81.04 | |
| GPT-4.1Mode=No-Thinking2026.02 | 77.97 | |
| Qwen3Model Size=8B, Mode=No-Thinking2026.02 | 77.91 | |
| MirrorModel Size=8B, Mode=No-Thinking2026.02 | 77.08 | |
| InternVL 3.0 2BNumber of Parameters=2B, Input Modality=Text-Only2026.03 | 73.12 | |
| OPD-T30BInference Mode=thinking2026.06 | 66.73 | |
| InternVL 3.5 2BNumber of Parameters=2B, Input Modality=Text-Only2026.03 | 63.66 | |
| Xuanwu VL-2BNumber of Parameters=2B, Input Modality=Text-Only2026.03 | 62.18 | |
| OPD-T8BInference Mode=thinking2026.06 | 59.9 | |
| RLInference Mode=thinking2026.06 | 49.79 | |
| Base (SFT ckpt)Inference Mode=thinking2026.06 | 31.12 |