General Knowledge Assessment on C-Eval
92.5AccuracyKimi-K2 Base
Evaluation Results
| Method | Links | |
|---|---|---|
| Kimi-K2 Base# Shots=5-shot, # Activated Params=32B, # Total Params=1043B2026.01 | 92.5 | |
| Qwen3.5-35B-A3B#Token=8002026.04 | 91.5 | |
| DeepSeek-V3.2 Exp Base# Shots=5-shot, # Activated Params=37B, # Total Params=671B2026.01 | 91 | |
| DeepSeek-V3.1 Base# Shots=5-shot, # Activated Params=37B, # Total Params=671B2026.01 | 90 | |
| Qwen3-Next-80B-A3B#Token=7002026.04 | 89.2 | |
| JoyAI-LLM Flash#Token=6002026.04 | 88.7 | |
| MiMo-V2-Flash Base# Shots=5-shot, # Activated Params=15B, # Total Params=309B2026.01 | 87.9 | |
| Qwen3-30B-A3B#Token=8002026.04 | 87.8 | |
| AUTOIF (Qwen2-72B-Instruct w/ Online DPO)Backbone Model=Qwen2-72B-Instruct, Supervision Model=Qwen2-72B, Alignment Strategy=Self-Alignment, Training Method=Online DPO2024.06 | 84.9 | |
| Qwen2-72B-InstructBackbone Model=Qwen2-72B-Instruct2024.06 | 83.8 | |
| PreBackbone=Qwen2.5-7B Instruct2025.12 | 79.5 | |
| MMKEBackbone=Qwen2.5-7B Instruct, Consolidation=false2025.12 | 79.3 | |
| MMKE+Con.Backbone=Qwen2.5-7B Instruct, Consolidation=true2025.12 | 78.8 | |
| Qwen-1.5 14BModel Type=Teacher2024.07 | 78.68 | |
| EtConBackbone=Qwen2.5-7B Instruct2025.12 | 78.5 | |
| FT-M+Con.Backbone=Qwen2.5-7B Instruct, Consolidation=true2025.12 | 77 | |
| GLM-4.7-Flash-T#Token=122002026.04 | 77 | |
| AUTOIF (Qwen2-7B Online DPO)Backbone Model=Qwen2-7B, Supervision Model=Qwen2-72B, Alignment Strategy=Strong-to-Weak, Training Method=Online DPO2024.06 | 76 | |
| FT-MBackbone=Qwen2.5-7B Instruct, Consolidation=false2025.12 | 75.9 | |
| AUTOIF (Qwen2-7B Offline DPO)Backbone Model=Qwen2-7B, Supervision Model=Qwen2-72B, Alignment Strategy=Strong-to-Weak, Training Method=Offline DPO2024.06 | 75.1 | |
| Qwen2-7BBackbone Model=Qwen2-7B2024.06 | 74.4 | |
| AUTOIF (Qwen2-7B-SFT)Backbone Model=Qwen2-7B, Supervision Model=Qwen2-72B, Alignment Strategy=Strong-to-Weak, Training Method=SFT2024.06 | 73.9 | |
| Qwen2-7B(ShareGPT)Backbone Model=Qwen2-7B2024.06 | 70.2 | |
| DDKTeacher Model=Qwen-1.5 14B, Student Model=Qwen-1.5 4B2024.07 | 68.57 | |
| KDTeacher Model=Qwen-1.5 14B, Student Model=Qwen-1.5 4B2024.07 | 68.35 | |
| MiniLLMTeacher Model=Qwen-1.5 14B, Student Model=Qwen-1.5 4B2024.07 | 68.2 | |
| CPTTeacher Model=Qwen-1.5 14B, Student Model=Qwen-1.5 4B2024.07 | 68.05 | |
| Qwen-1.5 4BModel Type=Student2024.07 | 67.6 | |
| Engram-40BShots=5-shot2026.01 | 63.3 | |
| Engram-27BShots=5-shot2026.01 | 62.7 | |
| AUTOIF (LLaMA-3-70B w/ Online DPO)Backbone Model=LLaMA3-70B-Instruct, Supervision Model=LLaMA3-70B, Alignment Strategy=Self-Alignment, Training Method=Online DPO2024.06 | 61.6 | |
| LLaMA3-70B-InstructBackbone Model=LLaMA3-70B-Instruct2024.06 | 60.2 | |
| MoE-27BShots=5-shot2026.01 | 58 | |
| HY-1.8B-FP16Model Scale=1.8B, Precision=FP16, Instruction-tuned=true2026.02 | 54.27 | |
| HY-1.8B-INT4Model Scale=1.8B, Precision=INT4, Instruction-tuned=true2026.02 | 48.67 | |
| HY-1.8B-2BitModel Scale=1.8B, Precision=2Bit, Instruction-tuned=true2026.02 | 47.6 | |
| Dense-4BShots=5-shot2026.01 | 46.9 | |
| Mistral-7BBackbone Model=Mistral-7B2024.06 | 38.2 | |
| AUTOIF (LLaMA3-8B Online DPO)Backbone Model=LLaMA3-8B, Supervision Model=LLaMA3-70B, Alignment Strategy=Strong-to-Weak, Training Method=Online DPO2024.06 | 38.2 | |
| AUTOIF (LLaMA3-8B Offline DPO)Backbone Model=LLaMA3-8B, Supervision Model=LLaMA3-70B, Alignment Strategy=Strong-to-Weak, Training Method=Offline DPO2024.06 | 36.2 | |
| HY-0.5B-FP16Model Scale=0.5B, Precision=FP16, Instruction-tuned=true2026.02 | 35.98 | |
| LLaMA3-8B(ShareGPT)Backbone Model=LLaMA3-8B2024.06 | 35.2 | |
| AUTOIF (LLaMA3-8B-SFT)Backbone Model=LLaMA3-8B, Supervision Model=LLaMA3-70B, Alignment Strategy=Strong-to-Weak, Training Method=SFT2024.06 | 34.5 | |
| LLaMA3-8BBackbone Model=LLaMA3-8B2024.06 | 24.2 | |
| ALPHABackbone=Qwen2.5-7B Instruct, Consolidation=false2025.12 | 23 | |
| ALPHA+Con.Backbone=Qwen2.5-7B Instruct, Consolidation=true2025.12 | 23 |