Multi-level multi-discipline evaluation on C-Eval
81.4AccuracyYi
Evaluation Results
| Method | Links | |
|---|---|---|
| YiSize=34B2024.03 | 81.4 | |
| QwenSize=14B2024.03 | 72.1 | |
| YiSize=6B2024.03 | 72 | |
| GPT-42024.03 | 69.9 | |
| Qwen2.5-1.5B#Params=1.5B/1.5B, #Tokens=18T2026.02 | 68.2 | |
| Qwen3-1.7B#Params=1.7B/1.7B, #Tokens=36T2026.02 | 65.2 | |
| SkyworkSize=13B2024.03 | 60.6 | |
| Baichuan-2Size=13B2024.03 | 59 | |
| InternLMSize=20B2024.03 | 58.8 | |
| FalconSize=180B2024.03 | 57.8 | |
| GPT-3.52024.03 | 52.5 | |
| Qwen2.5-0.5B#Params=0.5B/0.5B, #Tokens=18T2026.02 | 51 | |
| Qwen3-0.6B#Params=0.6B/0.6B, #Tokens=36T2026.02 | 50.4 | |
| Llama2Size=70B2024.03 | 50.1 | |
| SPES-9B#Params=3.1B/9B, #Tokens=400B2026.02 | 44.7 | |
| SmolLM2-1.7B#Params=1.7B/1.7B, #Tokens=11T2026.02 | 32.5 | |
| OLMoE-1B-7B#Params=1.3B/7B, #Tokens=5T2026.02 | 31.1 | |
| Llama3.2-1B#Params=1.1B/1.1B, #Tokens=9T2026.02 | 30.9 | |
| MobiLlama-1.3B#Params=1.3B/1.3B, #Tokens=1.3T2026.02 | 26.2 | |
| SPES-7B#Params=1.6B/7B, #Tokens=500B2026.02 | 26.2 | |
| TinyLlama-1.1B#Params=1.1B/1.1B, #Tokens=3T2026.02 | 26 | |
| SPES-2B#Params=0.8B/2.1B, #Tokens=500B2026.02 | 25 | |
| MoE++ 7B#Params=1.2B/7B, #Tokens=1T2026.02 | 23.6 | |
| OPT-1.3B#Params=1.3B/1.3B, #Tokens=180B2026.02 | 23 | |
| Pythia-1.4B#Params=1.4B/1.4B, #Tokens=300B2026.02 | 23 | |
| OPT-2.7B#Params=2.7B/2.7B, #Tokens=180B2026.02 | 23 | |
| Pythia-2.8B#Params=2.8B/2.8B, #Tokens=300B2026.02 | 22.9 | |
| MobiLlama-0.8B#Params=0.8B/0.8B, #Tokens=1.3T2026.02 | 22.7 |