Multi-task Language Understanding on CEval
91.21AccuracyQwen3 Model
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3 ModelParameters=235B-25072025.09 | 91.21 | |
| Base Model(Qwen3-8B-Base)Data Volume=–2026.05 | 82.5 | |
| ANDES (Ours)Data Volume=10k2026.05 | 82.4 | |
| DataflowData Volume=10k2026.05 | 82.1 | |
| InfininstructData Volume=10k2026.05 | 81.3 | |
| Qwen3 ModelParameters=8B2025.09 | 78.7 | |
| InfininstructData Volume=1M2026.05 | 77.9 | |
| Qwen3 ModelParameters=4B-25072025.09 | 76.76 | |
| Qwen2.5-Dense2MoELLM=Qwen2.5, Model=Ours, Activated Parameters=1.2 B2026.05 | 72.51 | |
| Qwen3 ModelParameters=32B2025.09 | 72.02 | |
| AAPAParameters=4B2025.09 | 70.45 | |
| Qwen2.5-DenseLLM=Qwen2.5, Model=Dense, Activated Parameters=1.5 B2026.05 | 68.72 | |
| Qwen3 ModelParameters=4B2025.09 | 62.62 | |
| Qwen3 ModelParameters=1.7B2025.09 | 58.02 | |
| DeepSeek Chat 7B# Shot=0-shot, Total Params=6.9B, Activated Params=6.9B, FLOPs per 4K Tokens=183.5T2024.01 | 44.7 | |
| FRAMEModel Size=3B, Training Tokens=1T2025.02 | 44 | |
| AAPAParameters=0.6B2025.09 | 41.38 | |
| Qwen3 ModelParameters=0.6B2025.09 | 41.14 | |
| DeepSeekMoE 16B# Shot=5-shot, # Total Params=16.4B, # Activated Params=2.8B, FLOPs per 4K Tokens=74.4T, # Training Tokens=2T2024.01 | 40.6 | |
| DeepSeek 67B (Dense)# Shot=5-shot2024.01 | 40.3 | |
| DeepSeekMoE Chat 16B# Shot=0-shot, Total Params=16.4B, Activated Params=2.8B, FLOPs per 4K Tokens=74.4T2024.01 | 40 | |
| Llama2-Dense2MoELLM=Llama2, Model=Ours, Activated Parameters=5.7 B2026.05 | 38.68 | |
| DeepSeekMoE 145B# Shot=5-shot2024.01 | 37.1 | |
| PDPCModel Size=3B, Training Tokens=1T2025.02 | 36.1 | |
| LLaMA2 SFT 7B# Shot=0-shot, Total Params=6.7B, Activated Params=6.7B, FLOPs per 4K Tokens=187.9T2024.01 | 35.1 | |
| LLaMA2 7B# Shot=5-shot, # Total Params=6.7B, # Activated Params=6.7B, FLOPs per 4K Tokens=187.9T, # Training Tokens=2T2024.01 | 33.9 | |
| DeepSeekMoE 142B (Half Activated)# Shot=5-shot2024.01 | 32.8 | |
| Llama2-DenseLLM=Llama2, Model=Dense, Activated Parameters=7.0 B2026.05 | 30.99 | |
| RandomModel Size=3B, Training Tokens=1T2025.02 | 27.2 | |
| GShard 137B# Shot=5-shot2024.01 | 26.2 | |
| Q3 -> Q1 -> Q4 -> Q2Model Size=3B, Training Tokens=1T, Curriculum Order=Q3 -> Q1 -> Q4 -> Q22025.02 | 25.5 |