Chinese Knowledge on CEval
82.16AccuracyQwen3.5-9B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3.5-9BShots=52026.04 | 82.16 | |
| Qwen3-14BShots=52026.04 | 81.78 | |
| Qwen3-8BShots=52026.04 | 78.59 | |
| XekRung-8BShots=52026.04 | 76.65 | |
| Qwen-1.5 7BRole=Teacher2024.07 | 74.1 | |
| Llama-3.3-70B-InstructShots=52026.04 | 69.96 | |
| SecGPT-14BShots=52026.04 | 67.51 | |
| DDKBase Model=Qwen-1.5 1.8B, Teacher=Qwen-1.5 7B2024.07 | 64.41 | |
| KDBase Model=Qwen-1.5 1.8B, Teacher=Qwen-1.5 7B2024.07 | 62.63 | |
| MiniLLMBase Model=Qwen-1.5 1.8B, Teacher=Qwen-1.5 7B2024.07 | 62.4 | |
| CPTBase Model=Qwen-1.5 1.8B, Teacher=Qwen-1.5 7B2024.07 | 60.13 | |
| Qwen-1.5 1.8BRole=Student2024.07 | 59.66 | |
| AdaMoESparsity Level=Mid Sparsity, Null=64, Avg. K=3.252026.05 | 57.28 | |
| BEAMSparsity Level=High Sparsity, beta=0.1, Avg. K=1.082026.05 | 56.15 | |
| Top-K ReducedSparsity Level=Mid Sparsity, K=4, Avg. K=4.002026.05 | 55.89 | |
| DeepSeekV2-LiteK=6, Avg. K=6.002026.05 | 55.26 | |
| MoE-DynamicSparsity Level=High Sparsity, phi=0.1, Avg. K=3.902026.05 | 55.1 | |
| AdaMoESparsity Level=High Sparsity, Null=128, Avg. K=2.112026.05 | 54.83 | |
| BEAMSparsity Level=Mid Sparsity, beta=0.01, Avg. K=2.612026.05 | 54.12 | |
| MoE-DynamicSparsity Level=Mid Sparsity, phi=0.3, Avg. K=4.312026.05 | 53.36 | |
| Top-K ReducedSparsity Level=High Sparsity, K=2, Avg. K=2.002026.05 | 53.35 | |
| Top-K PruningSparsity Level=Mid Sparsity, K=4, Avg. K=4.002026.05 | 53.25 | |
| Top-K PruningSparsity Level=High Sparsity, K=2, Avg. K=2.002026.05 | 51.06 | |
| BEAMSparsity Level=Extreme Sparsity, beta=1.0, Avg. K=0.482026.05 | 50.11 | |
| Top-K ReducedSparsity Level=Extreme Sparsity, K=1, Avg. K=1.002026.05 | 41.46 | |
| Llama-Primus-Reasoning-8BShots=52026.04 | 36.8 | |
| Llama-3.1-8B-InstructShots=52026.04 | 31.3 | |
| Foundation-Sec-8B-ReasoningShots=52026.04 | 11.6 |