General Language Model Evaluation on Aggregated 11-benchmark suite Math, Code, IF
74.9Average AccuracyQwen3-30B-A3B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen3-30B-A3BBase Model=Qwen3-30B-A3B2026.05 | 74.9 | 0 | — | — | — | |
| ZEDABase Model=Qwen3-30B-A3B2026.05 | 74.2 | 51.2 | — | — | — | |
| ZEDASFTBase Model=Qwen3-30B-A3B2026.05 | 73.3 | 51.5 | — | — | — | |
| NETSFT→OPDBase Model=Qwen3-30B-A3B2026.05 | 73 | 50 | — | — | — | |
| GLM-4.7-FlashBase Model=GLM-4.7-Flash2026.05 | 72.5 | 0 | — | — | — | |
| NETSFTBase Model=Qwen3-30B-A3B2026.05 | 72.3 | 50 | — | — | — | |
| ZEDABase Model=GLM-4.7-Flash2026.05 | 71.8 | 53 | — | — | — | |
| NETSFT→OPDBase Model=GLM-4.7-Flash2026.05 | 70.9 | 50 | — | — | — | |
| ZEDASFTBase Model=GLM-4.7-Flash2026.05 | 70.9 | 52.8 | — | — | — | |
| NETSFTBase Model=GLM-4.7-Flash2026.05 | 70.6 | 50 | — | — | — | |
| Dynamic SkippingBase Model=Qwen3-30B-A3B2026.05 | 68.1 | 43.8 | — | — | — | |
| Dynamic SkippingBase Model=GLM-4.7-Flash2026.05 | 67.8 | 37.5 | — | — | — | |
| AdaMoEBase Model=GLM-4.7-Flash2026.05 | 57.1 | 47 | — | — | — | |
| AdaMoEBase Model=Qwen3-30B-A3B2026.05 | 54.8 | 51.9 | — | — | — | |
| IXTTraining Dataset=Openthinker2026.05 | 50 | — | 55.5 | 43.1 | 41.8 | |
| NTPTraining Dataset=Openthinker2026.05 | 49.2 | — | 54 | 44 | 41.6 | |
| IXTTraining Dataset=SFT > 4k, Annotation Process=pairwise ann.2026.05 | 46.1 | — | 52.9 | 38.8 | 34.7 | |
| IXTTraining Dataset=SFT > 4k2026.05 | 45.4 | — | 52.9 | 37.6 | 33.4 | |
| NTPTraining Dataset=SFT > 4k2026.05 | 43.7 | — | 50.6 | 37.2 | 31.8 | |
| IXTTraining Dataset=General SFT2026.05 | 37.7 | — | 34.9 | 37.2 | 44.6 | |
| NTPTraining Dataset=General SFT2026.05 | 36.5 | — | 34.1 | 36.3 | 42 |