Weighted aggregate evaluation on All task families
70.3Aggregate Score (All F/C)Qwen3-14B Base
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-14B BaseModel size=14B2026.05 | 70.3 | 39.5 | 44.8 | |
| Qwen3-8B GRPOModel size=8B, Optimization method=GRPO2026.05 | 66.4 | 35 | 41.6 | |
| Qwen3-8B BaseModel size=8B2026.05 | 64.4 | 36.8 | 41.6 | |
| Qwen3-8B SFTModel size=8B, Optimization method=SFT2026.05 | 64.3 | 46 | 49.3 | |
| Qwen3-8B CCOPDModel size=8B, Optimization method=CCOPD2026.05 | 64.2 | 49.7 | 55.1 | |
| Qwen3-8B 4B-teacher CCOPDModel size=8B, Optimization method=CCOPD, Teacher source=4B-teacher2026.05 | 64 | 48.8 | 51.9 | |
| Qwen3-8B OPSDModel size=8B, Optimization method=OPSD2026.05 | 64 | 39.8 | 42.5 | |
| Qwen3-8B 14B-teacher CCOPDModel size=8B, Optimization method=CCOPD, Teacher source=14B-teacher2026.05 | 63.9 | 47.8 | 51.4 | |
| Qwen3-8B Forward-CCOPDModel size=8B, Optimization method=Forward-CCOPD2026.05 | 63.6 | 47.2 | 52.4 | |
| Qwen3-4B CCOPDModel size=4B, Optimization method=CCOPD2026.05 | 60.6 | 44.9 | 46.9 | |
| Qwen3-4B BaseModel size=4B2026.05 | 60.2 | 29.1 | 33.4 | |
| Llama3.1-8B CCOPDModel size=8B, Optimization method=CCOPD2026.05 | 49.7 | 36.8 | 39.5 | |
| Llama3.1-8B BaseModel size=8B2026.05 | 49.3 | 27.6 | 30.8 |