Mathematical Reasoning on Math (FULL, CONCAT, RAW-SHARDED)
96.1Accuracy (FULL Mode)Qwen3-14B Base
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-14B BaseModel family=Qwen3, Model size=14B, Optimization method=Base2026.05 | 96.1 | 92.9 | 71.8 | |
| Qwen3-8B Forward-CCOPDModel family=Qwen3, Model size=8B, Optimization method=Forward-CCOPD2026.05 | 93.2 | 91.3 | 79 | |
| Qwen3-8B SFTModel family=Qwen3, Model size=8B, Optimization method=SFT2026.05 | 93.2 | 91.3 | 66 | |
| Qwen3-8B 14B-teacher CCOPDModel family=Qwen3, Model size=8B, Optimization method=CCOPD, Teacher source=14B-teacher2026.05 | 92.2 | 86.4 | 69.9 | |
| Qwen3-8B GRPOModel family=Qwen3, Model size=8B, Optimization method=GRPO2026.05 | 91.3 | 90.3 | 74.8 | |
| Qwen3-8B 4B-teacher CCOPDModel family=Qwen3, Model size=8B, Optimization method=CCOPD, Teacher source=4B-teacher2026.05 | 90.3 | 88.4 | 68 | |
| Qwen3-8B BaseModel family=Qwen3, Model size=8B, Optimization method=Base2026.05 | 90.3 | 87.4 | 66 | |
| Qwen3-8B CCOPDModel family=Qwen3, Model size=8B, Optimization method=CCOPD2026.05 | 90.3 | 88.4 | 82.5 | |
| Qwen3-4B BaseModel family=Qwen3, Model size=4B, Optimization method=Base2026.05 | 89.3 | 84.5 | 55.3 | |
| Qwen3-4B CCOPDModel family=Qwen3, Model size=4B, Optimization method=CCOPD2026.05 | 89.3 | 83.5 | 56.9 | |
| Qwen3-8B OPSDModel family=Qwen3, Model size=8B, Optimization method=OPSD2026.05 | 86 | 85 | 56.3 | |
| Llama3.1-8B CCOPDModel family=Llama3.1, Model size=8B, Optimization method=CCOPD2026.05 | 74.8 | 73.8 | 53.4 | |
| Llama3.1-8B BaseModel family=Llama3.1, Model size=8B, Optimization method=Base2026.05 | 71.8 | 70.9 | 46.6 |