Structured Reasoning (Code/SQL) on Structured OOD
92.1Full AccuracyQwen3-14B Base
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-14B BaseModel size=14B, Optimization method=Base2026.05 | 92.1 | 83.2 | 52.6 | |
| Qwen3-8B OPSDModel size=8B, Optimization method=OPSD2026.05 | 87.8 | 77.9 | 54.8 | |
| Qwen3-8B SFTModel size=8B, Optimization method=SFT2026.05 | 86.9 | 76.9 | 64.4 | |
| Qwen3-8B GRPOModel size=8B, Optimization method=GRPO2026.05 | 86.9 | 84 | 45.8 | |
| Qwen3-8B CCOPDModel size=8B, Optimization method=CCOPD2026.05 | 86.2 | 77.9 | 67.9 | |
| Qwen3-8B 4B-teacher CCOPDModel size=8B, Optimization method=CCOPD, Teacher source=4B-teacher2026.05 | 85.6 | 78.8 | 67.6 | |
| Qwen3-8B BaseModel size=8B, Optimization method=Base2026.05 | 85.3 | 78.8 | 48.7 | |
| Qwen3-8B Forward-CCOPDModel size=8B, Optimization method=Forward-CCOPD2026.05 | 84.6 | 76 | 65.4 | |
| Qwen3-8B 14B-teacher CCOPDModel size=8B, Optimization method=CCOPD, Teacher source=14B-teacher2026.05 | 84.6 | 78.2 | 66.3 | |
| Qwen3-4B CCOPDModel size=4B, Optimization method=CCOPD2026.05 | 83.7 | 76 | 63.8 | |
| Qwen3-4B BaseModel size=4B, Optimization method=Base2026.05 | 80.1 | 74 | 41 | |
| Llama3.1-8B BaseModel size=8B, Optimization method=Base2026.05 | 67.6 | 63.7 | 37.5 | |
| Llama3.1-8B CCOPDModel size=8B, Optimization method=CCOPD2026.05 | 67.3 | 64.1 | 52.7 |