Code Generation on HumanEval v1 (test)
86.6AccuracyPrefillShare
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PrefillShareBackbone=Qwen3-8B-Base, KV Sharing=Supported2026.02 | 86.6 | — | |
| Full-FTBackbone=Qwen3-8B-Base, KV Sharing=Not Supported2026.02 | 83.5 | — | |
| TIPSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 80.49 | — | |
| TA-OPDSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 79.88 | — | |
| TA-OPDSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 79.57 | — | |
| EntropySetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 79.27 | — | |
| Pure OPDSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 78.36 | — | |
| TA-OPD+Ent.Setting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 78.35 | — | |
| TA-OPD+Ent.Setting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 78.05 | — | |
| Pure OPDSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 78.05 | — | |
| TIPSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 78.05 | — | |
| BaseSetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 77.75 | — | |
| BaseSetting=Qwen3-14B -> Qwen3-4B, Supervised-token budget=10%2026.05 | 77.75 | — | |
| EntropySetting=Qwen3-8B (GRPO) -> Qwen3-4B, Supervised-token budget=10%2026.05 | 77.65 | — | |
| Qwen3-8B-BaseKV Sharing=Inherent2026.02 | 68.3 | — | |
| TA-OPDSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 66.77 | — | |
| BaseSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 64.63 | — | |
| TA-OPD+Ent.Setting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 62.81 | — | |
| TIPSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 62.5 | — | |
| Pure OPDSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 62.2 | — | |
| TA-OPD+Ent.Setting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 61.59 | — | |
| SFT-GTSFT Training Domain=Code SFT (Ling-Coder-SFT)2026.05 | 61.55 | — | |
| TA-OPDSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 60.98 | — | |
| BaseSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 60.97 | — | |
| TABOMSFT Training Domain=Code SFT (Ling-Coder-SFT)2026.05 | 60.36 | — | |
| EntropySetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 59.45 | — | |
| Pure OPDSetting=Qwen3-4B -> Qwen3-1.7B, Supervised-token budget=10%2026.05 | 59.15 | — | |
| TABOMSFT Training Domain=Math SFT (MixChain-Z-PRM12K)2026.05 | 58.54 | — | |
| TIPSetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 58.54 | — | |
| SFT-SDSFT Training Domain=Math SFT (MixChain-Z-PRM12K)2026.05 | 57.92 | — | |
| EntropySetting=DeepSeek-R1-Distill-Qwen-14B -> Qwen2.5-3B, Supervised-token budget=10%2026.05 | 54.88 | — | |
| SFT-SDSFT Training Domain=Code SFT (Ling-Coder-SFT)2026.05 | 53.66 | — | |
| No-SFTSFT Training Domain=None (Base Model)2026.05 | 52.66 | — | |
| PrefillShareBackbone=LLaMA3.1-8B, KV Sharing=Supported2026.02 | 48.8 | — | |
| Full-FTBackbone=LLaMA3.1-8B, KV Sharing=Not Supported2026.02 | 48.2 | — | |
| SFT-GTSFT Training Domain=Math SFT (MixChain-Z-PRM12K)2026.05 | 46.34 | — | |
| LLaMA3.1-8BKV Sharing=Inherent2026.02 | 36.6 | — | |
| Forward KLFamily=KL Divergence Family2026.05 | — | 38.41 | |
| Forward KL + OursFamily=KL Divergence Family, Strategy=Bridge-Garden2026.05 | — | 41.46 | |
| Hard KDTeacher=DeepSeek-Coder-6.7B, Student=DeepSeek-Coder-1.3B, Category=Reference & Baselines2026.05 | — | 35.37 | |
| Reverse KLFamily=KL Divergence Family2026.05 | — | 39.02 | |
| Reverse KL + OursFamily=KL Divergence Family, Strategy=Bridge-Garden2026.05 | — | 37.8 | |
| Skew FKLFamily=Distance & Skewed Family2026.05 | — | 42.07 | |
| Skew FKL + OursFamily=Distance & Skewed Family, Strategy=Bridge-Garden2026.05 | — | 42.41 | |
| Skew RKLFamily=Distance & Skewed Family2026.05 | — | 42.07 | |
| Skew RKL + OursFamily=Distance & Skewed Family, Strategy=Bridge-Garden2026.05 | — | 41.24 | |
| Student (No Distill)Model=DeepSeek-Coder-1.3B, Category=Reference & Baselines2026.05 | — | 33.54 | |
| TeacherModel=DeepSeek-Coder-6.7B, Category=Reference & Baselines2026.05 | — | 76.83 | |
| Total VariationFamily=Distance & Skewed Family2026.05 | — | 39.63 | |
| Total Variation + OursFamily=Distance & Skewed Family, Strategy=Bridge-Garden2026.05 | — | 40.02 | |
| α-β divergenceFamily=Unified Divergence Family2026.05 | — | 41.46 | |
| α-β divergence + OursFamily=Unified Divergence Family, Strategy=Bridge-Garden2026.05 | — | 43.9 |