Code Generation on HumanEval+ (Pass@1, Avg, ΔScore)
88.3Pass@1Uni-OPD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Uni-OPDDistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 88.3 | — | — | |
| Uni-OPDDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 88 | — | — | |
| ExOPDDistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 86.9 | — | — | |
| ExPODistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 86.7 | — | — | |
| SFTDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 86.4 | — | — | |
| OPDDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 86.3 | — | — | |
| ExOPDDistillation Scenario=Multi-Teacher Distillation, Model Scale=4B2026.05 | 86.3 | — | — | |
| TeacherTraining Strategy=RL2026.05 | 85.2 | — | — | |
| ExPODistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 84.8 | — | — | |
| OPDDistillation Scenario=Single-Teacher Distillation, Model Scale=4B2026.05 | 82.6 | — | — | |
| TraceLiftModel=Qwen3-4B2026.05 | 78.66 | — | — | |
| StudentModel Scale=4B2026.05 | 77.4 | — | — | |
| Exec-onlyModel=Qwen3-4B2026.05 | 76.83 | — | — | |
| BaseModel=Qwen3-4B2026.05 | 75.61 | — | — | |
| AZRBackbone=Qwen3-4B2026.05 | 75 | — | — | |
| COSEBackbone=Qwen3-4B2026.05 | 73.8 | — | — | |
| R-ZeroBackbone=Qwen3-4B2026.05 | 73.2 | — | — | |
| BaseBackbone=Qwen3-4B2026.05 | 73.17 | — | — | |
| R1-OracleBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=100% GT2026.03 | 71.79 | 79.12 | 0 | |
| R1-pBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=20% GT2026.03 | 64.1 | 75.67 | -3.45 | |
| TraceLiftModel=Qwen2.5-7B2026.05 | 64.02 | — | — | |
| Exec-onlyModel=Qwen2.5-7B2026.05 | 61.59 | — | — | |
| MemRewardBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=20% GT + GNN2026.03 | 61.54 | 77.02 | -2.1 | |
| BaseModel=Qwen2.5-7B2026.05 | 60.37 | — | — | |
| R1-OracleBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=100% GT2026.03 | 53.85 | 70.47 | 0 | |
| AZRBackbone=Llama-3.2-3B-Instruct2026.05 | 52.4 | — | — | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.05 | 50.61 | — | — | |
| R-ZeroBackbone=Llama-3.2-3B-Instruct2026.05 | 50.6 | — | — | |
| COSEBackbone=Llama-3.2-3B-Instruct2026.05 | 49.4 | — | — | |
| MemRewardBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=20% GT + GNN2026.03 | 43.59 | 68.1 | -2.37 | |
| R1-pBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=20% GT2026.03 | 38.46 | 62.72 | -7.75 | |
| TraceLiftModel=Llama3.1-8B2026.05 | 32.93 | — | — | |
| Exec-onlyModel=Llama3.1-8B2026.05 | 31.1 | — | — | |
| BaseModel=Llama3.1-8B2026.05 | 29.88 | — | — | |
| ckpt_-1SFT Status=Pre-SFT, Few-shot settings=0-shot2026.05 | — | 68.29 | — | |
| ckpt_-1SFT Status=Pre-SFT, Few-shot settings=3-shot2026.05 | — | 0.61 | — | |
| MONAOptimizer=MONA, SFT Status=Post-SFT, Few-shot settings=0-shot2026.05 | — | 88.41 | — | |
| MONAOptimizer=MONA, SFT Status=Post-SFT, Few-shot settings=3-shot2026.05 | — | 86.59 | — | |
| MuonOptimizer=Muon, SFT Status=Post-SFT, Few-shot settings=0-shot2026.05 | — | 87.2 | — | |
| MuonOptimizer=Muon, SFT Status=Post-SFT, Few-shot settings=3-shot2026.05 | — | 85.98 | — |