Code Generation on HumanEval+ (Acc. and Token Metrics)
92.2AccuracyLaTER (training)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LaTER (training)Backbone=Qwen3-14B2026.05 | 92.2 | 1,776 | |
| CoT BaselineBackbone=Qwen3-14B2026.05 | 90.8 | 2,427 | |
| LaTER (training-free)Backbone=Qwen3-14B2026.05 | 90.8 | 1,790 | |
| CoT-SFTBackbone=Qwen3-14B2026.05 | 90.2 | 2,071 |