Unit test generation on HumanEval+ (test)
1.27Error RateCVeDRL
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| CVeDRLScale=0.6B2026.01 | 1.27 | 12.79 | 85.94 | 97.53 | 2.41 | |
| GPT-4oScale=-2026.01 | 1.98 | 17.21 | 80.81 | 96.91 | 5.35 | |
| CodeRMScale=8.0B2026.01 | 2.44 | 64.73 | 32.83 | 96.97 | 7.15 | |
| GPT-3.5Scale=-2026.01 | 3.14 | 26.32 | 70.54 | 96.73 | 4.13 | |
| Qwen3Scale=32B2026.01 | 9.43 | 25.31 | 65.26 | 89.53 | 8.17 | |
| LLaMA3.1Scale=8.0B2026.01 | 10.88 | 37.19 | 51.93 | 94.6 | 3.97 | |
| Qwen3Scale=0.6B2026.01 | 20.7 | 44.82 | 34.48 | 73.19 | 4.38 |