Code Generation on HumanEval (Correction Uplift %)
62.5Correction Uplift (%)ROSA
Evaluation Results
| Method | Links | |
|---|---|---|
| ROSAModel=Qwen3-8B2025.09 | 62.5 | |
| BaselineModel=Qwen3-8B2025.09 | 47.83 | |
| ROSAModel=Qwen2.5-7B-Instruct2025.09 | 40 | |
| ROSAModel=DeepSeek-R1-Distill-Llama-8B2025.09 | 31.97 | |
| ROSAModel=Qwen3-0.6B2025.09 | 31.01 | |
| BaselineModel=Qwen2.5-7B-Instruct2025.09 | 28.57 | |
| ROSAModel=Qwen2.5-0.5B-Instruct2025.09 | 26.09 | |
| BaselineModel=Qwen3-0.6B2025.09 | 19.33 | |
| BaselineModel=DeepSeek-R1-Distill-Llama-8B2025.09 | 15.49 | |
| BaselineModel=Qwen2.5-0.5B-Instruct2025.09 | 14.39 |