Code Generation on HumanEval+, MBPP+ v1.0 (test)
88.41HumanEval+ AccuracyQwen3-8B w/ OPSD+ReNIO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-8B w/ OPSD+ReNIOBase Model=Qwen3-8B, Training Strategy=OPSD+ReNIO2026.06 | 88.41 | 77.31 | 82.86 | |
| Qwen3-8B w/ GRPOBase Model=Qwen3-8B, Training Strategy=GRPO2026.06 | 87.2 | 78.51 | 82.86 | |
| Qwen3-4B w/ OPSD+ReNIOBase Model=Qwen3-4B, Training Strategy=OPSD+ReNIO2026.06 | 87.04 | 78.31 | 82.68 | |
| Qwen3-4BBase Model=Qwen3-4B, Training Strategy=Base2026.06 | 86.74 | 77.31 | 82.03 | |
| Qwen3-8B w/ OPSDBase Model=Qwen3-8B, Training Strategy=OPSD2026.06 | 86.59 | 77.05 | 81.82 | |
| Qwen3-4B w/ OPSDBase Model=Qwen3-4B, Training Strategy=OPSD2026.06 | 86.43 | 77.78 | 82.11 | |
| Qwen3-4B w/ GRPOBase Model=Qwen3-4B, Training Strategy=GRPO2026.06 | 86.28 | 77.78 | 82.03 | |
| Qwen3-8BBase Model=Qwen3-8B, Training Strategy=Base2026.06 | 85.52 | 77.84 | 81.68 | |
| Qwen3-1.7B w/ OPSD+ReNIOBase Model=Qwen3-1.7B, Training Strategy=OPSD+ReNIO2026.06 | 77.9 | 63.16 | 70.53 | |
| Qwen3-1.7B w/ OPSDBase Model=Qwen3-1.7B, Training Strategy=OPSD2026.06 | 74.85 | 62.43 | 68.64 | |
| R1-Distill-Qwen-7B w/ OPSD+ReNIOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Strategy=OPSD+ReNIO2026.06 | 74.85 | 59.39 | 67.12 | |
| Qwen3-1.7B w/ GRPOBase Model=Qwen3-1.7B, Training Strategy=GRPO2026.06 | 74.84 | 65.87 | 70.36 | |
| R1-Distill-Qwen-7B w/ GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Strategy=GRPO2026.06 | 74.7 | 58.27 | 66.49 | |
| R1-Distill-Qwen-7B w/ OPSDBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Strategy=OPSD2026.06 | 73.93 | 59.26 | 66.6 | |
| Qwen3-1.7BBase Model=Qwen3-1.7B, Training Strategy=Base2026.06 | 73.63 | 57.21 | 65.42 | |
| R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Strategy=Base2026.06 | 73.17 | 58.73 | 65.95 | |
| R1-Distill-Qwen-1.5B w/ OPSDBase Model=DeepSeek-R1-Distill-Qwen-1.5B, Training Strategy=OPSD2026.06 | 50.46 | 40.87 | 45.67 | |
| R1-Distill-Qwen-1.5B w/ OPSD+ReNIOBase Model=DeepSeek-R1-Distill-Qwen-1.5B, Training Strategy=OPSD+ReNIO2026.06 | 50.3 | 42.13 | 46.22 | |
| R1-Distill-Qwen-1.5B w/ GRPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B, Training Strategy=GRPO2026.06 | 49.24 | 41.47 | 45.36 | |
| R1-Distill-Qwen-1.5BBase Model=DeepSeek-R1-Distill-Qwen-1.5B, Training Strategy=Base2026.06 | 49.09 | 41.07 | 45.08 |