Code Reasoning on LCB v6
53.6AccuracyCE-GPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 53.6 | |
| DAPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=DAPO2025.09 | 52.2 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 52.2 | |
| GRPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=GRPO2025.09 | 49.2 | |
| DS-R1-Distill-Qwen-7BBase Model=DS-R1-Distill-Qwen-7B2025.09 | 49 | |
| MCPO-DAPOBackbone=Qwen3-8B2026.05 | 37.53 | |
| MCPO-GRPOBackbone=Qwen3-8B2026.05 | 34.29 | |
| MCPO-DAPOBackbone=Qwen3-4B2026.05 | 32.71 | |
| MGSBackbone=Qwen3-8B2026.05 | 32.63 | |
| MT-GRPOBackbone=Qwen3-8B2026.05 | 32.18 | |
| DAPOBackbone=Qwen3-8B2026.05 | 31.73 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 31.7 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 31.1 | |
| MCPO-GRPOBackbone=Qwen3-4B2026.05 | 30.77 | |
| CLIPOBackbone=Qwen3-8B2026.05 | 30.64 | |
| DAPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=DAPO2025.09 | 30.5 | |
| GRPOBackbone=Qwen3-8B2026.05 | 30.41 | |
| MGSBackbone=Qwen3-4B2026.05 | 28.53 | |
| MT-GRPOBackbone=Qwen3-4B2026.05 | 28.34 | |
| DAPOBackbone=Qwen3-4B2026.05 | 27.93 | |
| GRPOBackbone=Qwen3-4B2026.05 | 27.91 | |
| CLIPOBackbone=Qwen3-4B2026.05 | 27.25 | |
| GRPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=GRPO2025.09 | 27.1 | |
| DS-R1-Distill-Qwen-1.5BBase Model=DS-R1-Distill-Qwen-1.5B2025.09 | 25.1 | |
| Base ModelBackbone=Qwen3-8B2026.05 | 21.68 | |
| Base ModelBackbone=Qwen3-4B2026.05 | 19.54 |