Code Reasoning on LiveCodeBench 1.0 (test)
47.2AccuracyA3PO
Evaluation Results
| Method | Links | |
|---|---|---|
| A3POModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 47.2 | |
| Lp-RegModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 44.7 | |
| W-REINFORCEModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 44.6 | |
| DAPO w/ Fork TokensModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 44.1 | |
| DAPOModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 43.2 | |
| GRPOModel=Deepseek-R1-Distill-Qwen-7B2025.12 | 42.5 | |
| A3POModel=Qwen3-8B-Base2025.12 | 33.8 | |
| DAPO w/ Fork TokensModel=Qwen3-8B-Base2025.12 | 31.2 | |
| Lp-RegModel=Qwen3-8B-Base2025.12 | 30.9 | |
| W-REINFORCEModel=Qwen3-8B-Base2025.12 | 30.4 | |
| DAPOModel=Qwen3-8B-Base2025.12 | 29.7 | |
| GRPOModel=Qwen3-8B-Base2025.12 | 29.4 | |
| A3POModel=Qwen2.5-7B-Math2025.12 | 16.4 | |
| DAPO w/ Fork TokensModel=Qwen2.5-7B-Math2025.12 | 14.3 | |
| W-REINFORCEModel=Qwen2.5-7B-Math2025.12 | 13.8 | |
| Lp-RegModel=Qwen2.5-7B-Math2025.12 | 13.8 | |
| DAPOModel=Qwen2.5-7B-Math2025.12 | 12.4 | |
| GRPOModel=Qwen2.5-7B-Math2025.12 | 11.6 |