Knowledge-intensive Reasoning on GPQA
38.89Result ScoreCPPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CPPOModel=Qwen 7B2026.04 | 38.89 | 35.35 | |
| StaRPOModel=Qwen 7B2026.04 | 38.38 | 37.88 | |
| λ–GRPOModel=Qwen 7B2026.04 | 37.88 | 34.85 | |
| GRPOModel=Qwen 7B2026.04 | 35.86 | 33.33 | |
| StaRPOModel=Qwen 1.5B2026.04 | 35.35 | 34.85 | |
| CPPOModel=Qwen 1.5B2026.04 | 34.85 | 28.79 | |
| λ–GRPOModel=Qwen 1.5B2026.04 | 33.33 | 30.81 | |
| EntropyModel=Qwen 7B2026.04 | 30.3 | 29.8 | |
| OriginalModel=Qwen 7B2026.04 | 28.79 | 26.77 | |
| PlannerModel=Qwen 7B2026.04 | 28.79 | 24.24 | |
| GRPOModel=Qwen 1.5B2026.04 | 26.77 | 23.23 | |
| EntropyModel=Qwen 1.5B2026.04 | 25.25 | 23.23 | |
| PlannerModel=Qwen 1.5B2026.04 | 22.73 | 19.7 | |
| OriginalModel=Qwen 1.5B2026.04 | 19.19 | 16.67 |