Instruction Following on IFBench-P
17.4AccuracyCE-GPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 17.4 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 17.4 | |
| DS-R1-Distill-Qwen-7BBase Model=DS-R1-Distill-Qwen-7B2025.09 | 16.8 | |
| GRPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=GRPO2025.09 | 16.6 | |
| DAPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=DAPO2025.09 | 16.5 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 13.8 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 13.7 | |
| DAPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=DAPO2025.09 | 12.8 | |
| GRPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=GRPO2025.09 | 12.2 | |
| DS-R1-Distill-Qwen-1.5BBase Model=DS-R1-Distill-Qwen-1.5B2025.09 | 12 |