Instruction Following on IFEval + IFBench + InfoBench Aggregate (test)
57.88Average ScoreDAPO (Mixed reward)
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPO (Mixed reward)Framework=Think-with-Rubrics, Stage=DAPO RL, Reward source=Mixed2026.05 | 57.88 | |
| DAPO (Self-generated reward only)Framework=Think-with-Rubrics, Stage=DAPO RL, Reward source=Self-generated2026.05 | 57.17 | |
| DAPO (Golden rubrics reward only)Framework=Think-with-Rubrics, Stage=DAPO RL, Reward source=Golden rubrics2026.05 | 56.81 | |
| DAPO (Golden rubric reward)Framework=Rubric-as-Reward, Stage=DAPO RL, Mode=With think, Reward source=Golden rubric2026.05 | 54.01 | |
| DAPO (Golden rubric reward)Framework=Rubric-as-Reward, Stage=DAPO RL, Mode=Direct answer, Reward source=Golden rubric2026.05 | 53.94 | |
| SFT Warm-upFramework=Think-with-Rubrics, Stage=SFT Warm-up2026.05 | 53.22 | |
| SFT Warm-up (With think)Framework=Rubric-as-Reward, Stage=SFT Warm-up, Mode=With think2026.05 | 51.97 | |
| SFT Warm-up (Direct answer)Framework=Rubric-as-Reward, Stage=SFT Warm-up, Mode=Direct answer2026.05 | 51.2 | |
| Qwen3-8B-BaseStage=Base Model2026.05 | 46.23 |