Instruction Following on IFEval standard (test)
100Punctuation ScoreQwen-2.5-7B + SFT
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen-2.5-7B + SFTPrompt=Naive Prompt, Optimization=SFT2025.03 | 100 | 92.9 | 57.7 | 83.3 | 26.7 | 75 | 88.9 | 81.6 | 90.9 | 78.3 | |
| Qwen-2.5-7B + GAPOPrompt=Naive Prompt, Optimization=GAPO2025.03 | 100 | 95.2 | 57.7 | 83.3 | 46.7 | 75 | 100 | 92.1 | 100 | 83.9 | |
| Qwen-2.5-7B + PPOPrompt=Naive Prompt, Optimization=PPO2025.03 | 94.1 | 90.5 | 50 | 66.7 | 33.3 | 62.5 | 88.9 | 84.2 | 90.9 | 75.6 | |
| Qwen-2.5-7BPrompt=CoT, Base Model=Qwen-2.5-7B2025.03 | 23.5 | 78.6 | 53.8 | 33.3 | 13.3 | 62.5 | 66.7 | 57.9 | 100 | 57.8 | |
| Qwen-2.5-7BPrompt=Plan-N-Solve, Base Model=Qwen-2.5-7B2025.03 | 23.5 | 81 | 38.5 | 66.7 | 0 | 68.8 | 44.4 | 63.2 | 90.9 | 56.1 | |
| Qwen-2.5-7BPrompt=Naive Prompt, Base Model=Qwen-2.5-7B2025.03 | 17.6 | 88.1 | 42.3 | 66.7 | 20 | 62.5 | 66.7 | 52.6 | 90.9 | 57.8 | |
| Qwen-2.5-7B + DPOPrompt=Naive Prompt, Optimization=DPO2025.03 | 17.6 | 45.2 | 26.9 | 16.7 | 6.7 | 31.2 | 11.1 | 42.1 | 63.6 | 33.3 | |
| Qwen-2.5-7B + KTOPrompt=Naive Prompt, Optimization=KTO2025.03 | 11.8 | 71.4 | 38.5 | 50 | 6.7 | 50 | 44.4 | 76.3 | 100 | 54.4 | |
| Qwen-2.5-7B + SimPOPrompt=Naive Prompt, Optimization=SimPO2025.03 | 11.8 | 45.2 | 23.1 | 16.7 | 0 | 31.2 | 0 | 39.5 | 63.6 | 30.6 | |
| Qwen-2.5-7B + ORPOPrompt=Naive Prompt, Optimization=ORPO2025.03 | 5.9 | 40.5 | 34.6 | 33.3 | 20 | 25 | 33.3 | 55.3 | 9.1 | 33.9 |