Instruction Following on IFEval (IFEval Metric)
90.77IFEval ScoreGemma-3-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemma-3-InstructModel Size=12B2025.05 | 90.77 | |
| Qwen2.5-InstructModel Size=14B, GPU Hours=∼1.8M2025.05 | 85.01 | |
| Mistral-SmallModel Size=24B, GPU Hours=∼1.6M2025.05 | 82.25 | |
| InfiFPOModel Size=14B, GPU Hours=582025.05 | 82.25 | |
| SFT-DPOModel Size=14B, GPU Hours=502025.05 | 81.89 | |
| SFT-WRPOModel Size=14B, GPU Hours=572025.05 | 81.18 | |
| SFT-IPOModel Size=14B, GPU Hours=502025.05 | 80.94 | |
| InfiFPO*Model Size=14B, GPU Hours=55, Subset Source Models=true2025.05 | 80.46 | |
| SFTModel Size=14B, GPU Hours=152025.05 | 80.06 | |
| FuseChat*Model Size=14B, GPU Hours=650, Subset Source Models=true2025.05 | 78.9 | |
| FuseLLM*Model Size=14B, GPU Hours=225, Subset Source Models=true2025.05 | 78.56 | |
| Phi-4Model Size=14B, GPU Hours=∼1.0M2025.05 | 77.34 | |
| InfiFusion*Model Size=14B, GPU Hours=160, Subset Source Models=true2025.05 | 76.02 | |
| Qwen2.5-CoderModel Size=14B, GPU Hours=∼1.8M2025.05 | 74.7 | |
| Qwen2.5-MathModel Size=7B, GPU Hours=∼0.5M2025.05 | 35.49 |