Instruction-following on IFEval (Detailed Accuracy Metrics)
82.81Loose Accuracy (Prompt-level)Teacher
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TeacherBackbone=Llama3.1-70B, Training Method=Supervised Fine-Tuning (SFT), Training Dataset=Full Tulu 32026.06 | 82.81 | — | — | — | |
| SFTBackbone=Llama3.1-8B, Training Method=Supervised Fine-Tuning (SFT), Training Dataset=Full Tulu 32026.06 | 69.5 | — | — | — | |
| GKDBackbone=Llama3.1-8B, Training Method=Two-stage KD strategy (GKD), Training Dataset=Full Tulu 32026.06 | 68.95 | — | — | — | |
| SeqKDBackbone=Llama3.1-8B, Training Method=Two-stage KD strategy (SeqKD), Training Dataset=Full Tulu 32026.06 | 63.59 | — | — | — | |
| TYPEWRITERLMPost-training=SEL.IN.2026.06 | 11.7 | 11.7 | 23.1 | 23.9 | |
| Talkie-1930-IT2026.06 | 9.2 | 9.2 | 19.5 | 19.7 | |
| GPT-19002026.06 | 7.9 | 9.1 | 19.3 | 17.5 | |
| TYPEWRITERLMPost-training=LIMA2026.06 | 5.9 | 7 | 15.7 | 14.6 |