ResearchBenchmarksOpen-ended Instruction Following on AlpacaEval GPT-5.2-judged (test)Follow64.4Win RateHybrid KD57.22459.08760.9562.813May 25, 2026Evaluation ResultsMethodMethodLinksWin RateHybrid KDSetting=AlpacaEval (Qw...Setting=AlpacaEval (Qwen2.5-7B→3B)2026.0564.4Soft KDSetting=AlpacaEval (Qw...Setting=AlpacaEval (Qwen2.5-7B→3B)2026.0561.3Hard KDSetting=AlpacaEval (Qw...Setting=AlpacaEval (Qwen2.5-7B→3B)2026.0557.5