Instruction Following on AlpacaEval 2 (val)
82Win RateAAD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AADTraining Dataset=Nectar, Comparison Baseline Method=Greedy SFT, Backbone Model=Llama 8B2025.09 | 82 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Greedy SFT, Backbone Model=Llama 3B2025.09 | 80 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Greedy SFT, Backbone Model=Llama 8B2025.09 | 79 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Bo2, Backbone Model=Llama 8B2025.09 | 78 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Greedy SFT, Backbone Model=Llama 3B2025.09 | 77 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Greedy DPO, Backbone Model=Llama 8B2025.09 | 77 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Bo2, Backbone Model=Qwen 4B2025.09 | 77 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Greedy SFT, Backbone Model=Qwen 4B2025.09 | 76 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Greedy DPO, Backbone Model=Llama 3B2025.09 | 76 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Greedy DPO, Backbone Model=Llama 3B2025.09 | 76 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Greedy DPO, Backbone Model=Llama 8B2025.09 | 76 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Bo2, Backbone Model=Llama 3B2025.09 | 76 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Greedy DPO, Backbone Model=Qwen 4B2025.09 | 75 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Bo2, Backbone Model=Llama 3B2025.09 | 75 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Greedy SFT, Backbone Model=Qwen 0.6B2025.09 | 74 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Greedy DPO, Backbone Model=Qwen 0.6B2025.09 | 73 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=Bo2, Backbone Model=Qwen 0.6B2025.09 | 73 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=EFT, Backbone Model=Llama 3B2025.09 | 73 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=EFT, Backbone Model=Llama 8B2025.09 | 73 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=EFT, Backbone Model=Qwen 4B2025.09 | 73 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Bo2, Backbone Model=Llama 8B2025.09 | 72 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=EFT, Backbone Model=Llama 3B2025.09 | 70 | — | |
| AADTraining Dataset=Skywork, Comparison Baseline Method=EFT, Backbone Model=Qwen 0.6B2025.09 | 65 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=EFT, Backbone Model=Llama 8B2025.09 | 63 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Greedy SFT, Backbone Model=Qwen 4B2025.09 | 61 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Greedy DPO, Backbone Model=Qwen 4B2025.09 | 54 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Greedy SFT, Backbone Model=Qwen 0.6B2025.09 | 52 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Bo2, Backbone Model=Qwen 4B2025.09 | 50 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=EFT, Backbone Model=Qwen 4B2025.09 | 50 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Bo2, Backbone Model=Qwen 0.6B2025.09 | 48 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=Greedy DPO, Backbone Model=Qwen 0.6B2025.09 | 44 | — | |
| AADTraining Dataset=Nectar, Comparison Baseline Method=EFT, Backbone Model=Qwen 0.6B2025.09 | 44 | — |