General Instruction Following on Arena-Hard
22.1ScoreTAG-INSTRUCT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TAG-INSTRUCTBase Model=LLaMA3-8b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 22.1 | — | |
| CodecLMBase Model=LLaMA3-8b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 19.2 | — | |
| Evol-InstructBase Model=LLaMA3-8b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 16.8 | — | |
| Auto-Instruct-EvolBase Model=LLaMA3-8b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 16.8 | — | |
| Tree-InstructBase Model=LLaMA3-8b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 16.6 | — | |
| TAG-INSTRUCTBase Model=LLaMA3.2-3b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 12.9 | — | |
| Evol-InstructBase Model=LLaMA3.2-3b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 12.7 | — | |
| CodecLMBase Model=LLaMA3.2-3b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 12.7 | — | |
| Auto-Instruct-EvolBase Model=LLaMA3.2-3b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 10.8 | — | |
| Tree-InstructBase Model=LLaMA3.2-3b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 10.4 | — | |
| WizardLM-dataBase Model=LLaMA3-8b, Teacher Model=Ministral-Instruct-8b, #Convs=192K2025.05 | 4.5 | — | |
| WizardLM-dataBase Model=LLaMA3.2-3b, Teacher Model=Ministral-Instruct-8b, #Convs=192K2025.05 | 3.7 | — | |
| Alpaca-5kBase Model=LLaMA3-8b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 3.1 | — | |
| Alpaca-CleanBase Model=LLaMA3-8b, Teacher Model=Ministral-Instruct-8b, #Convs=52K2025.05 | 3 | — | |
| Alpaca-CleanBase Model=LLaMA3.2-3b, Teacher Model=Ministral-Instruct-8b, #Convs=52K2025.05 | 2.8 | — | |
| Alpaca-5kBase Model=LLaMA3.2-3b, Teacher Model=Ministral-Instruct-8b, #Convs=5K2025.05 | 2.6 | — | |
| Qwen3-235B-A22B-R-TAPArchitecture=MoE, Parameter Count=235B2026.03 | 0.971 | — | |
| Gemini2.5-Pro2026.03 | 0.964 | — | |
| Qwen3-235B-A22BArchitecture=MoE, Parameter Count=235B2026.03 | 0.956 | — | |
| Qwen3-32B-R-TAPArchitecture=Dense, Parameter Count=32B2026.03 | 0.956 | — | |
| AM-Thinking-v1-R-TAPArchitecture=Dense, Parameter Count=32B2026.03 | 0.943 | — | |
| Qwen3-32BArchitecture=Dense, Parameter Count=32B2026.03 | 0.938 | — | |
| DeepSeek-R1Architecture=MoE, Parameter Count=671B2026.03 | 0.932 | — | |
| AM-Thinking-v1Architecture=Dense, Parameter Count=32B2026.03 | 0.925 | — | |
| OpenAI-o1 (2024-12-17)2026.03 | 0.921 | — | |
| OpenAI-o3-mini (Medium)Configuration=Medium2026.03 | 0.89 | — | |
| Nemetron-Ultra-253BArchitecture=Dense, Parameter Count=256B2026.03 | 0.87 | — | |
| RefEvalBase Model=Qwen2.5-7B-SFT, Training Method=DPO from DSV3-Distill2026.02 | 0.741 | — | |
| ArmoRMBase Model=Qwen2.5-7B-SFT, Training Method=DPO from DSV3-Distill2026.02 | 0.722 | — | |
| RefFreeBase Model=Qwen2.5-7B-SFT, Training Method=DPO from DSV3-Distill2026.02 | 0.718 | — | |
| ROUGEBase Model=Qwen2.5-7B-SFT, Training Method=DPO from DSV3-Distill2026.02 | 0.674 | — | |
| BERTScoreBase Model=Qwen2.5-7B-SFT, Training Method=DPO from DSV3-Distill2026.02 | 0.645 | — | |
| RefEvalBase Model=Llama-3-8B-Instruct, Training Method=DPO from DSV3-Distill2026.02 | 0.587 | — | |
| ArmoRMBase Model=Llama-3-8B-Instruct, Training Method=DPO from DSV3-Distill2026.02 | 0.586 | — | |
| ArmoRM-BaseBase Model=Qwen2.5-7B-SFT2026.02 | 0.586 | — | |
| DSV3-DistillBase Model=Qwen2.5-7B-SFT2026.02 | 0.565 | — | |
| RefFreeBase Model=Llama-3-8B-Instruct, Training Method=DPO from DSV3-Distill2026.02 | 0.538 | — | |
| BERTScoreBase Model=Llama-3-8B-Instruct, Training Method=DPO from DSV3-Distill2026.02 | 0.53 | — | |
| ROUGEBase Model=Llama-3-8B-Instruct, Training Method=DPO from DSV3-Distill2026.02 | 0.521 | — | |
| GeniusTraining Data Source=Magpie, Training Sample Size=25K2025.04 | 0.5 | — | |
| GeniusTraining Data Source=OpenHermes, Training Sample Size=32K2025.04 | 0.5 | — | |
| DSV3-DistillBase Model=Llama-3-8B-Instruct2026.02 | 0.422 | — | |
| ArmoRM-BaseBase Model=Llama-3-8B-Instruct2026.02 | 0.404 | — | |
| LLaMA3.1-8B-Instruct2025.04 | 0.3031 | — | |
| BaseBase Model=Llama-3-8B-Instruct2026.02 | 0.271 | — | |
| BaseBase Model=Qwen2.5-7B-SFT2026.02 | 0.234 | — |