Instruction Following on Arena Hard
98.11Win RateOpenAI/GPT-5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OpenAI/GPT-5Size=-2025.09 | 98.11 | — | — | |
| DeepSeek-V3Backbone=DeepSeek-V32026.02 | 94.9 | — | — | |
| DeepSeek-R1Architecture=MoE, Activated Params=37B, Total Params=671B2025.01 | 92.3 | — | — | |
| OpenAI-o1-mini2025.01 | 92 | — | — | |
| I-DPO + MaPPOModel=Qwen2.5-32B-Instruct2025.07 | 89.8 | — | — | |
| Qwen3-235B-itSize=235B2025.09 | 88.71 | — | — | |
| DPO + MaPPOModel=Qwen2.5-32B-Instruct2025.07 | 87.1 | — | — | |
| Llama-3.1-Nemotron-70B-InstructFeedback + Edit Protocol=true2025.03 | 87 | — | — | |
| Google/Gemini-2.5-ProSize=-2025.09 | 86.98 | — | — | |
| I-DPOModel=Qwen2.5-32B-Instruct2025.07 | 86 | — | — | |
| DeepSeek-V3Architecture=MoE, Activated Params=37B, Total Params=671B2025.01 | 85.5 | — | — | |
| Claude-3.5-Sonnet-10222025.01 | 85.2 | — | — | |
| Llama-3.1-Nemotron-70B-InstructFeedback + Edit Protocol=false2025.03 | 85 | — | — | |
| DPOModel=Qwen2.5-32B-Instruct2025.07 | 81.4 | — | — | |
| GPT-4o-05132025.01 | 80.4 | — | — | |
| GPT-4o-2024-05-132025.03 | 79.3 | — | — | |
| Claude-3-5-Sonnet-202406202025.03 | 79.2 | — | — | |
| Anthropic/Claude-Sonnet-4Size=-2025.09 | 77.58 | — | — | |
| Llama-3.3-70B-InstructFeedback + Edit Protocol=true2025.03 | 74.8 | — | — | |
| DPO w/ C2Backbone=Qwen3-8B, Reward Model=C22026.04 | 74.6 | — | — | |
| ITModel=Qwen2.5-32B-Instruct2025.07 | 74.2 | — | — | |
| RefEvalBackbone=Qwen2.5-7B2026.02 | 74.1 | — | — | |
| DPO w/ Reasoning RMBackbone=Qwen3-8B, Reward Model=Reasoning RM2026.04 | 71.8 | — | — | |
| Llama-3.1-Tulu-3-70B-DPOSize=70B2025.09 | 71.34 | — | — | |
| Base ModelBackbone=Qwen3-8B2026.04 | 70.1 | — | — | |
| Llama-3.1-405B-Instruct2025.03 | 69.3 | — | — | |
| Llama-3.3-70B-InstructFeedback + Edit Protocol=false2025.03 | 62.4 | — | — | |
| I-DPO +MaPPOBackbone=Qwen2.5-14B-Instruct2025.07 | 62.1 | — | — | |
| I-DPO + MaPPOModel=Qwen2.5-14B-Instruct2025.07 | 62.1 | — | — | |
| I-DPO + MaPPOModel=Qwen2.5-7B-Instruct2025.07 | 61.6 | — | — | |
| I-DPO + MaPPOModel=Qwen2.5-7B-Instruct2026.05 | 61.6 | — | — | |
| SimUAPOBackbone=Gemma-2-9B-Instruct2025.09 | 59.4 | — | — | |
| LLaMA-3.3-70B-itSize=70B2025.09 | 59.21 | — | — | |
| DPO + MaPPOModel=Qwen2.5-7B-Instruct2025.07 | 59.2 | — | — | |
| DPO + MaPPOModel=Qwen2.5-7B-Instruct2026.05 | 59.2 | — | — | |
| DPO + MaPPOModel=Qwen2.5-14B-Instruct2025.07 | 59.1 | — | — | |
| DPOBackbone=Gemma-2-9B-Instruct, Source=Meng et al. (2024)2025.09 | 58.9 | — | — | |
| UAPOBackbone=Gemma-2-9B-Instruct2025.09 | 58.8 | — | — | |
| RefEvalBackbone=Llama3-8B-Inst2026.02 | 58.7 | — | — | |
| DPOBackbone=Gemma-2-9B-Instruct2025.09 | 58.4 | — | — | |
| Qwen2.5-7B-InstBackbone=Qwen2.5-7B2026.02 | 58 | — | — | |
| R-DPOBackbone=Gemma-2-9B-Instruct2025.09 | 57.9 | — | — | |
| SimPOBackbone=Gemma-2-9B-Instruct, Source=Meng et al. (2024)2025.09 | 57.8 | — | — | |
| SimPOBackbone=Gemma-2-9B-Instruct2025.09 | 57.8 | — | — | |
| PPOBackbone=Qwen2.5-14B-Instruct, clip ratio=0.22025.07 | 57.5 | — | — | |
| GRPOBackbone=Qwen2.5-14B-Instruct, clip ratio=0.22025.07 | 56.9 | — | — | |
| Llama-3.1-70B-Instruct2025.03 | 55.7 | — | — | |
| CPOBackbone=Gemma-2-9B-Instruct2025.09 | 55.2 | — | — | |
| Ministral 3Model Size=14B2026.01 | 55.1 | — | — | |
| R-DPOReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 54.98 | — | — | |
| SimPOReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 54.94 | — | — | |
| I-DPOModel=Qwen2.5-14B-Instruct2025.07 | 54.5 | — | — | |
| Qwen2.5-7BModel size=7B2025.06 | 54.1 | — | — | |
| POPBackbone=Qwen-2.5-7B-Inst2026.04 | 54.09 | — | — | |
| DPOReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 53.98 | — | — | |
| KTOBackbone=Gemma-2-9B-Instruct2025.09 | 53.8 | — | — | |
| IPOBackbone=Gemma-2-9B-Instruct2025.09 | 53.5 | — | — | |
| Qwen3-VLModel Size=8B, Variant=Instruct2026.01 | 52.8 | — | — | |
| DPOModel=Qwen2.5-14B-Instruct2025.07 | 52.3 | — | — | |
| TD-MNPOSize=9B2025.09 | 52.26 | — | — | |
| CPOReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 52.07 | — | — | |
| AttentionPOReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 52.06 | — | — | |
| HT-MNPO (Athene-RM-8B)Size=9B2025.09 | 51.17 | — | — | |
| HT-MNPO (ArmoRM-Llama3)Size=9B2025.09 | 50.93 | — | — | |
| Ministral 3Model Size=8B2026.01 | 50.9 | — | — | |
| IPOReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 50.5 | — | — | |
| HT-MNPO (Skywork-Reward-V2)Size=9B2025.09 | 50.34 | — | — | |
| Qwen-2.5-7B-InstBackbone=Qwen-2.5-7B-Inst2026.04 | 50.17 | — | — | |
| AttentionPOReference Model (πref)=LLaMA-3-8B-Base-SFT2026.05 | 49.72 | — | — | |
| KTOReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 48.98 | — | — | |
| INPOSize=9B2025.09 | 48.03 | — | — | |
| SimPOReference Model (πref)=LLaMA-3-8B-Base-SFT2026.05 | 47.01 | — | — | |
| I-DPOModel=Qwen2.5-7B-Instruct2025.07 | 46.9 | — | — | |
| I-DPOModel=Qwen2.5-7B-Instruct2026.05 | 46.9 | — | — | |
| ORPOBackbone=Gemma-2-9B-Instruct2025.09 | 46.2 | — | — | |
| DPOSize=9B2025.09 | 45.63 | — | — | |
| DPOModel=Qwen2.5-7B-Instruct2025.07 | 45.5 | — | — | |
| DPOModel=Qwen2.5-7B-Instruct2026.05 | 45.5 | — | — | |
| SimPOSize=9B2025.09 | 45.04 | — | — | |
| SFT ModelSize=9B2025.09 | 44.97 | — | — | |
| ORPOReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 44.64 | — | — | |
| SPPOSize=9B2025.09 | 43.89 | — | — | |
| Qwen3-VLModel Size=4B, Variant=Instruct2026.01 | 43.8 | — | — | |
| Gemma3Model Size=12B, Variant=Instruct2026.01 | 43.6 | — | — | |
| ITModel=Qwen2.5-14B-Instruct2025.07 | 43.6 | — | — | |
| MATRIX-Gen-SFTBase model=Qwen-2.5-7B2024.10 | 43.2 | — | — | |
| ITModel=Qwen2.5-7B-Instruct2025.07 | 42.9 | — | — | |
| ITModel=Qwen2.5-7B-Instruct2026.05 | 42.9 | — | — | |
| SLiC-HFReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 42.76 | — | — | |
| Qwen3Model Size=14B, Variant=Non-Thinking2026.01 | 42.7 | — | — | |
| SFTBackbone=Gemma-2-9B-Instruct2025.09 | 42.1 | — | — | |
| RRHFReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 41.91 | — | — | |
| Train on DBackbone=Qwen-2.5-7B-Inst2026.04 | 41.3 | — | — | |
| Mixtral-8x22B-itSize=141B2025.09 | 40.98 | — | — | |
| LLaMA-3.1-8B-itSize=8B2025.09 | 39.16 | — | — | |
| DPOReference Model (πref)=LLaMA-3-8B-Base-SFT2026.05 | 38.54 | — | — | |
| Mutual-TaughtCategory=Our Methods, Iteration=22025.05 | 38.4 | — | 682 | |
| BaseReference Model (πref)=LLaMA-3-8B-Instruct2026.05 | 37.57 | — | — | |
| I-DPOModel=Qwen2.5-3B-Instruct2025.07 | 36.6 | — | — | |
| I-DPOModel=Qwen2.5-3B-Instruct2026.05 | 36.6 | — | — |