Instruction Following on AlpacaEval LC 2
80.9Win RateQwen 3 VL 32B Think
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen 3 VL 32B ThinkModel Family=Qwen 3, Parameter Count=32B, Thinking Capability=true2025.12 | 80.9 | |
| Olmo 3 Think (DPO)Training Stage=DPO, Model Family=Olmo 3, Parameter Count=32B, Thinking Capability=true2025.12 | 78.6 | |
| Qwen 3 32BModel Family=Qwen 3, Parameter Count=32B, Thinking Capability=false2025.12 | 75.6 | |
| Olmo 3 Think (Final 3.0)Training Stage=Final Think 3.0, Model Family=Olmo 3, Parameter Count=32B, Thinking Capability=true2025.12 | 74.2 | |
| Multi-DPOPModel=Qwen3-30B2025.10 | 69.7 | |
| Olmo 3 Think (SFT)Training Stage=SFT, Model Family=Olmo 3, Parameter Count=32B, Thinking Capability=true2025.12 | 69.1 | |
| Olmo 3.1 Think 32BTraining Stage=Final Think 3.1, Model Family=Olmo 3.1, Parameter Count=32B, Thinking Capability=true2025.12 | 69.1 | |
| GRPOModel=Qwen3-30B2025.10 | 68.9 | |
| DPOModel=Qwen3-30B2025.10 | 68.5 | |
| BaseModel=Qwen3-30B2025.10 | 67.4 | |
| SFTModel=Qwen3-30B2025.10 | 65.3 | |
| Multi-DPOPModel=GLM-4-9B2025.10 | 64.2 | |
| GRPOModel=GLM-4-9B2025.10 | 63.8 | |
| DPOModel=GLM-4-9B2025.10 | 63.5 | |
| BaseModel=GLM-4-9B2025.10 | 62.3 | |
| SFTModel=GLM-4-9B2025.10 | 60.7 | |
| Multi-DPOPModel=Qwen3-4B2025.10 | 58.4 | |
| GRPOModel=Qwen3-4B2025.10 | 57.5 | |
| DPOModel=Qwen3-4B2025.10 | 57.2 | |
| BaseModel=Qwen3-4B2025.10 | 56.2 | |
| SFTModel=Qwen3-4B2025.10 | 54.5 | |
| Qwen3-4B (Non-thinking)Variant=Non-thinking2026.05 | 53.5 | |
| Qwen3-4B-GRLO+RLVRMethod=GRLO+RLVR2026.05 | 51.1 | |
| Qwen3-4B-GRLOMethod=GRLO2026.05 | 45.8 | |
| Multi-DPOPModel=Gemma-3-4B2025.10 | 43.1 | |
| GRPOModel=Gemma-3-4B2025.10 | 42.8 | |
| DPOModel=Gemma-3-4B2025.10 | 42.5 | |
| BaseModel=Gemma-3-4B2025.10 | 41.2 | |
| SFTModel=Gemma-3-4B2025.10 | 39.8 | |
| PROSPER-JCBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 38.21 | |
| PROSPERBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 37.61 | |
| Multi-DPOPModel=Tulu-3.1-8B2025.10 | 36.9 | |
| DPOModel=Tulu-3.1-8B2025.10 | 36.7 | |
| GRPOModel=Tulu-3.1-8B2025.10 | 36.3 | |
| BaseModel=Tulu-3.1-8B2025.10 | 34.5 | |
| Llama3.2-3B-GRLO+RLVRBackbone=Llama3.2-3B, Training Strategy=GRLO+RLVR2026.05 | 33.9 | |
| PROSPER-VBBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 33.64 | |
| SFTModel=Tulu-3.1-8B2025.10 | 33.1 | |
| Llama3.2-3B-GRLOBackbone=Llama3.2-3B, Training Strategy=GRLO2026.05 | 31.5 | |
| General-Reasoner-4B2026.05 | 30.8 | |
| DS-R1 32BModel Family=DeepSeek-R1, Parameter Count=32B, Thinking Capability=true2025.12 | 26.2 | |
| Qwen2.5-7B-InstructModel Scale=7B, LLM Judge=gpt-5-mini2026.02 | 25.32 | |
| Llama3.2-3B-InstructBackbone=Llama3.2-3B, Training Strategy=Instruct2026.05 | 22.9 | |
| RLCFBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 17.24 | |
| Llama3.2-3B-SFTBackbone=Llama3.2-3B, Training Strategy=SFT2026.05 | 8.5 | |
| Llama3.2-3B-RLVRBackbone=Llama3.2-3B, Training Strategy=RLVR2026.05 | 8.1 | |
| Qwen3-4B-OpenSFTVariant=OpenSFT2026.05 | 7.6 | |
| Qwen3-4B-MathSFTVariant=MathSFT2026.05 | 7.3 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B2026.05 | 1.6 |