Instruction Following on IFEval (test)
84.8IFEval ScoreSPOT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SPOTBackbone=Qwen3-8b2026.03 | 84.8 | — | — | — | |
| Qwen3-8bSampling=avg@52026.03 | 83 | — | — | — | |
| RFTBackbone=Qwen3-8b2026.03 | 81.5 | — | — | — | |
| Qwen3-Omni-InstructType=Omni, Size=30B-A3B2026.02 | 81.17 | — | — | — | |
| SFT+Backbone=Qwen3-8b2026.03 | 80 | — | — | — | |
| SFTBackbone=Qwen3-8b2026.03 | 79.6 | — | — | — | |
| Llama3.1-8b-InstructSampling=avg@52026.03 | 73.6 | — | — | — | |
| SPOTBackbone=Llama3.1-8b-Instruct2026.03 | 73.2 | — | — | — | |
| RFTBackbone=Llama3.1-8b-Instruct2026.03 | 71.2 | — | — | — | |
| SFT+Backbone=Llama3.1-8b-Instruct2026.03 | 68.6 | — | — | — | |
| DAPO (Mixed reward)Framework=Think-with-Rubrics, Stage=DAPO RL, Reward source=Mixed2026.05 | 65.61 | — | — | — | |
| DAPO (Golden rubrics reward only)Framework=Think-with-Rubrics, Stage=DAPO RL, Reward source=Golden rubrics2026.05 | 64.87 | — | — | — | |
| DAPO (Self-generated reward only)Framework=Think-with-Rubrics, Stage=DAPO RL, Reward source=Self-generated2026.05 | 64.69 | — | — | — | |
| DPO + General DataBase Model=Llama3.1-8B-Instruct, Alignment=DPO, Strategy=General Data2026.02 | 64.51 | — | — | — | |
| SFT + MergeBase Model=Llama3.1-8B-Instruct, Alignment=SFT, Strategy=Merge2026.02 | 63.96 | — | — | — | |
| SFT-DPO + OGPSABase Model=Qwen2.5-7B-Instruct, Alignment=SFT-DPO, Strategy=OGPSA2026.02 | 63.96 | — | — | — | |
| SFT + OGPSABase Model=Qwen2.5-7B-Instruct, Alignment=SFT, Strategy=OGPSA2026.02 | 63.03 | — | — | — | |
| SFTBackbone=Llama3.1-8b-Instruct2026.03 | 62.1 | — | — | — | |
| SFT Warm-upFramework=Think-with-Rubrics, Stage=SFT Warm-up2026.05 | 61 | — | — | — | |
| DAPO (Golden rubric reward)Framework=Rubric-as-Reward, Stage=DAPO RL, Mode=With think, Reward source=Golden rubric2026.05 | 59.7 | — | — | — | |
| DAPO (Golden rubric reward)Framework=Rubric-as-Reward, Stage=DAPO RL, Mode=Direct answer, Reward source=Golden rubric2026.05 | 58.96 | — | — | — | |
| SFT Warm-up (Direct answer)Framework=Rubric-as-Reward, Stage=SFT Warm-up, Mode=Direct answer2026.05 | 57.3 | — | — | — | |
| Order PolicyGeneration length=256, Block size=64, Decoding steps=2562026.06 | 56.33 | — | — | — | |
| Ming-Lite-Omni-1.5Type=Omni, Size=19B-A2.8B2026.02 | 53.68 | — | — | — | |
| Eureka-Audio-InstructType=Ours, Size=1.7B2026.02 | 53.21 | — | — | — | |
| FullBackbone=Llama3.1-8B, Training Dataset=WizardLM2026.04 | 53.01 | — | — | — | |
| SFT Warm-up (With think)Framework=Rubric-as-Reward, Stage=SFT Warm-up, Mode=With think2026.05 | 52.68 | — | — | — | |
| EntropyGeneration length=256, Block size=64, Decoding steps=2562026.06 | 52.67 | — | — | — | |
| MarginGeneration length=256, Block size=64, Decoding steps=2562026.06 | 52.33 | — | — | — | |
| SelectITBackbone=Llama3.1-8B, Training Dataset=WizardLM2026.04 | 52.11 | — | — | — | |
| wICIBackbone=Llama3.1-8B, Training Dataset=WizardLM2026.04 | 51.19 | — | — | — | |
| FullBackbone=Mistral-7B, Training Dataset=WizardLM2026.04 | 50.92 | — | — | — | |
| ConfidenceGeneration length=256, Block size=64, Decoding steps=2562026.06 | 50.67 | — | — | — | |
| NUGGETSBackbone=Llama3.1-8B, Training Dataset=WizardLM2026.04 | 50.53 | — | — | — | |
| Qwen3-8B-BaseStage=Base Model2026.05 | 50.28 | — | — | — | |
| IFDBackbone=Llama3.1-8B, Training Dataset=WizardLM2026.04 | 49.6 | — | — | — | |
| DEITABackbone=Llama3.1-8B, Training Dataset=WizardLM2026.04 | 49.05 | — | — | — | |
| FullBackbone=Llama3.1-8B, Training Dataset=Alpaca-GPT42026.04 | 48.83 | — | — | — | |
| IFDBackbone=Mistral-7B, Training Dataset=WizardLM2026.04 | 48.48 | — | — | — | |
| wICIBackbone=Mistral-7B, Training Dataset=WizardLM2026.04 | 48.43 | — | — | — | |
| NUGGETSBackbone=Mistral-7B, Training Dataset=WizardLM2026.04 | 48.15 | — | — | — | |
| DEITABackbone=Mistral-7B, Training Dataset=WizardLM2026.04 | 48.13 | — | — | — | |
| Kimi-Audio-7B-InstructType=Audio, Size=7B2026.02 | 47.91 | — | — | — | |
| SelectITBackbone=Mistral-7B, Training Dataset=WizardLM2026.04 | 47.75 | — | — | — | |
| AMA Reweightingoptimization_strategy=reweighting2025.05 | 44.55 | — | — | — | |
| AMA Resamplingoptimization_strategy=resampling2025.05 | 44.55 | — | — | — | |
| Standard Uniform2025.05 | 44.18 | — | — | — | |
| Step-Audio-2-miniType=Audio, Size=8B2026.02 | 43.54 | — | — | — | |
| UltraFeedback Specialist2025.05 | 42.51 | — | — | — | |
| wICIBackbone=Llama3.1-8B, Training Dataset=Alpaca-GPT42026.04 | 42.37 | — | — | — | |
| IFDBackbone=Llama3.1-8B, Training Dataset=Alpaca-GPT42026.04 | 42.31 | — | — | — | |
| FullBackbone=Mistral-7B, Training Dataset=Alpaca-GPT42026.04 | 41.74 | — | — | — | |
| MiniCPM-oType=Omni, Size=9B2026.02 | 41.72 | — | — | — | |
| Standard2025.05 | 41.22 | — | — | — | |
| Qwen2.5-Omni-7BType=Omni, Size=7B2026.02 | 39.84 | — | — | — | |
| Model Averaging2025.05 | 39.37 | — | — | — | |
| NUGGETSBackbone=Llama3.1-8B, Training Dataset=Alpaca-GPT42026.04 | 38.55 | — | — | — | |
| wICIBackbone=Mistral-7B, Training Dataset=Alpaca-GPT42026.04 | 38.35 | — | — | — | |
| DEITABackbone=Llama3.1-8B, Training Dataset=Alpaca-GPT42026.04 | 36.87 | — | — | — | |
| LLaMA-MoE-v22026.02 | 36 | — | — | — | |
| OLMoE-1B-7B2026.02 | 35.49 | — | — | — | |
| IMPARTModels=Chat&Code, Merge=TIES, Mask=IMPART2025.04 | 35.3 | — | — | — | |
| Zephyr-7b-sft-full2025.05 | 35.3 | — | — | — | |
| IFDBackbone=Mistral-7B, Training Dataset=Alpaca-GPT42026.04 | 35.19 | — | — | — | |
| SelectITBackbone=Llama3.1-8B, Training Dataset=Alpaca-GPT42026.04 | 34.11 | — | — | — | |
| DEITABackbone=Mistral-7B, Training Dataset=Alpaca-GPT42026.04 | 33.7 | — | — | — | |
| ChatModels=Chat, Merge=N/A, Mask=No2025.04 | 33.64 | — | — | — | |
| DAREModels=Chat&Code, Merge=TIES, Mask=DARE2025.04 | 33.64 | — | — | — | |
| ExpertWeaver-InstructInstruction-tuned=true2026.02 | 33.1 | — | — | — | |
| Qwen2.5-Omni-3BType=Omni, Size=3B2026.02 | 32.97 | — | — | — | |
| TIESModels=Chat&Code, Merge=TIES, Mask=No2025.04 | 32.9 | — | — | — | |
| NUGGETSBackbone=Mistral-7B, Training Dataset=Alpaca-GPT42026.04 | 32.8 | — | — | — | |
| SelectITBackbone=Mistral-7B, Training Dataset=Alpaca-GPT42026.04 | 32.77 | — | — | — | |
| Audio Flamingo 3Type=Audio, Size=8B2026.02 | 32.27 | — | — | — | |
| DAREModels=Chat&Math, Merge=TA, Mask=DARE2025.04 | 29.21 | — | — | — | |
| TAModels=Chat&Math, Merge=TA, Mask=No2025.04 | 29.02 | — | — | — | |
| SafeRLHF Specialist2025.05 | 29.02 | — | — | — | |
| Qwen3 8B2026.02 | 29 | — | — | — | |
| IMPARTModels=Chat&Math, Merge=TA, Mask=IMPART2025.04 | 28.84 | — | — | — | |
| LLaMA-MoE-3B-7B2026.02 | 28.1 | — | — | — | |
| Qwen2-AudioType=Audio, Size=7B2026.02 | 26.24 | — | — | — | |
| SE-KD + TopSmpselection ratio=20%2026.02 | 22 | — | — | — | |
| SE-KD2026.02 | 21.4 | — | — | — | |
| RS-KD2026.02 | 20.9 | — | — | — | |
| TopSmp + RS-KDselection ratio=20%2026.02 | 20.9 | — | — | — | |
| TopSmpselection ratio=20%2026.02 | 20.8 | — | — | — | |
| AT-KD2026.02 | 20.7 | — | — | — | |
| SE-KD3X2026.02 | 20.7 | — | — | — | |
| RandomSmpselection ratio=20%2026.02 | 20.6 | — | — | — | |
| Full KD2026.02 | 20.5 | — | — | — | |
| RandomPosselection ratio=20%2026.02 | 19.8 | — | — | — | |
| Qwen3 1.7B2026.02 | 19.4 | — | — | — | |
| Anchored LearningBackbone=Qwen2.5-3B-Instruct2026.05 | — | 65.2 | — | — | |
| BackboneBackbone=LLaMA2-Chat-13B, CRqt=12025.04 | — | 19.04 | — | — | |
| BackboneBackbone=LLaMA2-Chat-7B, CRqt=12025.04 | — | 20.52 | — | — | |
| BackboneBackbone=LLaMA3-Inst-8B, CRqt=12025.04 | — | 11.46 | — | — | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.05 | — | 39.8 | — | — | |
| BaselineModel=Qwen3-0.6B2026.02 | — | 62.46 | — | — | |
| BaselineModel=Qwen3-8B2026.02 | — | 77.35 | — | — | |
| Best Static BaselineTotal=541, Sampled=542026.04 | — | — | 62.48 | — |