Instruction Following on FollowBench
79HSRImpRIF-32B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ImpRIF-32BTraining Stage=SFT+RL2026.02 | 79 | 82.39 | — | — | |
| ImpRIF-32BTraining Stage=SFT2026.02 | 78.72 | 82.51 | — | — | |
| Qwen3-235B-A22BTraining Stage=Base2026.02 | 76.27 | 81.81 | — | — | |
| ImpRIF-8BTraining Stage=SFT+RL2026.02 | 74.94 | 81 | — | — | |
| ImpRIF-8BTraining Stage=SFT2026.02 | 74.77 | 80.33 | — | — | |
| ImpRIF-4BTraining Stage=SFT2026.02 | 72.7 | 78.93 | — | — | |
| ImpRIF-4BTraining Stage=SFT+RL2026.02 | 72.12 | 79.67 | — | — | |
| ImpRIF-32BTraining Stage=RL2026.02 | 71.73 | 78.64 | — | — | |
| Qwen3-32BTraining Stage=Base2026.02 | 71.58 | 78.58 | — | — | |
| Qwen2.5-72BReasoning Capability=Lacks inference reasoning capabilities2026.02 | 71.15 | 79.39 | — | — | |
| Qwen3-14BTraining Stage=Base2026.02 | 70.74 | 78.98 | — | — | |
| Ministral3-14BTraining Stage=Base2026.02 | 70.52 | 76.9 | — | — | |
| GPT-4oStage=-2026.05 | 70.4 | — | — | — | |
| ImpRIF-8BTraining Stage=RL2026.02 | 69.09 | 77.68 | — | — | |
| Claude-Opus-4.7Stage=-2026.05 | 68.9 | — | — | — | |
| Llama3.1-70BReasoning Capability=Lacks inference reasoning capabilities2026.02 | 67.94 | 79.62 | — | — | |
| Qwen3-8BTraining Stage=Base2026.02 | 67.89 | 77 | — | — | |
| MuSCBase Model=LLaMA-3-8B-Instruct, Setting=PreInst2025.02 | 66.9 | 75.11 | — | — | |
| MuSCBase Model=LLaMA-3-8B-Instruct, Setting=SelfInst2025.02 | 66.71 | 74.84 | — | — | |
| R1-0528-Qwen3-8BStage=Iter32026.05 | 66.2 | — | — | — | |
| Qwen3-4BTraining Stage=Base2026.02 | 65.56 | 74.6 | — | — | |
| R1-0528-Qwen3-8BStage=Iter22026.05 | 64.8 | — | — | — | |
| R1-0528-Qwen3-8BStage=Iter12026.05 | 64.7 | — | — | — | |
| ImpRIF-4BTraining Stage=RL2026.02 | 64.32 | 76.47 | — | — | |
| Self-Reward w/ BSMBase Model=LLaMA-3-8B-Instruct, Setting=SelfInst2025.02 | 64.3 | 73.84 | — | — | |
| Self-Reward w/ GPT-4Base Model=LLaMA-3-8B-Instruct, Setting=PreInst2025.02 | 64.02 | 73.26 | — | — | |
| Self-Reward w/ BSMBase Model=LLaMA-3-8B-Instruct, Setting=PreInst2025.02 | 63.96 | 73.78 | — | — | |
| ISHEEPBase Model=LLaMA-3-8B-Instruct, Setting=PreInst2025.02 | 63.54 | 73.21 | — | — | |
| ISHEEPBase Model=LLaMA-3-8B-Instruct, Setting=SelfInst2025.02 | 62.77 | 72.86 | — | — | |
| MuSCBase Model=Qwen2-7B-Instruct, Setting=PreInst2025.02 | 62.73 | 73.09 | — | — | |
| MuSCBase Model=Qwen2-7B-Instruct, Setting=SelfInst2025.02 | 62.6 | 72.57 | — | — | |
| LLaMA-3-8B-InstructBase Model=LLaMA-3-8B-Instruct, Setting=Baseline2025.02 | 62.39 | 73.07 | — | — | |
| QwQ-32BStage=-2026.05 | 62.2 | — | — | — | |
| Self-Reward w/ GPT-4Base Model=LLaMA-3-8B-Instruct, Setting=SelfInst2025.02 | 62.18 | 73.34 | — | — | |
| Self-RewardBase Model=LLaMA-3-8B-Instruct, Setting=SelfInst2025.02 | 61.2 | 72.22 | — | — | |
| Self-RewardBase Model=LLaMA-3-8B-Instruct, Setting=PreInst2025.02 | 60.88 | 72.17 | — | — | |
| R1-0528-Qwen3-8BStage=BASE2026.05 | 60.4 | — | — | — | |
| Self-CorrectBase Model=LLaMA-3-8B-Instruct, Setting=PreInst2025.02 | 60.11 | 70.94 | — | — | |
| Qwen2-7B-InstructBase Model=Qwen2-7B-Instruct, Setting=Baseline2025.02 | 59.81 | 71.69 | — | — | |
| Qwen2.5-7B-InstructStage=Iter32026.05 | 59 | — | — | — | |
| Self-Reward w/ BSMBase Model=Qwen2-7B-Instruct, Setting=PreInst2025.02 | 58.02 | 70.62 | — | — | |
| Self-Reward w/ BSMBase Model=Qwen2-7B-Instruct, Setting=SelfInst2025.02 | 57.83 | 70.53 | — | — | |
| Self-Supervised-7BStage=-2026.05 | 57.5 | — | — | — | |
| Llama-3.1-8B-InstructStage=Iter32026.05 | 57.3 | — | — | — | |
| ISHEEPBase Model=Qwen2-7B-Instruct, Setting=SelfInst2025.02 | 57.01 | 69.88 | — | — | |
| VERIF-8BStage=-2026.05 | 56.9 | — | — | — | |
| Llama-3.1-8B-InstructStage=Iter22026.05 | 56.9 | — | — | — | |
| Qwen2.5-7B-InstructStage=Iter22026.05 | 56.8 | — | — | — | |
| Llama-3.1-8B-InstructStage=Iter12026.05 | 56.8 | — | — | — | |
| Qwen2.5-7B-InstructStage=Iter12026.05 | 56.6 | — | — | — | |
| Self-RewardBase Model=Qwen2-7B-Instruct, Setting=PreInst2025.02 | 56.45 | 70 | — | — | |
| RAIF-7BStage=-2026.05 | 56.2 | — | — | — | |
| SPAR-8B-DPOStage=-2026.05 | 56.1 | — | — | — | |
| ISHEEPBase Model=Qwen2-7B-Instruct, Setting=PreInst2025.02 | 55.52 | 69.62 | — | — | |
| Self-RewardBase Model=Qwen2-7B-Instruct, Setting=SelfInst2025.02 | 55.36 | 69.71 | — | — | |
| Qwen2.5-7B-InstructStage=BASE2026.05 | 55.1 | — | — | — | |
| Self-CorrectBase Model=LLaMA-3-8B-Instruct, Setting=SelfInst2025.02 | 54.38 | 67.19 | — | — | |
| Distill-Qwen-14BStage=Iter32026.05 | 54 | — | — | — | |
| Llama-3.1-8B-InstructStage=BASE2026.05 | 53.8 | — | — | — | |
| Distill-Qwen-14BStage=Iter12026.05 | 53.2 | — | — | — | |
| Distill-Qwen-14BStage=Iter22026.05 | 52.7 | — | — | — | |
| Self-CorrectBase Model=Qwen2-7B-Instruct, Setting=SelfInst2025.02 | 51.98 | 67.89 | — | — | |
| Distill-Qwen-14BStage=BASE2026.05 | 51.2 | — | — | — | |
| RM-DistillerPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=HH-RLHF, Algorithm=DAPO2026.01 | 50.09 | 63.31 | — | — | |
| SFTBase Model=LLaMA-3-8B-Instruct, Setting=PreInst2025.02 | 50.06 | 66.48 | — | — | |
| Conifer-7B-DPOStage=-2026.05 | 50 | — | — | — | |
| RM-DistillerPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=HH-RLHF, Algorithm=GRPO2026.01 | 49.95 | 63.14 | — | — | |
| RM-DistillerPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=ShareGPT, Algorithm=DAPO2026.01 | 49.62 | 63.15 | — | — | |
| Self-CorrectBase Model=Qwen2-7B-Instruct, Setting=PreInst2025.02 | 49.47 | 66.35 | — | — | |
| RM-DistillerPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=ShareGPT, Algorithm=GRPO2026.01 | 49.45 | 62.9 | — | — | |
| Crab-7B-DPOStage=-2026.05 | 49.4 | — | — | — | |
| BT ClassifierPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=HH-RLHF, Algorithm=DAPO2026.01 | 48.59 | 62.48 | — | — | |
| RM-DistillerPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=HH-RLHF, Algorithm=PPO2026.01 | 48.42 | 62.05 | — | — | |
| BT ClassifierPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=HH-RLHF, Algorithm=GRPO2026.01 | 48.33 | 62.15 | — | — | |
| BT ClassifierPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=ShareGPT, Algorithm=DAPO2026.01 | 48.15 | 62.1 | — | — | |
| BT ClassifierPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=ShareGPT, Algorithm=GRPO2026.01 | 47.9 | 61.88 | — | — | |
| RM-DistillerPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=ShareGPT, Algorithm=PPO2026.01 | 47.78 | 61.77 | — | — | |
| SFTBase Model=Qwen2-7B-Instruct, Setting=PreInst2025.02 | 47.36 | 64.67 | — | — | |
| BT ClassifierPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=HH-RLHF, Algorithm=PPO2026.01 | 46.85 | 61.2 | — | — | |
| BT ClassifierPolicy=Llama-3-8B, Student RM=Qwen2.5-3B-Instruct, Teacher=GPT-4o, Dataset (Training)=ShareGPT, Algorithm=PPO2026.01 | 46.2 | 60.95 | — | — | |
| BaselinePolicy=Llama-3-8B, Dataset (Training)=UltraChat, Algorithm=SFT2026.01 | 41.04 | 57.39 | — | — | |
| Qwen2.5-1.5B-InstructStage=Iter32026.05 | 36.6 | — | — | — | |
| Qwen2.5-1.5B-InstructStage=Iter12026.05 | 36.5 | — | — | — | |
| Qwen2.5-1.5B-InstructStage=Iter22026.05 | 36 | — | — | — | |
| Qwen2.5-1.5B-InstructStage=BASE2026.05 | 34.6 | — | — | — | |
| API Prompting (direct Judge)Evaluation Protocol=direct Judge2026.05 | — | — | — | 81.7 | |
| API Prompting (Rubric+Judge pairwise)Evaluation Protocol=Rubric+Judge pairwise2026.05 | — | — | — | 83.2 | |
| API Prompting (Rubric+Judge pointwise)Evaluation Protocol=Rubric+Judge pointwise2026.05 | — | — | — | 60.5 | |
| DPO#Data=10K2026.01 | — | — | 53.6 | — | |
| Gemini-2.5-FlashModel Category=Black-box LLMs2026.05 | — | — | — | 86 | |
| GRPO (BLEU)#Data=10K2026.01 | — | — | 49.8 | — | |
| GRPO (GRM)#Data=10K2026.01 | — | — | 54.3 | — | |
| GRPO (Random)#Data=10K2026.01 | — | — | 17.5 | — | |
| GRPO (RLPR)#Data=10K2026.01 | — | — | 54.4 | — | |
| GRPO (RLVRR)#Data=10K2026.01 | — | — | 56.2 | — | |
| GRPO (RM)#Data=10K2026.01 | — | — | 53.7 | — | |
| Instruct#Data=n/a2026.01 | — | — | 54.2 | — | |
| JudgeLRM-7BModel Category=White-box Judge/Reward LLMs2026.05 | — | — | — | 79.8 | |
| Qwen-3-8B (Rubric+Judge pairwise)Backbone=Qwen-3-8B, Evaluation Protocol=Rubric+Judge pairwise2026.05 | — | — | — | 63 | |
| Qwen-3-8B (Rubric+Judge pointwise)Backbone=Qwen-3-8B, Evaluation Protocol=Rubric+Judge pointwise2026.05 | — | — | — | 57.5 |