Instruction Following on IFEval (Prompt, Inst)
88.92Avg. Score (IFEval)Oracle rule-based
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Oracle rule-basedReward=Oracle rule-based, Training step=5002026.05 | 88.92 | — | — | — | — | — | — | |
| Qwen3-14BBackbone=Qwen3-14B2026.06 | 85.4 | — | — | — | — | — | — | |
| Soft-RLVRVerifier=GPT-OSS-120B, Checklist source=DeepSeek R1, Training step=5002026.05 | 85 | — | — | — | — | — | — | |
| Qwen3-8B-thinkingBackbone=Qwen3-8B, Mode=thinking2026.06 | 85 | — | — | — | — | — | — | |
| Soft-RLVRVerifier=GPT-OSS-20B, Checklist source=DeepSeek R1, Training step=5002026.05 | 84.2 | — | — | — | — | — | — | |
| QWQ-32BBackbone=QWQ-32B2026.06 | 83.9 | — | — | — | — | — | — | |
| GPT-4 (0314)2026.05 | 81.3 | — | — | 79.3 | 76.9 | 85.4 | 83.6 | |
| Qwen2.5-7B-Instruct + DPO (via Rubric-ARROW)2026.05 | 80.7 | — | — | 79.7 | 75.6 | 85.3 | 82.1 | |
| Qwen2.5-7B-Instruct + IterDPO (via Rubric-ARROW)2026.05 | 80.3 | — | — | 79.9 | 74.5 | 85.4 | 81.4 | |
| Qwen2.5-7B-Instruct + IterDPO (via RIFL)2026.05 | 79.7 | — | — | 78 | 74.9 | 84.2 | 81.5 | |
| Qwen2.5-7B-Instruct + IterDPO (via RLCF)2026.05 | 79.5 | — | — | 78.2 | 74.3 | 84.5 | 81.1 | |
| Qwen2.5-7B-Instruct + DPO (via Rubric-RM)2026.05 | 79.5 | — | — | 78.2 | 73.9 | 84.5 | 81.2 | |
| Qwen2.5-7B-Instruct + IterDPO (via Rubric-RM)2026.05 | 79.4 | — | — | 77.6 | 74.1 | 84.3 | 81.7 | |
| Qwen2.5-7B-Instruct + IterDPO (via Rubric-ARROWw/o RL)2026.05 | 79.4 | — | — | 76.7 | 74.1 | 83.2 | 81.2 | |
| Qwen2.5-7B-Instruct + DPO (via RIFL)2026.05 | 79.4 | — | — | 77.5 | 74.1 | 84.3 | 81.8 | |
| Qwen2.5-7B-Instruct + DPO (via RLCF)2026.05 | 78.6 | — | — | 77.3 | 72.6 | 84.1 | 80.3 | |
| Qwen2.5-7B-Instruct + DPO (via Rubric-ARROWw/o RL)2026.05 | 78 | — | — | 76 | 72.8 | 82.9 | 80.3 | |
| UltraIF2026.05 | 77.3 | — | — | 75.4 | 71.3 | 83 | 79.4 | |
| Qwen2.5-7B-Instruct2026.05 | 77.3 | — | — | 75 | 72.5 | 81.8 | 79.9 | |
| Qwen2.5-7B-Instruct + DPO (via Skywork)2026.05 | 76 | — | — | 75.7 | 68 | 83.2 | 78.5 | |
| Qwen2.5-7B-Instruct + DPO (via ArmoRM)2026.05 | 76 | — | — | 73.8 | 70.2 | 81.7 | 78.3 | |
| Qwen2.5-7B-Instruct + DPO (via AI Judge)2026.05 | 75.2 | — | — | 73 | 68.9 | 80.9 | 77.8 | |
| Qwen2.5-7B-Instruct + DPO (via Ultrafbk.)2026.05 | 74.6 | — | — | 71.5 | 69.1 | 79.9 | 77.7 | |
| Command R7B (No RL)Reward=None (Initial Policy), Training step=5002026.05 | 73.89 | — | — | — | — | — | — | |
| FlexRound + LFQbits=W4, temperature=0.7, top-p=0.8, top-k=202026.05 | 71.44 | — | — | — | — | — | — | |
| Qwen2.5-7B-Instructbits=BF16, temperature=0.7, top-p=0.8, top-k=202026.05 | 70.82 | — | — | — | — | — | — | |
| RAIF2026.05 | 70.1 | — | — | — | — | — | — | |
| Qwen2.5-7B-Instruct + SFT (Distilled)2026.05 | 69.8 | — | — | 66.8 | 64.1 | 75.3 | 72.8 | |
| OmniQuant + LFQbits=W4, temperature=0.7, top-p=0.8, top-k=202026.05 | 69.78 | — | — | — | — | — | — | |
| FlexRoundbits=W4, temperature=0.7, top-p=0.8, top-k=202026.05 | 69.64 | — | — | — | — | — | — | |
| FlexRound + LFQbits=W3g128, temperature=0.7, top-p=0.8, top-k=202026.05 | 69.5 | — | — | — | — | — | — | |
| OmniQuant + LFQbits=W3g128, temperature=0.7, top-p=0.8, top-k=202026.05 | 68.63 | — | — | — | — | — | — | |
| OmniQuantbits=W4, temperature=0.7, top-p=0.8, top-k=202026.05 | 68.46 | — | — | — | — | — | — | |
| FlexRoundbits=W3g128, temperature=0.7, top-p=0.8, top-k=202026.05 | 68.3 | — | — | — | — | — | — | |
| OmniQuantbits=W3g128, temperature=0.7, top-p=0.8, top-k=202026.05 | 68.23 | — | — | — | — | — | — | |
| Block-AP + LFQbits=W4, temperature=0.7, top-p=0.8, top-k=202026.05 | 68.12 | — | — | — | — | — | — | |
| Block-APbits=W4, temperature=0.7, top-p=0.8, top-k=202026.05 | 66.87 | — | — | — | — | — | — | |
| NebulaExp-reasoning-SFTBackbone=Qwen3-8B-base2026.06 | 66.54 | — | — | — | — | — | — | |
| Block-AP + LFQbits=W3g128, temperature=0.7, top-p=0.8, top-k=202026.05 | 64.03 | — | — | — | — | — | — | |
| Block-APbits=W3g128, temperature=0.7, top-p=0.8, top-k=202026.05 | 61.35 | — | — | — | — | — | — | |
| AutoIF2026.05 | 57.2 | — | — | 56.9 | 47.1 | 67 | 57.6 | |
| MOTABStudent Model=gpt-oss-120b2026.05 | 50.01 | 41.59 | — | — | — | — | — | |
| MOTABStudent Model=Qwen3-32B2026.05 | 46.8 | 37.89 | — | — | — | — | — | |
| SKDStudent Model=Qwen3-32B2026.05 | 43.38 | 35.86 | — | — | — | — | — | |
| SKDStudent Model=gpt-oss-120b2026.05 | 42.71 | 34.57 | — | — | — | — | — | |
| ImitKDStudent Model=Qwen3-32B2026.05 | 41.02 | 32.53 | — | — | — | — | — | |
| SFTStudent Model=gpt-oss-120b2026.05 | 40.37 | 32.16 | — | — | — | — | — | |
| ImitKDStudent Model=gpt-oss-120b2026.05 | 40.15 | 32.35 | — | — | — | — | — | |
| SFTStudent Model=Qwen3-32B2026.05 | 37.23 | 29.92 | — | — | — | — | — | |
| ADModel=Llama-3-8B2026.06 | — | 67.65 | 76.26 | — | — | — | — | |
| ADModel=Llama-3-70B2026.06 | — | 76.89 | 84.41 | — | — | — | — | |
| CDModel=Llama-3-70B2026.06 | — | 71.72 | 79.74 | — | — | — | — | |
| DCOModel=Llama-3-8B2026.06 | — | 74.68 | 81.41 | — | — | — | — | |
| DCOModel=Llama-3-70B2026.06 | — | 85.77 | 90.29 | — | — | — | — | |
| DeCoRe (static)Model=Llama-3-8B2026.06 | — | 69.13 | 78.06 | — | — | — | — | |
| DeCoRe (static)Model=Llama-3-70B2026.06 | — | 78.56 | 84.89 | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-7BRL Training=Baseline2026.05 | — | — | — | — | 57.1 | — | — | |
| DoLa (high)Model=Llama-3-8B2026.06 | — | 70.24 | 78.66 | — | — | — | — | |
| DoLa (high)Model=Llama-3-70B2026.06 | — | 78 | 84.65 | — | — | — | — | |
| DoLa (low)Model=Llama-3-8B2026.06 | — | 69.69 | 78.18 | — | — | — | — | |
| DoLa (low)Model=Llama-3-70B2026.06 | — | 77.08 | 84.29 | — | — | — | — | |
| GLM-4.7-FlashRL Training=Baseline2026.05 | — | — | — | — | 83.5 | — | — | |
| GreedyModel=Llama-3-8B2026.06 | — | 70.24 | 78.3 | — | — | — | — | |
| GreedyModel=Llama-3-70B2026.06 | — | 77.45 | 84.41 | — | — | — | — | |
| Hybrid RewardBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | — | — | — | — | 69.2 | — | — | |
| Hybrid RewardBackbone=Qwen3-4B2026.05 | — | — | — | — | 86.5 | — | — | |
| Hybrid RewardBackbone=GLM-4.7-Flash2026.05 | — | — | — | — | 89.8 | — | — | |
| Hybrid RewardBackbone=Qwen3-30B-A3B2026.05 | — | — | — | — | 87.5 | — | — | |
| ITIModel=Llama-3-8B2026.06 | — | 52.31 | 63.19 | — | — | — | — | |
| ITIModel=Llama-3-70B2026.06 | — | 76.71 | 83.69 | — | — | — | — | |
| POPBackbone=Qwen-2.5-7B2026.04 | — | 34.94 | 46.64 | — | — | — | — | |
| POPBackbone=Qwen-2.5-7B-Inst2026.04 | — | 71.54 | 79.5 | — | — | — | — | |
| Qwen-2.5-7BBackbone=Qwen-2.5-7B2026.04 | — | 26.07 | 39.03 | — | — | — | — | |
| Qwen-2.5-7B-InstBackbone=Qwen-2.5-7B-Inst2026.04 | — | 67.93 | 76.74 | — | — | — | — | |
| Qwen3-30B-A3BRL Training=Baseline2026.05 | — | — | — | — | 85.4 | — | — | |
| Qwen3-4BRL Training=Baseline2026.05 | — | — | — | — | 83.4 | — | — | |
| Train on DBackbone=Qwen-2.5-7B2026.04 | — | 23.48 | 35.67 | — | — | — | — | |
| Train on DBackbone=Qwen-2.5-7B-Inst2026.04 | — | 52.87 | 63.43 | — | — | — | — |