Instruction Following on IFBench (Accuracy, Rank)
36AccuracyAMARIS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AMARISRubric Strategy=per-instance rubric2026.05 | 36 | — | |
| AMARISRubric Strategy=global rubric2026.05 | 35.2 | — | |
| Rubric-ARMRL Training Approach=Rubric-ARM2026.05 | 35 | — | |
| OpenRubricsRL Training Approach=DPO via Rubric-RM2026.05 | 33.7 | — | |
| RubricHub (RuRL)RL Training Approach=RuRL2026.05 | 33.5 | — | |
| RuscaRLRL Training Approach=RuscaRL2026.05 | 33 | — | |
| Naive (no RL)RL Training Approach=None2026.05 | 28.2 | — | |
| RLCFRL Training Approach=RLCF2026.05 | 28.2 | — | |
| BaselineBackbone=LLaMA-3.1-8B-Instruct2026.05 | 26.2 | — | |
| SKOPBackbone=LLaMA-3.1-8B-Instruct2026.05 | 25 | 2.69 | |
| Angular SteerBackbone=LLaMA-3.1-8B-Instruct2026.05 | 19.5 | 4.75 | |
| CASTBackbone=LLaMA-3.1-8B-Instruct2026.05 | 18.2 | 5.63 | |
| LoRABackbone=LLaMA-3.1-8B-Instruct2026.05 | 16.8 | — | |
| SADIBackbone=LLaMA-3.1-8B-Instruct2026.05 | 15.5 | 3.38 | |
| CAABackbone=LLaMA-3.1-8B-Instruct2026.05 | 14.5 | 5.44 | |
| DISCO-QBackbone=LLaMA-3.1-8B-Instruct2026.05 | 11.5 | 4.75 | |
| ITIBackbone=LLaMA-3.1-8B-Instruct2026.05 | 10.5 | 4.75 | |
| Comm SteerBackbone=LLaMA-3.1-8B-Instruct2026.05 | 6 | 4.63 |