Instruction Following on Arena-Hard Style-Con
57.7ScoreIterDPO (via Rubric-ARROW)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| IterDPO (via Rubric-ARROW)Backbone=Qwen2.5-7B-Instruct2026.05 | 57.7 | 53 | |
| IterDPO (via Rubric-ARROWw/o RL)Backbone=Qwen2.5-7B-Instruct2026.05 | 56.9 | 49.4 | |
| IterDPO (via Rubric-RM)Backbone=Qwen2.5-7B-Instruct2026.05 | 56.7 | 51.3 | |
| IterDPO (via RIFL)Backbone=Qwen2.5-7B-Instruct2026.05 | 55.7 | 49.7 | |
| IterDPO (via RLCF)Backbone=Qwen2.5-7B-Instruct2026.05 | 54.6 | 46 | |
| DPO (via Rubric-ARROWw/o RL)Backbone=Qwen2.5-7B-Instruct2026.05 | 54.3 | 47.4 | |
| DPO (via Rubric-ARROW)Backbone=Qwen2.5-7B-Instruct2026.05 | 54.3 | 50.7 | |
| DPO (via RIFL)Backbone=Qwen2.5-7B-Instruct2026.05 | 53.4 | 47.5 | |
| DPO (via Rubric-RM)Backbone=Qwen2.5-7B-Instruct2026.05 | 53.1 | 48.6 | |
| DPO (via Skywork)Backbone=Qwen2.5-7B-Instruct2026.05 | 50.3 | 47.9 | |
| GPT-4 (0314)2026.05 | 50 | 39.4 | |
| DPO (via RLCF)Backbone=Qwen2.5-7B-Instruct2026.05 | 48.4 | 44.1 | |
| DPO (via Ultrafbk.)Backbone=Qwen2.5-7B-Instruct2026.05 | 47.9 | 43.3 | |
| DPO (via ArmoRM)Backbone=Qwen2.5-7B-Instruct2026.05 | 46.4 | 43.2 | |
| DPO (via AI Judge)Backbone=Qwen2.5-7B-Instruct2026.05 | 44.4 | 39.4 | |
| Qwen2.5-7B-Instruct2026.05 | 42.8 | 41 | |
| SFT (Distilled)Backbone=Qwen2.5-7B-Instruct2026.05 | 29.2 | 32.8 |