Instruction Following on MulDimIF
84.7ScoreHeRL
Evaluation Results
| Method | Links | |
|---|---|---|
| HeRLBackbone=Llama-3.2-3B-Instruct, Training Method=HeRL2026.03 | 84.7 | |
| HeRLBackbone=Qwen2.5-7B-Instruct, Training Method=HeRL2026.03 | 83.4 | |
| HeRLBackbone=Qwen3-4B-Instruct-2507, Training Method=HeRL2026.03 | 82.5 | |
| RLVRBackbone=Qwen3-4B-Instruct-2507, Training Method=RLVR2026.03 | 79 | |
| RLVRBackbone=Llama-3.2-3B-Instruct, Training Method=RLVR2026.03 | 77.6 | |
| RTT-AON (Ours)Backbone=Qwen3-4B-Instruct2026.04 | 76.75 | |
| RTT-CSR (Ours)Backbone=Qwen3-4B-Instruct2026.04 | 76.33 | |
| RL-CSRBackbone=Qwen3-4B-Instruct2026.04 | 74.38 | |
| RL-AONBackbone=Qwen3-4B-Instruct2026.04 | 74.25 | |
| RLVRBackbone=Qwen2.5-7B-Instruct, Training Method=RLVR2026.03 | 73.5 | |
| RTT-AON (Ours)Backbone=Qwen2.5-7B-Instruct2026.04 | 71.83 | |
| RTT-CSR (Ours)Backbone=Qwen2.5-7B-Instruct2026.04 | 69.67 | |
| RL-AONBackbone=Qwen2.5-7B-Instruct2026.04 | 69.41 | |
| RTT-AON (Ours)Backbone=Llama3.2-3B-Instruct2026.04 | 68.58 | |
| SFTBackbone=Qwen2.5-7B-Instruct, Training Method=SFT2026.03 | 67.8 | |
| SFTBackbone=Llama-3.2-3B-Instruct, Training Method=SFT2026.03 | 66.9 | |
| RL-AONBackbone=Llama3.2-3B-Instruct2026.04 | 66.83 | |
| SFTBackbone=Qwen3-4B-Instruct-2507, Training Method=SFT2026.03 | 66.8 | |
| RL-CSRBackbone=Qwen2.5-7B-Instruct2026.04 | 66.67 | |
| RTT-CSR (Ours)Backbone=Llama3.2-3B-Instruct2026.04 | 66.33 | |
| DPOBackbone=Qwen3-4B-Instruct-2507, Training Method=DPO2026.03 | 61.5 | |
| Qwen3-4B-Instruct-2507Backbone=Qwen3-4B-Instruct-2507, Training Method=Initial2026.03 | 57.3 | |
| RL-CSRBackbone=Llama3.2-3B-Instruct2026.04 | 56.92 | |
| DPOBackbone=Qwen2.5-7B-Instruct, Training Method=DPO2026.03 | 56.5 | |
| SFTBackbone=Qwen3-4B-Instruct2026.04 | 56.5 | |
| Qwen3-4B-Instruct†Backbone=Qwen3-4B-Instruct2026.04 | 56.08 | |
| DPOBackbone=Qwen3-4B-Instruct2026.04 | 55.83 | |
| DPOBackbone=Llama-3.2-3B-Instruct, Training Method=DPO2026.03 | 54.4 | |
| SFTBackbone=Qwen2.5-7B-Instruct2026.04 | 52.83 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B-Instruct, Training Method=Initial2026.03 | 51.4 | |
| Qwen2.5-7B-Instruct†Backbone=Qwen2.5-7B-Instruct2026.04 | 51.08 | |
| DPOBackbone=Qwen2.5-7B-Instruct2026.04 | 51.08 | |
| SFTBackbone=Llama3.2-3B-Instruct2026.04 | 36.5 | |
| Llama-3.2-3B-InstructBackbone=Llama-3.2-3B-Instruct, Training Method=Initial2026.03 | 35.8 | |
| Llama3.2-3B-Instruct⋆Backbone=Llama3.2-3B-Instruct2026.04 | 35.42 | |
| DPOBackbone=Llama3.2-3B-Instruct2026.04 | 34.5 |