Instruction Following on IFBench Strict
31.5Avg@10Qwen3-4B RL finetuned on HanabiRewards
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-4B RL finetuned on HanabiRewardsBackbone=Qwen3-4B, Variant=Ours-RL, Training=RL finetuned on HanabiRewards2026.01 | 31.5 | 44.6 | |
| Qwen3-4B-Instruct-2507Backbone=Qwen3-4B, Variant=Base2026.01 | 30.9 | 42.9 |