Instruction Following on IFBench (Pr. (S))
57.3Pr. (S)Hybrid Reward
Evaluation Results
| Method | Links | |
|---|---|---|
| Hybrid RewardBackbone=GLM-4.7-Flash2026.05 | 57.3 | |
| GLM-4.7-FlashRL Training=Baseline2026.05 | 50.8 | |
| Hybrid RewardBackbone=Qwen3-30B-A3B2026.05 | 39.3 | |
| Hybrid RewardBackbone=Qwen3-4B2026.05 | 35.9 | |
| Qwen3-30B-A3BRL Training=Baseline2026.05 | 35.9 | |
| Qwen3-4BRL Training=Baseline2026.05 | 29.4 | |
| Hybrid RewardBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 21.3 | |
| DeepSeek-R1-Distill-Qwen-7BRL Training=Baseline2026.05 | 13.4 |