Open-ended Generation on Arena-Hard v2.0
47.8ScoreHybrid Reward
Evaluation Results
| Method | Links | |
|---|---|---|
| Hybrid RewardBackbone=GLM-4.7-Flash2026.05 | 47.8 | |
| Hybrid RewardBackbone=Qwen3-30B-A3B2026.05 | 38.5 | |
| Qwen3-30B-A3BRL Training=Baseline2026.05 | 30.6 | |
| GLM-4.7-FlashRL Training=Baseline2026.05 | 28.3 | |
| Hybrid RewardBackbone=Qwen3-4B2026.05 | 22 | |
| Qwen3-4BRL Training=Baseline2026.05 | 14.7 | |
| Hybrid RewardBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 4.1 | |
| DeepSeek-R1-Distill-Qwen-7BRL Training=Baseline2026.05 | 2.7 |