LLM Evaluation on Arena-Hard v2
18.2ScoreQwen3-8B + CE-RM-4B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-8B + CE-RM-4BGRPO group size=8, Reward Model=CE-RM-4B2026.01 | 18.2 | — | |
| Qwen3-8B + CE-RM-4BGRPO group size=4, Reward Model=CE-RM-4B, Test-time scaling=@42026.01 | 17.6 | — | |
| Qwen3-14BModel Type=Base Policy Model2026.01 | 17.1 | — | |
| Qwen3-8B + CE-RM-4BGRPO group size=4, Reward Model=CE-RM-4B2026.01 | 16.3 | — | |
| Qwen3-8B + CompassJudger1-32BGRPO group size=8, Reward Model=CompassJudger1-32B2026.01 | 13.6 | — | |
| Qwen3-8B + RM w/o unified criteriaGRPO group size=8, Reward Model=RM w/o unified criteria2026.01 | 13.5 | — | |
| Qwen3-8B + CompassJudger1-32BGRPO group size=4, Reward Model=CompassJudger1-32B2026.01 | 13.4 | — | |
| Qwen3-8B + RM w/o unified criteriaGRPO group size=4, Reward Model=RM w/o unified criteria2026.01 | 12.9 | — | |
| Qwen3-8BModel Type=Base Policy Model2026.01 | 9.8 | — | |
| STEP3-VL-10BNumber of Parameters=10B2026.01 | 0.5857 | — | |
| Qwen3-VL ThinkingNumber of Parameters=8B2026.01 | 0.4734 | — | |
| MiMo-VL RL-2508Number of Parameters=7B2026.01 | 0.2859 | — | |
| InternVL 3.5Number of Parameters=8B2026.01 | 0.1557 | — | |
| GLM-4.6V FlashNumber of Parameters=9B2026.01 | 0.0926 | — |