LLM Evaluation on Arena-Hard v0.1
78.3Arena-Hard ScoreQwen3-8B + CE-RM-4B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-8B + CE-RM-4BGRPO group size=4, Reward Model=CE-RM-4B, Test-time scaling=@42026.01 | 78.3 | — | |
| Qwen3-8B + CE-RM-4BGRPO group size=8, Reward Model=CE-RM-4B2026.01 | 77.6 | — | |
| Qwen3-14BModel Type=Base Policy Model2026.01 | 77.4 | — | |
| Qwen3-8B + CE-RM-4BGRPO group size=4, Reward Model=CE-RM-4B2026.01 | 75.7 | — | |
| Qwen3-8B + CompassJudger1-32BGRPO group size=4, Reward Model=CompassJudger1-32B2026.01 | 75 | — | |
| Qwen3-8B + CompassJudger1-32BGRPO group size=8, Reward Model=CompassJudger1-32B2026.01 | 74.7 | — | |
| Qwen3-8B + RM w/o unified criteriaGRPO group size=8, Reward Model=RM w/o unified criteria2026.01 | 72.1 | — | |
| Qwen3-8B + RM w/o unified criteriaGRPO group size=4, Reward Model=RM w/o unified criteria2026.01 | 71 | — | |
| Qwen3-8BModel Type=Base Policy Model2026.01 | 66.5 | — |