Arena-Hard Creative Writing v2
90.8ScoreGemini-2.5-Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-2.5-ProType=Closed-source LLM2026.02 | 90.8 | — | |
| o3Type=Closed-source LLM2026.02 | 88.8 | — | |
| Qwen3-30B-A3B-Instruct + More Query Rubricsbackbone=Qwen3-30B-A3B-Instruct, supervision=More Query Rubrics2026.02 | 79.4 | — | |
| Deepseek-R1Type=Open-source LLM2026.02 | 77 | — | |
| Qwen3-235B-InstructType=Open-source LLM2026.02 | 73.5 | — | |
| Baichuan-M2-32BType=Specialized LLM2026.02 | 69.2 | — | |
| Claude-3.7-SonnetType=Closed-source LLM2026.02 | 63.9 | — | |
| GPT-4.1Type=Closed-source LLM2026.02 | 61.5 | — | |
| Qwen3-4B-Instruct + More Query Rubricsbackbone=Qwen3-4B-Instruct, supervision=More Query Rubrics2026.02 | 61.3 | — | |
| HuatuoGPT-o1-72BType=Specialized LLM2026.02 | 55.3 | — | |
| Qwen3-4B-Instruct + Doctor Rubricsbackbone=Qwen3-4B-Instruct, supervision=Doctor Rubrics2026.02 | 55.3 | — | |
| Qwen3-32BType=Open-source LLM2026.02 | 53.3 | — | |
| Qwen3-4B-Instruct + Principle Rubricsbackbone=Qwen3-4B-Instruct, supervision=Principle Rubrics2026.02 | 51 | — | |
| Qwen3-4B-Instruct + Draft Rubricsbackbone=Qwen3-4B-Instruct, supervision=Draft Rubrics2026.02 | 50.5 | — | |
| Qwen3-8B + CE-RM-4BGRPO group size=8, Reward Model=CE-RM-4B2026.01 | 49.1 | — | |
| Qwen3-8B + CE-RM-4BGRPO group size=4, Reward Model=CE-RM-4B, Test-time scaling=@42026.01 | 48 | — | |
| Qwen3-8B + CE-RM-4BGRPO group size=4, Reward Model=CE-RM-4B2026.01 | 42.9 | — | |
| Qwen3-8B + RM w/o unified criteriaGRPO group size=8, Reward Model=RM w/o unified criteria2026.01 | 39.9 | — | |
| Qwen3-8B + CompassJudger1-32BGRPO group size=8, Reward Model=CompassJudger1-32B2026.01 | 39.4 | — | |
| Qwen3-8B + RM w/o unified criteriaGRPO group size=4, Reward Model=RM w/o unified criteria2026.01 | 37.6 | — | |
| Qwen3-30B-A3B-InstructType=Our Method baseline2026.02 | 34.9 | — | |
| Qwen3-8B + CompassJudger1-32BGRPO group size=4, Reward Model=CompassJudger1-32B2026.01 | 27.1 | — | |
| Qwen3-14BModel Type=Base Policy Model2026.01 | 24.7 | — | |
| Qwen3-8BModel Type=Base Policy Model2026.01 | 14.4 | — | |
| Qwen3-4B-InstructType=Our Method baseline2026.02 | 13.2 | — |