Creative Writing Evaluation on EQ-Bench Creative (OOD)
1,911Elo RatingGPT-5.4
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5.4Model Category=Frontier, Judge=GPT-5.42026.06 | 1,911 | |
| Claude Opus 4.6Model Category=Frontier, Judge=GPT-5.42026.06 | 1,783 | |
| POLARIS–9BModel Category=Open-weight, Judge=GPT-5.42026.06 | 1,661 | |
| Gemini 3.1 ProModel Category=Frontier, Judge=GPT-5.42026.06 | 1,627 | |
| Gemini 3 FlashModel Category=Frontier, Judge=GPT-5.42026.06 | 1,620 | |
| Gemma-4-31BModel Category=Open-weight, Judge=GPT-5.42026.06 | 1,514 | |
| Qwen3.5-27BModel Category=Open-weight, Judge=GPT-5.42026.06 | 1,503 | |
| Gemma-4-26B A4B*Model Category=Open-weight, Architecture=MoE, Judge=GPT-5.42026.06 | 1,460 | |
| Qwen3.5-9BModel Category=Open-weight, Judge=GPT-5.42026.06 | 1,352 | |
| Gemma-4-E4B†Model Category=Open-weight, Architecture=PLE, Judge=GPT-5.42026.06 | 1,312 | |
| Ministral-3-8BModel Category=Open-weight, Judge=GPT-5.42026.06 | 1,219 | |
| DeepSeek-R1-Distill-Qwen-14BModel Category=Open-weight, Judge=GPT-5.42026.06 | 1,030 | |
| LongWriter-Zero-32BModel Category=Open-weight, Judge=GPT-5.42026.06 | 1,013 | |
| LongWriter-Llama3.1-8BModel Category=Open-weight, Judge=GPT-5.42026.06 | 800 |