Creative Writing on WritingBench
80.39ScoreMiniMax-M2.5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MiniMax-M2.5Category=Proprietary LLMs2026.06 | 80.39 | — | — | |
| Qwen3-8B-OPERACategory=Our Methods, Technique=OPERA2026.06 | 78.19 | — | — | |
| LongWriter-Zero-32BCategory=Open-source LLMs2026.06 | 77.44 | — | — | |
| Qwen3-8B-SFTCategory=Our Methods2026.06 | 76.63 | — | — | |
| Gemini-2.5-proCategory=Proprietary LLMs2026.06 | 76.35 | — | — | |
| Qwen3-8BCategory=Our Methods2026.06 | 75.08 | — | — | |
| DeepWriter-8BCategory=Open-source LLMs2026.06 | 73.7 | — | — | |
| Confident DecodingModel=Qwen3.5-122B-A10B, Decoding Strategy=Confident (Ours)2026.06 | 72.7 | — | — | |
| Last LayerModel=Qwen3.5-122B-A10B, Decoding Strategy=Last Layer2026.06 | 72.6 | — | — | |
| Llama3.1-8B-OPERACategory=Our Methods, Technique=OPERA2026.06 | 72.12 | — | — | |
| Llama3.1-8B-SFTCategory=Our Methods2026.06 | 71.3 | — | — | |
| Confident DecodingModel=gpt-oss-120B, Decoding Strategy=Confident (Ours)2026.06 | 67.8 | — | — | |
| Last LayerModel=gpt-oss-120B, Decoding Strategy=Last Layer2026.06 | 67.5 | — | — | |
| Last LayerModel=Qwen3.5-27B, Decoding Strategy=Last Layer2026.06 | 66.7 | — | — | |
| Confident DecodingModel=Qwen3.5-27B, Decoding Strategy=Confident (Ours)2026.06 | 66.4 | — | — | |
| GPT-4o-0513Category=Proprietary LLMs2026.06 | 66.19 | — | — | |
| Confident DecodingModel=Qwen3.5-35B-A3B, Decoding Strategy=Confident (Ours)2026.06 | 65.3 | — | — | |
| Last LayerModel=Qwen3.5-35B-A3B, Decoding Strategy=Last Layer2026.06 | 65.2 | — | — | |
| Confident DecodingModel=Gemma-4-31B, Decoding Strategy=Confident (Ours)2026.06 | 64.4 | — | — | |
| Last LayerModel=Gemma-4-31B, Decoding Strategy=Last Layer2026.06 | 64.2 | — | — | |
| AMARISRubric Strategy=global rubric2026.05 | 57.9 | — | — | |
| AMARISRubric Strategy=per-instance rubric2026.05 | 57.3 | — | — | |
| RubricHub (RuRL)RL Training Approach=RuRL2026.05 | 56.9 | — | — | |
| RuscaRLRL Training Approach=RuscaRL2026.05 | 56.1 | — | — | |
| Confident DecodingModel=gpt-oss-20b, Decoding Strategy=Confident (Ours)2026.06 | 54.6 | — | — | |
| Last LayerModel=gpt-oss-20b, Decoding Strategy=Last Layer2026.06 | 54.3 | — | — | |
| Llama3.1-8BCategory=Our Methods2026.06 | 49.58 | — | — | |
| Naive (no RL)RL Training Approach=None2026.05 | 45.2 | — | — | |
| LongWriter-8BCategory=Open-source LLMs2026.06 | 44.57 | — | — | |
| DPWriterBackbone=Qwen3-4B2026.01 | 6.43 | 10.45 | 8.81 | |
| Qwen3-4BBackbone=Qwen3-4B2026.01 | 6.37 | 7.55 | 6.32 | |
| GRPOBackbone=Qwen3-4B2026.01 | 6.32 | 9.07 | 8.02 | |
| GRPO-UnlikelinessBackbone=Qwen3-4B2026.01 | 6.28 | 9.46 | 8.33 | |
| GAPOBackbone=Qwen3-4B2026.01 | 6.25 | 9.83 | 8.11 | |
| DarlingBackbone=Qwen3-4B2026.01 | 6.23 | 8.82 | 7.66 | |
| DPWriterBackbone=Llama-3.2-3B-Instruct2026.01 | 5.31 | 12.03 | 9.6 | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.01 | 5.25 | 12.01 | 9.42 | |
| DarlingBackbone=Llama-3.2-3B-Instruct2026.01 | 4.57 | 9.31 | 7.79 | |
| GAPOBackbone=Llama-3.2-3B-Instruct2026.01 | 4.57 | 10.65 | 8.05 | |
| GRPO-UnlikelinessBackbone=Llama-3.2-3B-Instruct2026.01 | 4.47 | 11.34 | 8.42 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B2026.01 | 3.74 | 15.84 | 5.94 | |
| Llama-3.2-3B-InstructBackbone=Llama-3.2-3B-Instruct2026.01 | 3.54 | 11.27 | 6.97 |