Writing on WritingBench
85.87ScoreGPT-5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5Training=-2026.04 | 85.87 | |
| Qwen3-8B + R2-Write-SFT + RLpTraining=SFT + PPO2026.04 | 83.8 | |
| Qwen3-8B + R2-Write-SFT + RLTraining=SFT + PPO2026.04 | 82.22 | |
| Gemini2.5-ProTraining=-2026.04 | 82.15 | |
| Claude-4-sonnetTraining=-2026.04 | 81.76 | |
| Hybrid RewardBackbone=GLM-4.7-Flash2026.05 | 81.4 | |
| AgentSPEXModel=Claude-Sonnet-4.5-Thinking, Domain=Writing2026.04 | 81 | |
| Qwen3-8B + R2-Write-SFTTraining=SFT2026.04 | 80.71 | |
| Qwen2.5-7B-InstBase=Base, Verifier=-2026.01 | 80.7 | |
| MiniMax-M2.52026.06 | 80.39 | |
| ReActModel=Claude-Sonnet-4.5-Thinking, Domain=Writing2026.04 | 80.3 | |
| Qwen3-8B + Distill + RLTraining=SFT + PPO2026.04 | 80.22 | |
| Qwen3-4B + R2-Write-SFT + RLpTraining=SFT + PPO2026.04 | 80.22 | |
| CoTModel=Claude-Sonnet-4.5-Thinking, Domain=Writing2026.04 | 79.9 | |
| Hybrid RewardBackbone=Qwen3-30B-A3B2026.05 | 79.2 | |
| Qwen3-30B-A3B + Hybrid RLBackbone=Qwen3-30B-A3B, Training Method=Hybrid RL2026.05 | 79.2 | |
| Qwen3-8B + DistillTraining=SFT2026.04 | 78.82 | |
| Qwen3-8B + RLTraining=PPO2026.04 | 78.42 | |
| Qwen3-4B + R2-Write-SFTTraining=SFT2026.04 | 78.2 | |
| Writing-RL-7BTraining=SFT + PPO2026.04 | 78.2 | |
| OPERABackbone=Qwen3-8B2026.06 | 78.19 | |
| Rubicon-PreviewBackbone=Qwen3-30B-A3B, Training Method=rubric-anchor RL2026.05 | 77.7 | |
| LongWriter-Zero-32B2026.06 | 77.44 | |
| Qwen3-8B + R2-Write-LastTraining=SFT2026.04 | 76.7 | |
| Qwen3-8B-SFTMode=SFT2026.06 | 76.63 | |
| LongWriter-Zero-32BTraining=SFT + GRPO2026.04 | 76.56 | |
| Hybrid RewardBackbone=Qwen3-4B2026.05 | 76.4 | |
| Gemini-2.5-pro2026.06 | 76.35 | |
| GLM-4.7-FlashRL Training=Baseline2026.05 | 76.3 | |
| Qwen3-8B2026.06 | 75.08 | |
| Qwen3-4B + RLTraining=PPO2026.04 | 74.48 | |
| Qwen3-30B-A3BRL Training=Baseline2026.05 | 74.4 | |
| Qwen3-30B-A3BBackbone=Qwen3-30B-A3B2026.05 | 74.4 | |
| DeepWriter-8B2026.06 | 73.7 | |
| Reverse-Engineering-8BTraining=SFT2026.04 | 73.1 | |
| Confident DecodingModel=Qwen3.5-122B-A10B, Decoding Method=Confident2026.06 | 72.7 | |
| Last Layer DecodingModel=Qwen3.5-122B-A10B, Decoding Method=Last Layer2026.06 | 72.6 | |
| OPERABackbone=Llama3.1-8B2026.06 | 72.12 | |
| Qwen3-8BTraining=-2026.04 | 71.84 | |
| DARLBase=Inst, Verifier=✗2026.01 | 71.6 | |
| Llama3.1-8B-SFTMode=SFT2026.06 | 71.3 | |
| DARLBase=Base, Verifier=✗2026.01 | 70.9 | |
| Qwen3-4BRL Training=Baseline2026.05 | 70 | |
| VeriFreeBase=Base, Verifier=✗2026.01 | 69.5 | |
| Longwriter-9BTraining=SFT2026.04 | 68.2 | |
| Confident DecodingModel=gpt-oss-120B, Decoding Method=Confident2026.06 | 67.8 | |
| RLPRBase=Base, Verifier=✗2026.01 | 67.5 | |
| Last Layer DecodingModel=gpt-oss-120B, Decoding Method=Last Layer2026.06 | 67.5 | |
| Qwen3-4BTraining=-2026.04 | 67.4 | |
| Confident DecodingModel=Qwen3.5-27B, Decoding Method=Confident2026.06 | 66.9 | |
| Last Layer DecodingModel=Qwen3.5-27B, Decoding Method=Last Layer2026.06 | 66.7 | |
| Llama3.1-8B-InstBase=Inst, Verifier=-2026.01 | 66.3 | |
| General ReasonerBase=Base, Verifier=Model2026.01 | 66.3 | |
| GPT-4o-05132026.06 | 66.19 | |
| Confident DecodingModel=Qwen3.5-35B-A3B, Decoding Method=Confident2026.06 | 65.4 | |
| Last Layer DecodingModel=Qwen3.5-35B-A3B, Decoding Method=Last Layer2026.06 | 65.3 | |
| Confident DecodingModel=Gemma-4-31B, Decoding Method=Confident2026.06 | 64.4 | |
| Last Layer DecodingModel=Gemma-4-31B, Decoding Method=Last Layer2026.06 | 64.2 | |
| Confident DecodingModel=Qwen3.5-9B-Base, Decoding Method=Confident2026.06 | 63 | |
| Last Layer DecodingModel=Qwen3.5-9B-Base, Decoding Method=Last Layer2026.06 | 61.1 | |
| SimpleRL-ZooBase=Base, Verifier=Rule2026.01 | 60.9 | |
| Last Layer DecodingModel=Qwen3.5-9B, Decoding Method=Last Layer2026.06 | 60.7 | |
| Confident DecodingModel=Qwen3.5-9B, Decoding Method=Confident2026.06 | 59.5 | |
| Hybrid RewardBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 59.3 | |
| Confident DecodingModel=gpt-oss-20b, Decoding Method=Confident2026.06 | 54.9 | |
| RLVRBase=Base, Verifier=Rule2026.01 | 54.5 | |
| Last Layer DecodingModel=gpt-oss-20b, Decoding Method=Last Layer2026.06 | 54.4 | |
| Oat-ZeroBase=Math, Verifier=Rule2026.01 | 53.9 | |
| RLPRBase=Inst, Verifier=✗2026.01 | 53.5 | |
| TTRLBase=Base, Verifier=Rule2026.01 | 52 | |
| DeepSeek-R1-Distill-Qwen-7BRL Training=Baseline2026.05 | 50.4 | |
| Suri-7BTraining=SFT2026.04 | 49.7 | |
| Llama3.1-8B2026.06 | 49.58 | |
| LongWriter-8B2026.06 | 44.57 | |
| SimpleRL-ZooBase=Math, Verifier=Rule2026.01 | 39.9 | |
| Qwen2.5-7BBase=-, Verifier=-2026.01 | 38.3 | |
| ARES-RLBackbone=Qwen3-32B2026.05 | 38.24 | |
| WebscaleBackbone=Qwen3-32B2026.05 | 37.09 | |
| ARES-SFTBackbone=Qwen3-32B2026.05 | 37.05 | |
| CPTBackbone=Qwen3-32B2026.05 | 36.98 | |
| NaturalReasoningBackbone=Qwen3-32B2026.05 | 36.77 | |
| PRIMEBase=Math, Verifier=Rule2026.01 | 33.8 | |
| RLVRBase=Inst, Verifier=Rule2026.01 | 20.7 | |
| Confident DecodingModel=Qwen3.5-0.8B, Decoding Method=Confident2026.06 | 10.1 | |
| Last Layer DecodingModel=Qwen3.5-0.8B, Decoding Method=Last Layer2026.06 | 10 | |
| Solar OpenNumber of Parameters=102B2026.01 | 7.51 | |
| GLM-4.5-AirNumber of Parameters=110B2026.01 | 7.4 | |
| gpt-oss-120bNumber of Parameters=117B, Optimization Level=high2026.01 | 6.61 | |
| gpt-oss-120bNumber of Parameters=117B, Optimization Level=medium2026.01 | 6.55 | |
| HeRLBackbone=Qwen3-4B-Instruct-2507, Training Method=HeRL2026.03 | 0.857 | |
| DPOBackbone=Qwen3-4B-Instruct-2507, Training Method=DPO2026.03 | 0.85 | |
| Qwen3-4B-Instruct-2507Backbone=Qwen3-4B-Instruct-2507, Training Method=Initial2026.03 | 0.843 | |
| RLVRBackbone=Qwen3-4B-Instruct-2507, Training Method=RLVR2026.03 | 0.839 | |
| SFTBackbone=Qwen3-4B-Instruct-2507, Training Method=SFT2026.03 | 0.817 | |
| HeRLBackbone=Qwen2.5-7B-Instruct, Training Method=HeRL2026.03 | 0.591 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B-Instruct, Training Method=Initial2026.03 | 0.57 | |
| RLVRBackbone=Qwen2.5-7B-Instruct, Training Method=RLVR2026.03 | 0.548 | |
| DPOBackbone=Qwen2.5-7B-Instruct, Training Method=DPO2026.03 | 0.521 | |
| SFTBackbone=Qwen2.5-7B-Instruct, Training Method=SFT2026.03 | 0.515 | |
| HeRLBackbone=Llama-3.2-3B-Instruct, Training Method=HeRL2026.03 | 0.454 |