Open-ended generation on HelloBench (HB)
84HB-A ScoreQwen3-32B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-32BModel Category=General Open-source Models2026.04 | 84 | 86.8 | |
| Claude 3.7Model Category=General Closed-source Models2026.04 | 83.9 | 93.2 | |
| GPT-4oModel Category=General Closed-source Models2026.04 | 83.7 | 87.6 | |
| Claude 3.5Model Category=General Closed-source Models2026.04 | 82.9 | 88.3 | |
| DeepWriter-8B + RL-TCERSource Finetuning Dataset=DeepWriting Dataset2026.04 | 82.2 | 86.2 | |
| Qwen3-8BModel Category=General Open-source Models2026.04 | 81.4 | 85.3 | |
| Qwen2.5-7B-Instruct + SFT + RL-TCERModel Category=Finetuned Open-source Models, Training Stage=SFT + RL-TCER2026.04 | 81.1 | 86.4 | |
| DeepWriter-8B + RL-EndoRSource Finetuning Dataset=DeepWriting Dataset2026.04 | 79.6 | 86.9 | |
| Qwen2.5-7B-Instruct + SFT + RL-EndoRModel Category=Finetuned Open-source Models, Training Stage=SFT + RL-EndoR2026.04 | 79 | 84.7 | |
| DeepWriter-8BSource Finetuning Dataset=DeepWriting Dataset2026.04 | 77.8 | 85.7 | |
| Qwen2.5-32B-InstructModel Category=General Open-source Models2026.04 | 77 | 78.4 | |
| Qwen2.5-7B-Instruct + SFTModel Category=Finetuned Open-source Models, Training Stage=SFT2026.04 | 73.7 | 85.8 | |
| LongWriter-8B + RL-TCERSource Finetuning Dataset=LongWriter Dataset2026.04 | 72.6 | 84.5 | |
| Qwen2.5-7B-InstructModel Category=Finetuned Open-source Models, Training Stage=Base2026.04 | 72 | 76.3 | |
| LongWriter-8B + RL-EndoRSource Finetuning Dataset=LongWriter Dataset2026.04 | 70.1 | 84.2 | |
| LongWriter-8BSource Finetuning Dataset=LongWriter Dataset2026.04 | 68.8 | 82.9 | |
| Llama3.1-8B-InstructModel Category=General Open-source Models2026.04 | 45.5 | 41.3 |