Professional deep-research writing on Deepresearch-Gym
77.1KPRClaude-4-sonnet
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Claude-4-sonnetTraining=-2026.04 | 77.1 | 1.87 | 7.86 | |
| GPT-5Training=-2026.04 | 76.26 | 2.2 | 7.98 | |
| Gemini2.5-ProTraining=-2026.04 | 73.2 | 2.68 | 7.4 | |
| Qwen3-8B + R2-Write-SFT + RLpTraining=SFT + PPO2026.04 | 72.5 | 2.1 | 7.8 | |
| Qwen3-8B + R2-Write-SFT + RLTraining=SFT + PPO2026.04 | 71.63 | 2.24 | 7.46 | |
| Qwen3-8B + R2-Write-SFTTraining=SFT2026.04 | 70.05 | 2.33 | 7.19 | |
| Qwen3-4B + R2-Write-SFT + RLpTraining=SFT + PPO2026.04 | 69.72 | 2.42 | 7.1 | |
| Qwen3-8B + Distill + RLTraining=SFT + PPO2026.04 | 68.92 | 2.7 | 7.25 | |
| Qwen3-8B + RLTraining=PPO2026.04 | 68.84 | 2.73 | 6.86 | |
| LongWriter-Zero-32BTraining=SFT + GRPO2026.04 | 68.2 | 3.24 | 7.05 | |
| Writing-RL-7BTraining=SFT + PPO2026.04 | 68.1 | 3.62 | 7.05 | |
| Qwen3-4B + R2-Write-SFTTraining=SFT2026.04 | 67.12 | 2.68 | 6.44 | |
| Qwen3-8B + DistillTraining=SFT2026.04 | 66.37 | 2.48 | 6.6 | |
| Qwen3-8B + R2-Write-LastTraining=SFT2026.04 | 65.72 | 2.62 | 6.6 | |
| Qwen3-4B + RLTraining=PPO2026.04 | 64.2 | 2.84 | 6.23 | |
| Qwen3-8BTraining=-2026.04 | 63.78 | 2.62 | 5.98 | |
| Qwen3-4BTraining=-2026.04 | 60.04 | 2.88 | 5.76 | |
| Reverse-Engineering-8BTraining=SFT2026.04 | 60.01 | 4.89 | 6.02 | |
| Longwriter-9BTraining=SFT2026.04 | 57.22 | 5.98 | 5.66 |