Creative Writing on Arena Hard
63.5Win RateOnline DPO with WILDREWARD
Evaluation Results
| Method | Links | |
|---|---|---|
| Online DPO with WILDREWARDDPO Setting=Online, Reward Model=WILDREWARD2026.02 | 63.5 | |
| Online DPO with ArmoRMDPO Setting=Online, Reward Model=ArmoRM2026.02 | 57.7 | |
| Llama3.1-8B-InstructDPO Setting=Original (None), Reward Model=N/A2026.02 | 55.7 | |
| Offline DPO with WILDREWARDDPO Setting=Offline, Reward Model=WILDREWARD2026.02 | 55.4 | |
| SPARDBackbone=Qwen3-8B2026.04 | 45.9 | |
| + GRPOavgBackbone=Qwen3-8B2026.04 | 44.3 | |
| + DPOBackbone=Qwen3-8B2026.04 | 43.1 | |
| + GRPOimpBackbone=Qwen3-8B2026.04 | 43.1 | |
| BaseBackbone=Qwen3-8B2026.04 | 42 | |
| + GRPOrmBackbone=Qwen3-8B2026.04 | 40.6 | |
| + SFTBackbone=Qwen3-8B2026.04 | 32.7 | |
| SPARDBackbone=Qwen2.5-7B-Instruct2026.04 | 15.6 | |
| + GRPOavgBackbone=Qwen2.5-7B-Instruct2026.04 | 14.4 | |
| + DPOBackbone=Qwen2.5-7B-Instruct2026.04 | 12.7 | |
| + SFTBackbone=Qwen2.5-7B-Instruct2026.04 | 12.5 | |
| + GRPOimpBackbone=Qwen2.5-7B-Instruct2026.04 | 12.4 | |
| + GRPOrmBackbone=Qwen2.5-7B-Instruct2026.04 | 11.2 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.04 | 10.7 |