Instruction Following on ArenaHard Creative Writing 2.0
61.9Win RateRLLM
Evaluation Results
| Method | Links | |
|---|---|---|
| RLLMRM=Qwen3-8B (prompted), RM Type=Generative, RM Size=8B, Training samples=non-verifiable WildChat, Evaluation mode=thinking mode2026.03 | 61.9 | |
| RLHFRM=Nexusflow/Athene-RM-8B, RM Type=Scalar, RM Size=8B, Training samples=non-verifiable WildChat, Evaluation mode=thinking mode2026.03 | 57.9 | |
| RLHFRM=Skywork-Reward-V2-Llama-3.1-8B, RM Type=Scalar, RM Size=8B, Training samples=non-verifiable WildChat, Evaluation mode=thinking mode2026.03 | 50.9 | |
| Qwen3-8BRM=–, RM Type=–, RM Size=–, Training samples=non-verifiable WildChat, Evaluation mode=thinking mode2026.03 | 33.3 | |
| RLHFThinking Mode=Thinking, RM=Nexusflow/Athene-RM-8B, RM Type=Scalar, RM Size=8B, Evaluator=GPT-4.12026.03 | 15.8 | |
| RLLMThinking Mode=Thinking, RM=Qwen3-1.7B, RM Type=Generative, RM Size=1.7B, Evaluator=GPT-4.12026.03 | 14.7 | |
| RLLMThinking Mode=Non-thinking, RM=Qwen3-1.7B, RM Type=Generative, RM Size=1.7B, Evaluator=GPT-4.12026.03 | 9.1 | |
| RLHFThinking Mode=Thinking, RM=Skywork-Reward-V2-Llama-3.1-8B, RM Type=Scalar, RM Size=8B, Evaluator=GPT-4.12026.03 | 8.4 | |
| RLHFThinking Mode=Non-thinking, RM=Nexusflow/Athene-RM-8B, RM Type=Scalar, RM Size=8B, Evaluator=GPT-4.12026.03 | 8 | |
| RLHFThinking Mode=Non-thinking, RM=Skywork-Reward-V2-Llama-3.1-8B, RM Type=Scalar, RM Size=8B, Evaluator=GPT-4.12026.03 | 7.8 | |
| Qwen3-1.7BThinking Mode=Thinking, RM=–, RM Type=–, RM Size=–, Evaluator=GPT-4.12026.03 | 6.9 | |
| Qwen3-1.7BThinking Mode=Non-thinking, RM=–, RM Type=–, RM Size=–, Evaluator=GPT-4.12026.03 | 3.1 |