Instruction Following on ArenaHard Hard Prompts 2.0
32.7Win RateRLLM
Evaluation Results
| Method | Links | |
|---|---|---|
| RLLMRM=Qwen3-8B (prompted), RM Type=Generative, RM Size=8B, Training samples=non-verifiable WildChat, Evaluation mode=thinking mode2026.03 | 32.7 | |
| RLHFRM=Skywork-Reward-V2-Llama-3.1-8B, RM Type=Scalar, RM Size=8B, Training samples=non-verifiable WildChat, Evaluation mode=thinking mode2026.03 | 26.4 | |
| RLHFRM=Nexusflow/Athene-RM-8B, RM Type=Scalar, RM Size=8B, Training samples=non-verifiable WildChat, Evaluation mode=thinking mode2026.03 | 25.4 | |
| Qwen3-8BRM=–, RM Type=–, RM Size=–, Training samples=non-verifiable WildChat, Evaluation mode=thinking mode2026.03 | 22.4 | |
| RLLMThinking Mode=Thinking, RM=Qwen3-1.7B, RM Type=Generative, RM Size=1.7B, Evaluator=GPT-4.12026.03 | 8.5 | |
| Qwen3-1.7BThinking Mode=Thinking, RM=–, RM Type=–, RM Size=–, Evaluator=GPT-4.12026.03 | 6.4 | |
| RLHFThinking Mode=Thinking, RM=Skywork-Reward-V2-Llama-3.1-8B, RM Type=Scalar, RM Size=8B, Evaluator=GPT-4.12026.03 | 6 | |
| RLLMThinking Mode=Non-thinking, RM=Qwen3-1.7B, RM Type=Generative, RM Size=1.7B, Evaluator=GPT-4.12026.03 | 6 | |
| RLHFThinking Mode=Thinking, RM=Nexusflow/Athene-RM-8B, RM Type=Scalar, RM Size=8B, Evaluator=GPT-4.12026.03 | 4.3 | |
| RLHFThinking Mode=Non-thinking, RM=Nexusflow/Athene-RM-8B, RM Type=Scalar, RM Size=8B, Evaluator=GPT-4.12026.03 | 3.9 | |
| RLHFThinking Mode=Non-thinking, RM=Skywork-Reward-V2-Llama-3.1-8B, RM Type=Scalar, RM Size=8B, Evaluator=GPT-4.12026.03 | 3.6 | |
| Qwen3-1.7BThinking Mode=Non-thinking, RM=–, RM Type=–, RM Size=–, Evaluator=GPT-4.12026.03 | 3.1 |