Real-world Query Evaluation on WildBench
71.5WildBench Accuracy+RL (Skywork-Reward-V2-Llama-3.1-8B)
Evaluation Results
| Method | Links | |
|---|---|---|
| +RL (Skywork-Reward-V2-Llama-3.1-8B)Model=Qwen2.5-7B2025.07 | 71.5 | |
| Instruct (official)Model=Qwen2.5-7B2025.07 | 70.9 | |
| +RL (Skywork-Reward-V2-Llama-3.1-8B)Model=Llama-3.1-8B2025.07 | 70.2 | |
| +RL (Skywork-Reward-V2-Qwen3-4B)Model=Qwen2.5-7B2025.07 | 69 | |
| +RL (Skywork-Reward-Gemma-2-27B-v0.2)Model=Qwen2.5-7B2025.07 | 67.8 | |
| +RL (Skywork-Reward-V2-Qwen3-4B)Model=Llama-3.1-8B2025.07 | 65 | |
| +RL (Skywork-Reward-Llama-3-8B-v0.2)Model=Qwen2.5-7B2025.07 | 64.9 | |
| Instruct (official)Model=Llama-3.1-8B2025.07 | 64.2 | |
| +RL (Skywork-Reward-Gemma-2-27B-v0.2)Model=Llama-3.1-8B2025.07 | 61.5 | |
| +SFTModel=Qwen2.5-7B2025.07 | 60.5 | |
| +SFTModel=Llama-3.1-8B2025.07 | 60.3 | |
| +RL (Skywork-Reward-Llama-3-8B-v0.2)Model=Llama-3.1-8B2025.07 | 57.8 | |
| BaseModel=Llama-3.1-8B2025.07 | 54.9 | |
| BaseModel=Qwen2.5-7B2025.07 | 51.8 |