Adversarial Safety Evaluation on HEx-PHI (first 100 harmful prompts)
45ASRDARWIN
Evaluation Results
| Method | Links | |
|---|---|---|
| DARWINBase Model=LLaMA-3.1-8B-Instruct, Reward Model=Skywork-Reward-V2-LLaMA-3.1-8B, Beam Pool Size (W)=8, Beam Replacement Frequency=every 30 generated tokens, Sampling Temperature (β)=0.7, top-k=402026.06 | 45 | |
| Vanilla LLMBase Model=Qwen3-8B, Reward Model=Skywork-Reward-V2-Qwen3-8B2026.06 | 25 | |
| GGROBase Model=LLaMA-3.1-8B-Instruct, Reward Model=Skywork-Reward-V2-LLaMA-3.1-8B, Beam Pool Size (W)=8, Beam Replacement Frequency=every 30 generated tokens, Sampling Temperature (β)=0.7, top-k=402026.06 | 22 | |
| CBSBase Model=Qwen3-8B, Reward Model=Skywork-Reward-V2-Qwen3-8B2026.06 | 18 | |
| CARDSBase Model=Qwen3-8B, Reward Model=Skywork-Reward-V2-Qwen3-8B, tau_H=1.02026.06 | 18 | |
| RSBase Model=Qwen3-8B, Reward Model=Skywork-Reward-V2-Qwen3-8B2026.06 | 16 | |
| BoN (N=64)Base Model=Qwen3-8B, Reward Model=Skywork-Reward-V2-Qwen3-8B, N=642026.06 | 14 | |
| GGROBase Model=Qwen3-8B, Reward Model=Skywork-Reward-V2-Qwen3-8B, tau_H=1.02026.06 | 11 |