Safety Evaluation (FRR) on XSTest
0.4FRRBoN (N=64)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BoN (N=64)Model=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 0.4 | — | |
| RSModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 0.8 | — | |
| BoN (N=64)Model=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 0.8 | — | |
| CBSModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 0.8 | — | |
| GGROModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 1.2 | — | |
| JPUBackbone=Llama3-8B-Instruct2026.01 | 1.6 | — | |
| RSModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 1.6 | — | |
| CBSModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 1.6 | — | |
| Vanilla LLMModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 1.6 | — | |
| ARGS-GModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 1.6 | — | |
| CARDSModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 1.6 | — | |
| SEAModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 2 | — | |
| Base modelBackbone=Llama3-8B-Instruct2026.01 | 3.2 | — | |
| SEAModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 3.2 | — | |
| GGROModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 3.6 | — | |
| ARGS-GModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 4 | — | |
| CARDSModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 4.4 | — | |
| CKUBackbone=Llama3-8B-Instruct2026.01 | 5.11 | — | |
| EraserBackbone=Llama3-8B-Instruct2026.01 | 5.22 | — | |
| Safe UnlearningBackbone=Llama3-8B-Instruct2026.01 | 5.44 | — | |
| Circuit BreakBackbone=Llama3-8B-Instruct2026.01 | 5.56 | — | |
| RSFTBackbone=Llama3-8B-Instruct2026.01 | 6 | — | |
| Vanilla LLMModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 6 | — | |
| Initial RLHFTraining Configuration=Initial RLHF2026.04 | 7 | — | |
| General Safe-RLHFTraining Configuration=General Safe-RLHF2026.04 | 9 | — | |
| ARES (Ministral)Training Configuration=Ours (Ministral)2026.04 | 9 | — | |
| ARES (Qwen)Training Configuration=Ours (Qwen)2026.04 | 10 | — | |
| Original ModelTraining Configuration=Original Model2026.04 | 11 | — | |
| JPUBackbone=Llama2-7B-Chat2026.01 | 22.4 | — | |
| CKUBackbone=Llama2-7B-Chat2026.01 | 25.56 | — | |
| Safe UnlearningBackbone=Llama2-7B-Chat2026.01 | 27.78 | — | |
| Base modelBackbone=Llama2-7B-Chat2026.01 | 28.8 | — | |
| Circuit BreakBackbone=Llama2-7B-Chat2026.01 | 29.78 | — | |
| EraserBackbone=Llama2-7B-Chat2026.01 | 33.33 | — | |
| RSFTBackbone=Llama2-7B-Chat2026.01 | 36.42 | — | |
| Goal PrioritizationTarget Model=Vicuna-7B2026.04 | — | 20.4 | |
| Llama Guard 3Target Model=Vicuna-7B2026.04 | — | 8.4 | |
| No DefenseTarget Model=Vicuna-7B2026.04 | — | 37 | |
| Qwen3GuardTarget Model=Vicuna-7B2026.04 | — | 12.4 | |
| Self-GuardTarget Model=Vicuna-7B2026.04 | — | 14.8 | |
| TrajGuardTarget Model=Vicuna-7B2026.04 | — | 1.5 |