Harmful Refusal on WJB
0.2ASRSELF-REDTEAM
Evaluation Results
| Method | Links | |
|---|---|---|
| SELF-REDTEAMBackbone=Qwen2.5-7B-IT2026.05 | 0.2 | |
| SELF-REDTEAMBackbone=Qwen2.5-14B-IT2026.05 | 0.5 | |
| ABSBackbone=Qwen2.5-7B-IT2026.05 | 1 | |
| Qwen2.5-14B-ITBackbone=Qwen2.5-14B-IT2026.05 | 1.7 | |
| ABSBackbone=Qwen2.5-3B-IT2026.05 | 1.9 | |
| ABSBackbone=Qwen2.5-14B-IT2026.05 | 2.2 | |
| Qwen2.5-7B-ITBackbone=Qwen2.5-7B-IT2026.05 | 4 | |
| SELF-REDTEAMBackbone=Qwen2.5-3B-IT2026.05 | 5.6 | |
| Qwen2.5-3B-ITBackbone=Qwen2.5-3B-IT2026.05 | 11.9 | |
| ELSBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 20.7 | |
| Llama3.1-8B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 21.4 | |
| Self-Play + SFTBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 24 | |
| Llama3.1-8B-IT-AB + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 24 | |
| Qwen2.5-14B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 37.2 | |
| Defender-Only + SFTBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 43.2 | |
| Qwen2.5-7B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 48.9 | |
| Self-PlayBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 53.6 | |
| Qwen2.5-3B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 53.9 | |
| SFTBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 60 | |
| Llama-3.1-8B-ITModel Status=Base Model, Input Condition=adv harm2025.10 | 67.5 | |
| Llama3.1-8B-ITTraining=Instruction-tuned base2025.06 | 67.5 | |
| Defender-OnlyBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 69.5 | |
| Qwen2.5-14B-ITTraining=Instruction-tuned base2025.06 | 74.2 | |
| Qwen2.5-7B-ITTraining=Instruction-tuned base2025.06 | 86.4 | |
| Qwen2.5-3B-ITTraining=Instruction-tuned base2025.06 | 86.6 | |
| Llama3.1-8B-IT-ABTraining=Instruction-tuned ablated base2025.06 | 99.1 |