Harmful Refusal on WG (test)
0ASRQwen2.5-14B-IT + SELF-REDTEAM
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-14B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 0 | |
| Qwen2.5-7B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 0.2 | |
| Llama3.1-8B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 0.3 | |
| Qwen2.5-3B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 0.5 | |
| Llama3.1-8B-IT-AB + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 1.9 | |
| Qwen2.5-3B-ITTraining=Instruction-tuned base2025.06 | 2.2 | |
| Qwen2.5-14B-ITTraining=Instruction-tuned base2025.06 | 2.2 | |
| Qwen2.5-7B-ITTraining=Instruction-tuned base2025.06 | 2.7 | |
| Llama3.1-8B-ITTraining=Instruction-tuned base2025.06 | 6.3 | |
| Qwen2.5-14B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 8 | |
| Llama3.1-8B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 9.4 | |
| SELF-REDTEAMBackbone=Qwen2.5-14B-IT, Fine-tuning=Full2026.05 | 11.6 | |
| ABSBackbone=Qwen2.5-3B-IT, Training=Anchored Bipolicy Self-Play2026.05 | 12.2 | |
| ABSBackbone=Qwen2.5-14B-IT, Training=Anchored Bipolicy Self-Play2026.05 | 13.1 | |
| Self-Play + SFTBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 13.8 | |
| Llama3.1-8B-IT-AB + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 13.8 | |
| Qwen2.5-14B-ITBackbone=Qwen2.5-14B-IT2026.05 | 14.6 | |
| ABSBackbone=Qwen2.5-7B-IT, Training=Anchored Bipolicy Self-Play2026.05 | 16.9 | |
| Qwen2.5-14B-ITTraining=Instruction-tuned base2025.06 | 16.9 | |
| Self-PlayBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 17.2 | |
| SELF-REDTEAMBackbone=Qwen2.5-7B-IT, Fine-tuning=Full2026.05 | 17.8 | |
| Qwen2.5-7B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 17.9 | |
| SFTBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 18.3 | |
| ELSBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 21.9 | |
| Llama-3.1-8B-ITModel Status=Base Model, Input Condition=adv harm2025.10 | 22.3 | |
| SELF-REDTEAMBackbone=Qwen2.5-3B-IT, Fine-tuning=Full2026.05 | 23.4 | |
| Llama3.1-8B-ITTraining=Instruction-tuned base2025.06 | 23.7 | |
| Qwen2.5-3B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 24.5 | |
| Defender-Only + SFTBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 25.1 | |
| Defender-OnlyBase Model=Llama-3.1-8B-IT, Input Condition=adv harm2025.10 | 27.6 | |
| Qwen2.5-7B-ITBackbone=Qwen2.5-7B-IT2026.05 | 27.9 | |
| Qwen2.5-3B-ITBackbone=Qwen2.5-3B-IT2026.05 | 28.2 | |
| Qwen2.5-7B-ITTraining=Instruction-tuned base2025.06 | 30.3 | |
| Qwen2.5-3B-ITTraining=Instruction-tuned base2025.06 | 36.5 | |
| Llama3.1-8B-IT-ABTraining=Instruction-tuned ablated base2025.06 | 47.8 | |
| Llama3.1-8B-IT-ABTraining=Instruction-tuned ablated base2025.06 | 55.3 |