Jailbreak Robustness on JailbreakBench (100 behaviors, 10 categories)
23.4AE (GCG)Qwen2.5-Instruct 0.5B
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5-Instruct 0.5BModel family=Qwen2.5, Model size=0.5B, Training stage=Instruct2026.06 | 23.4 | 24.3 | 18.2 | 8.5 | 28.4 | 58.7 | 98 | 99 | 100 | |
| Tulu3 (8B) BaseModel family=Tulu3, Model size=8B, Training stage=Base2026.06 | 8.5 | 60 | 11.2 | 9 | 38.5 | 54.9 | 100 | 100 | 100 | |
| Qwen2.5-Instruct 3BModel family=Qwen2.5, Model size=3B, Training stage=Instruct2026.06 | 3 | 196.6 | 36.7 | 14.9 | 14.8 | 33.2 | 79 | 96 | 96 | |
| Qwen3 4B-SafeRLModel family=Qwen3, Model size=4B, Training stage=SafeRL2026.06 | 1.9 | 233.3 | 59.1 | 29.4 | 6.9 | 15.1 | 63 | 74 | 84 | |
| Qwen3 8BtransferModel family=Qwen3, Model size=8B, Transfer settings=GCG attack transferred from Qwen2.5-0.5B2026.06 | 1.8 | — | — | — | — | — | 6 | — | — | |
| Tulu3 (8B) DPOModel family=Tulu3, Model size=8B, Training stage=DPO2026.06 | 1.1 | 482.9 | 88.6 | 37.1 | 5.7 | 11.8 | 58 | 74 | 73 | |
| Tulu3 (8B) RLVRModel family=Tulu3, Model size=8B, Training stage=RLVR2026.06 | 1.1 | 494.1 | 83.4 | 27.3 | 6.2 | 17.6 | 58 | 78 | 88 | |
| Qwen2.5-Instruct 7BModel family=Qwen2.5, Model size=7B, Training stage=Instruct2026.06 | 1.1 | 482 | 48.3 | 23.2 | 10.9 | 23.1 | 67 | 94 | 93 | |
| Tulu3 (8B) SFTModel family=Tulu3, Model size=8B, Training stage=SFT2026.06 | 0.6 | — | — | 51.8 | 3.2 | 9 | 34 | 40 | 51 | |
| Qwen3 4BModel family=Qwen3, Model size=4B2026.06 | 0.6 | — | 37.6 | 24.2 | 14.5 | 20.1 | 28 | 96 | 83 |