Jailbreak Robustness on safe-unlearning
98Avg Evaluation Score (k=4)Self-ReSET
Evaluation Results
| Method | Links | |
|---|---|---|
| Self-ReSETBase Model=Qwen3-8B2026.05 | 98 | |
| Self-ReSETBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 97.3 | |
| STAR-1Base Model=Qwen3-8B2026.05 | 95.9 | |
| Self-ReSETBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 95.6 | |
| RECAPBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 93.7 | |
| DAPOBase Model=Qwen3-8B2026.05 | 89.8 | |
| DAPOBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 88.2 | |
| RECAPBase Model=Qwen3-8B2026.05 | 87.9 | |
| RECAPBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 84.9 | |
| STAR-1Base Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 81.8 | |
| DAPOBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 81.3 | |
| STAR-1Base Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 79.9 | |
| SafechainBase Model=Qwen3-8B2026.05 | 71.7 | |
| SafechainBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 68.6 | |
| SafechainBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 61.8 | |
| BaseBase Model=Qwen3-8B2026.05 | 49.7 | |
| BaseBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 48.4 | |
| BaseBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 45.9 |