Knowledge Recovery on WMDP-Bio 100-sample subset
0.93ASRREBEL
Evaluation Results
| Method | Links | |
|---|---|---|
| REBELUnlearning technique=IDKNLL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.93 | |
| REBELUnlearning technique=UNDIAL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.85 | |
| REBELUnlearning technique=IDKDPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.69 | |
| Leak@1000Unlearning technique=IDKNLL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.66 | |
| Leak@500Unlearning technique=IDKNLL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.65 | |
| REBELUnlearning technique=NPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.6 | |
| Leak@100Unlearning technique=IDKNLL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.58 | |
| Leak@500Unlearning technique=IDKDPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.58 | |
| Leak@1000Unlearning technique=IDKDPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.58 | |
| Leak@100Unlearning technique=IDKDPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.51 | |
| Leak@1000Unlearning technique=UNDIAL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.51 | |
| Leak@10Unlearning technique=IDKNLL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.5 | |
| Leak@500Unlearning technique=UNDIAL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.48 | |
| Leak@1000Unlearning technique=NPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.44 | |
| Leak@500Unlearning technique=NPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.43 | |
| Leak@100Unlearning technique=UNDIAL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.42 | |
| Leak@100Unlearning technique=NPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.39 | |
| Leak@10Unlearning technique=UNDIAL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.33 | |
| REBELUnlearning technique=SimNPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.33 | |
| BaselineUnlearning technique=IDKNLL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.32 | |
| Leak@10Unlearning technique=NPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.32 | |
| Leak@10Unlearning technique=IDKDPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.31 | |
| REBELUnlearning technique=GradDiff, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.31 | |
| BaselineUnlearning technique=IDKDPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.28 | |
| BaselineUnlearning technique=UNDIAL, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.26 | |
| Leak@1000Unlearning technique=SimNPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.26 | |
| BaselineUnlearning technique=NPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.25 | |
| Leak@500Unlearning technique=SimNPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.25 | |
| Leak@500Unlearning technique=GradDiff, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.24 | |
| Leak@1000Unlearning technique=GradDiff, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.24 | |
| Leak@10Unlearning technique=GradDiff, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.23 | |
| Leak@100Unlearning technique=GradDiff, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.23 | |
| BaselineUnlearning technique=SimNPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.22 | |
| Leak@10Unlearning technique=SimNPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.22 | |
| Leak@100Unlearning technique=SimNPO, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.22 | |
| BaselineUnlearning technique=GradDiff, Target model=Llama-3-8B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.21 |