Knowledge Recovery on TOFU 10% (400 samples) 1.0 (forget)
60ASRREBEL
Evaluation Results
| Method | Links | |
|---|---|---|
| REBELUnlearning technique=SimNPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 60 | |
| Leak@1000Unlearning technique=SimNPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 45.25 | |
| Leak@500Unlearning technique=SimNPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 41.25 | |
| REBELUnlearning technique=NPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 36.25 | |
| Leak@100Unlearning technique=SimNPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 34.5 | |
| REBELUnlearning technique=AltPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 30 | |
| REBELUnlearning technique=IdkDPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 22 | |
| REBELUnlearning technique=IdkNLL, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 22 | |
| Leak@1000Unlearning technique=NPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 18.75 | |
| Leak@10Unlearning technique=SimNPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 18.5 | |
| Leak@500Unlearning technique=NPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 17.75 | |
| REBELUnlearning technique=RMU, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 16.5 | |
| Leak@100Unlearning technique=NPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 14.75 | |
| Leak@1000Unlearning technique=AltPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 13.25 | |
| Leak@500Unlearning technique=AltPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 13 | |
| Leak@100Unlearning technique=AltPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 8.75 | |
| REBELUnlearning technique=GradDIFF, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 8.25 | |
| Leak@10Unlearning technique=NPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 7.25 | |
| BaselineUnlearning technique=NPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 4.75 | |
| Leak@1000Unlearning technique=IdkDPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 4.75 | |
| Leak@500Unlearning technique=IdkDPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 4.5 | |
| Leak@10Unlearning technique=AltPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 3.75 | |
| Leak@1000Unlearning technique=IdkNLL, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 3.25 | |
| Leak@100Unlearning technique=IdkDPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 2.75 | |
| Leak@500Unlearning technique=IdkNLL, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 2.75 | |
| BaselineUnlearning technique=SimNPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 2 | |
| Leak@500Unlearning technique=GradDIFF, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 1.75 | |
| Leak@1000Unlearning technique=GradDIFF, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 1.75 | |
| Leak@1000Unlearning technique=RMU, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 1.75 | |
| BaselineUnlearning technique=AltPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 1.5 | |
| Leak@500Unlearning technique=RMU, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 1.25 | |
| Leak@100Unlearning technique=IdkNLL, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 1 | |
| Leak@10Unlearning technique=IdkNLL, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.75 | |
| Leak@100Unlearning technique=RMU, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.75 | |
| BaselineUnlearning technique=IdkNLL, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.5 | |
| Leak@10Unlearning technique=IdkDPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.5 | |
| Leak@100Unlearning technique=GradDIFF, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.5 | |
| BaselineUnlearning technique=RMU, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.25 | |
| Leak@10Unlearning technique=RMU, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0.25 | |
| BaselineUnlearning technique=IdkDPO, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0 | |
| BaselineUnlearning technique=GradDIFF, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0 | |
| Leak@10Unlearning technique=GradDIFF, Target model=Llama-3.1-1B-Instruct, Hacker model=Qwen2.5-7B-Instruct, Judge model=Qwen2.5-7B-Instruct2026.02 | 0 |