Machine Unlearning on TOFU Llama-2-7b Llama-3.2-1B (forget)
0FKM (Knowledge Memorization Probe)GradDiff+RT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GradDiff+RTRetain Training=true2026.05 | 0 | 0.625 | 99.7 | |
| CEU+RTRetain Training=true2026.05 | 0.002 | 0.63 | 97.3 | |
| SHRED2026.05 | 0.055 | 0.637 | -38.6 | |
| Target (retrained)Condition=Retrained oracle2026.05 | 0.148 | 0.612 | 0 | |
| DPO+RTRetain Training=true2026.05 | 0.162 | 0.606 | -19.2 | |
| GradAscent2026.05 | 0.181 | 0.454 | -93.6 | |
| NPO+RTRetain Training=true2026.05 | 0.294 | 0.557 | -91.1 | |
| SimNPO+RTRetain Training=true2026.05 | 0.663 | 0.613 | -97.4 | |
| RMU+RTRetain Training=true2026.05 | 0.823 | 0.608 | -99.6 | |
| Full (pre-unlearn)Condition=Pre-unlearn2026.05 | 0.99 | 0.627 | -99.5 |