Factual Recall on Factual recall GPT-2 small (n=500)
81.6Top-1 AccuracyIGSD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| IGSDK=8, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=swap (IGSD)2026.06 | 81.6 | 76.4 | |
| Zero-ablationK=8, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=zero2026.06 | 81.4 | 63.6 | |
| MagnitudeK=8, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=magnitude2026.06 | 81.4 | 63.6 | |
| Zero-ablationK=4, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=zero2026.06 | 78 | 44.9 | |
| IGSDK=4, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=swap (IGSD)2026.06 | 75.4 | 50.2 | |
| IGSDK=2, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=swap (IGSD)2026.06 | 70 | 78.5 | |
| RandomK=8, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=random2026.06 | 67.7 | 40 | |
| MagnitudeK=2, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=magnitude2026.06 | 64.2 | 37.6 | |
| MagnitudeK=4, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=magnitude2026.06 | 64.2 | 36 | |
| RandomK=4, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=random2026.06 | 63.1 | 35.6 | |
| RandomK=2, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=random2026.06 | 59.5 | 26.7 | |
| Zero-ablationK=2, Model=GPT-2 small, Ablation Strategy=zero-ablating the rest, Ranking Criterion=zero2026.06 | 57.4 | 26.4 |