Secret Data Extraction on 100 Targeted Secrets OKVQA DocVQA VQAv2
100P(s|x) > 0.10 RateDistilGPT-2 (82M)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DistilGPT-2 (82M)Setting=After poisoning2026.06 | 100 | 99 | |
| GPT-2 Small (124M)Setting=After poisoning2026.06 | 100 | 100 | |
| GPT-Neo (125M)Setting=After poisoning2026.06 | 100 | 100 | |
| Pythia (160M)Setting=After poisoning2026.06 | 100 | 100 | |
| OPT (250M)Setting=After poisoning2026.06 | 100 | 100 | |
| GPT-2 Medium (355M)Setting=After poisoning2026.06 | 100 | 100 | |
| Llama2 (7B)Setting=After poisoning, LoRA fine-tuning=true2026.06 | 100 | 100 | |
| Llama2 (13B)Setting=After poisoning, LoRA fine-tuning=true2026.06 | 100 | 99 | |
| Llama3.2 (1B)Setting=After poisoning, LoRA fine-tuning=true2026.06 | 100 | 100 | |
| GPT-2 Medium (355M)Setting=Baseline setting2026.06 | 15 | 1 | |
| OPT (250M)Setting=Baseline setting2026.06 | 10 | 0 | |
| Pythia (160M)Setting=Baseline setting2026.06 | 6 | 0 | |
| GPT-2 Small (124M)Setting=Baseline setting2026.06 | 3 | 0 | |
| DistilGPT-2 (82M)Setting=Baseline setting2026.06 | 2 | 0 | |
| GPT-Neo (125M)Setting=Baseline setting2026.06 | 2 | 0 | |
| Llama2 (7B)Setting=Baseline setting, LoRA fine-tuning=true2026.06 | 0 | 0 | |
| Llama2 (13B)Setting=Baseline setting, LoRA fine-tuning=true2026.06 | 0 | 0 | |
| Llama3.2 (1B)Setting=Baseline setting, LoRA fine-tuning=true2026.06 | 0 | 0 |