Knowledge Editing on Counterfact (first 2000 edits)
99.95AccuracyROME
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| ROMEModel=LLaMA 2-7b2025.03 | 99.95 | 68.2 | 93.48 | — | — | — | — | — | |
| MEMIT+FEModel=Llama3-8b-instruct2026.05 | 99.8 | 93 | 0.34 | 99.9 | 61 | 82.7 | 78.8 | 77.8 | |
| ROMEModel=GPT2-XL2025.03 | 99.55 | 73.7 | 82.67 | — | — | — | — | — | |
| SAKEModel=LLaMA 2-7b2025.03 | 97.7 | 82.03 | 85.59 | — | — | — | — | — | |
| SAKEModel=GPT2-XL2025.03 | 97 | 84.85 | 84.52 | — | — | — | — | — | |
| BLUEModel=Llama3-8b-instruct2026.05 | 96.9 | 90 | 0.35 | 98.4 | 60.1 | 81 | 77.8 | 77.2 | |
| PRUNEModel=Llama3-8b-instruct2026.05 | 94.4 | 78.7 | 0.43 | 97.4 | 47.9 | 76.8 | 74.8 | 73.8 | |
| MEMITModel=Llama3-8b-instruct2026.05 | 94.3 | 78.7 | 0.41 | 97.4 | 48 | 77.5 | 75.2 | 74.4 | |
| RECTModel=Llama3-8b-instruct2026.05 | 93.4 | 77.7 | 0.42 | 96.9 | 46.7 | 76.9 | 75.1 | 74.1 | |
| ActAddModel=LLaMA 2-7b2025.03 | 90.1 | 33.65 | 81.45 | — | — | — | — | — | |
| AlphaeditModel=Llama3-8b-instruct2026.05 | 89 | 76.3 | 0.63 | 95.2 | 44.4 | 71.2 | 68.9 | 67.9 | |
| ActAddModel=GPT2-XL2025.03 | 85 | 29.78 | 82.75 | — | — | — | — | — | |
| MEMITModel=LLaMA 2-7b2025.03 | 74.4 | 55.13 | 74.37 | — | — | — | — | — | |
| MEMITModel=GPT2-XL2025.03 | 60 | 36.6 | 67.21 | — | — | — | — | — | |
| OneLayerModel=Llama3-8b-instruct2026.05 | 59.7 | 48.3 | 0.28 | 76.2 | 21 | 80.5 | 77.4 | 76.5 | |
| RLEditModel=Llama3-8b-instruct2026.05 | 23.1 | 51.5 | 5.62 | 57.8 | 17.8 | 25.7 | 8.6 | 9.8 | |
| WISEModel=Llama3-8b-instruct2026.05 | 2.3 | 11.8 | 0.09 | 18 | 0.8 | 97.7 | 97.5 | 97.4 |