Model Editing on CounterFact (Efficacy, Paraphrase, Specificity, Avg.)
98.1EfficacyFT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| FTBase Model=GPT-J2025.10 | 98.1 | 69.4 | 82.7 | 1.59 | |
| FTBase Model=Qwen3-8B2025.10 | 97.9 | 64.2 | 77.4 | 1.04 | |
| ACEBase Model=Qwen3-8B2025.10 | 91.2 | 80.7 | 74.6 | 54.27 | |
| ACEBase Model=GPT-J2025.10 | 89.7 | 83.6 | 70.6 | 43.58 | |
| PMETBase Model=GPT-J2025.10 | 74.6 | 63.2 | 64.1 | 31.07 | |
| PMETBase Model=Qwen3-8B2025.10 | 70.7 | 61.7 | 51.9 | 17.26 | |
| MEMITBase Model=GPT-J2025.10 | 57 | 51.9 | 66.2 | 30.09 | |
| ROMEBase Model=GPT-J2025.10 | 54.1 | 54.3 | 61.4 | 27.48 | |
| MEMITBase Model=Qwen3-8B2025.10 | 50.3 | 53.6 | 66.4 | 10.27 | |
| ROMEBase Model=Qwen3-8B2025.10 | 45.2 | 42.9 | 53.7 | 24.08 |