Model Editing on CounterFact (Comprehensive Evaluation)
79.4ReliabilityCrispEdit
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| CrispEditEvaluation Context=QA Context, Time=3m 17s, Evaluation Protocol=WILD2026.02 | 79.4 | 55.9 | 69.3 | 67.5 | 49.5 | 54 | 76.5 | |
| AlphaEditEvaluation Context=QA Context, Time=5h 56m, Evaluation Protocol=WILD2026.02 | 74.9 | 57 | 47.4 | 32.9 | 41.5 | 40.5 | 37.5 | |
| CrispEdit-SeqEvaluation Context=QA Context, Time=34m 39s, Evaluation Protocol=WILD2026.02 | 66.5 | 43.8 | 67.9 | 68.5 | 56.6 | 54 | 73 | |
| LocBF-FTEvaluation Context=QA Context, Time=14m 40s, Evaluation Protocol=WILD2026.02 | 61.1 | 41.6 | 69.4 | 65 | 51.3 | 52.5 | 74 | |
| AlphaEditEvaluation Context=No Context, Time=5h 56m, Evaluation Protocol=WILD2026.02 | 50.5 | 44.1 | 47.4 | 32.9 | 41.5 | 40.5 | 37.5 | |
| CrispEdit-SeqEvaluation Context=No Context, Time=34m 39s, Evaluation Protocol=WILD2026.02 | 39.1 | 29.2 | 67.9 | 68.5 | 56.6 | 54 | 73 | |
| CrispEditEvaluation Context=No Context, Time=3m 17s, Evaluation Protocol=WILD2026.02 | 38.4 | 32.4 | 69.3 | 67.5 | 49.5 | 54 | 76.5 | |
| Adam-NSCLEvaluation Context=QA Context, Time=24m 9s, Evaluation Protocol=WILD2026.02 | 19.1 | 8.5 | 68.6 | 22.8 | 57.1 | 39.5 | 16.5 | |
| FT SequentialEvaluation Context=QA Context, Time=6m 45s, Evaluation Protocol=WILD2026.02 | 19.1 | 10.6 | 33.4 | 20.4 | 51.3 | 31.5 | 0 | |
| UltraEditEvaluation Context=QA Context, Time=3m 9s, Evaluation Protocol=WILD2026.02 | 18.1 | 12.4 | 69.2 | 68.6 | 49.2 | 52 | 74 | |
| LoRAEvaluation Context=QA Context, Time=51m 34s, Evaluation Protocol=WILD2026.02 | 13.2 | 8.3 | 68.2 | 68.8 | 53.4 | 53 | 71 | |
| FTEvaluation Context=QA Context, Time=4m 12s, Evaluation Protocol=WILD2026.02 | 12.3 | 6 | 67.4 | 22.7 | 50.4 | 40 | 18 | |
| LocBF-FTEvaluation Context=No Context, Time=14m 40s, Evaluation Protocol=WILD2026.02 | 10.9 | 13.3 | 69.4 | 65 | 51.3 | 52.5 | 74 | |
| UltraEditEvaluation Context=No Context, Time=3m 9s, Evaluation Protocol=WILD2026.02 | 10.2 | 9.3 | 69.2 | 68.6 | 49.2 | 52 | 74 | |
| LoRAEvaluation Context=No Context, Time=51m 34s, Evaluation Protocol=WILD2026.02 | 9.5 | 2.7 | 68.2 | 68.8 | 53.4 | 53 | 71 | |
| LoRA SequentialEvaluation Context=QA Context, Time=2h 16m, Evaluation Protocol=WILD2026.02 | 6.5 | 4.8 | 67.3 | 62.4 | 53.9 | 40 | 71 | |
| Adam-NSCLEvaluation Context=No Context, Time=24m 9s, Evaluation Protocol=WILD2026.02 | 1.7 | 1.8 | 68.6 | 22.8 | 57.1 | 39.5 | 16.5 | |
| FTEvaluation Context=No Context, Time=4m 12s, Evaluation Protocol=WILD2026.02 | 1.6 | 2.2 | 67.4 | 22.7 | 50.4 | 40 | 18 | |
| LoRA SequentialEvaluation Context=No Context, Time=2h 16m, Evaluation Protocol=WILD2026.02 | 1.6 | 2 | 67.3 | 62.4 | 53.9 | 40 | 71 | |
| FT SequentialEvaluation Context=No Context, Time=6m 45s, Evaluation Protocol=WILD2026.02 | 1.3 | 2.2 | 33.4 | 20.4 | 51.3 | 31.5 | 0 | |
| LLaMA-3-8B-InstructEvaluation Context=QA Context, Evaluation Protocol=WILD2026.02 | 1.2 | 1 | 69.5 | 69.3 | 50.7 | 58 | 73.5 | |
| LLaMA-3-8B-InstructEvaluation Context=No Context, Evaluation Protocol=WILD2026.02 | 0.3 | 0.6 | 69.5 | 69.3 | 50.7 | 58 | 73.5 | |
| MEMITEvaluation Context=QA Context, Time=7h 30m, Evaluation Protocol=WILD2026.02 | 0 | 0 | 24.6 | 18.6 | 49.6 | 21 | 0 | |
| MEMITEvaluation Context=No Context, Time=7h 30m, Evaluation Protocol=WILD2026.02 | 0 | 0 | 24.6 | 18.6 | 49.6 | 21 | 0 | |
| MENDEvaluation Context=QA Context, Time=17m 42s, Evaluation Protocol=WILD2026.02 | 0 | 0 | 22.9 | 18.2 | 0 | 26 | 0 | |
| MENDEvaluation Context=No Context, Time=17m 42s, Evaluation Protocol=WILD2026.02 | 0 | 0 | 22.9 | 18.2 | 0 | 26 | 0 |