Multi-hop Knowledge Editing on MQUAKE-T (All edited)
78.16AccuracyPokeMQA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PokeMQABackbone=GPT-3.5-turbo-instruct, Model Size=Undisclosed, Prompting Style=Question decomposition2023.12 | 78.16 | 67.88 | |
| MeLLoBackbone=GPT-3.5-turbo-instruct, Model Size=Undisclosed, Prompting Style=Question decomposition2023.12 | 74.57 | 53.53 | |
| PokeMQABackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 74.36 | 60.22 | |
| PokeMQABackbone=Vicuna, Model Size=7B, Prompting Style=Question decomposition2023.12 | 73.07 | 55.09 | |
| MeLLoBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 62.58 | 3.96 | |
| MEMITBackbone=LLaMa-2, Model Size=7B, Prompting Style=Chain-of-thought2023.12 | 31.58 | — | |
| MEMITBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 25.21 | 20.13 | |
| MeLLoBackbone=Vicuna, Model Size=7B, Prompting Style=Question decomposition2023.12 | 19.86 | 1.28 | |
| ROMEBackbone=LLaMa-2, Model Size=7B, Prompting Style=Chain-of-thought2023.12 | 14.4 | — | |
| FTBackbone=LLaMa-2, Model Size=7B, Prompting Style=Chain-of-thought2023.12 | 3.75 | — | |
| ROMEBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 1.71 | 0.32 | |
| FTBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 1.02 | 0.37 |