Multi-hop Knowledge Editing on MQUAKE-CF-3K (1 edited)
67.27AccuracyPokeMQA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PokeMQABackbone=GPT-3.5-turbo-instruct, Model Size=Undisclosed, Prompting Style=Question decomposition2023.12 | 67.27 | 56.37 | |
| MeLLoBackbone=GPT-3.5-turbo-instruct, Model Size=Undisclosed, Prompting Style=Question decomposition2023.12 | 57.43 | 28.8 | |
| PokeMQABackbone=Vicuna, Model Size=7B, Prompting Style=Question decomposition2023.12 | 45.83 | 34.8 | |
| PokeMQABackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 44.13 | 30.6 | |
| MeLLoBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 33.57 | 9.9 | |
| FTBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 28.2 | 7.3 | |
| MeLLoBackbone=Vicuna, Model Size=7B, Prompting Style=Question decomposition2023.12 | 22.7 | 7.03 | |
| FTBackbone=LLaMa-2, Model Size=7B, Prompting Style=Chain-of-thought2023.12 | 22.3 | — | |
| MEMITBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 14.97 | 6.43 | |
| ROMEBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 13.13 | 5.37 | |
| MEMITBackbone=LLaMa-2, Model Size=7B, Prompting Style=Chain-of-thought2023.12 | 11.83 | — | |
| ROMEBackbone=LLaMa-2, Model Size=7B, Prompting Style=Chain-of-thought2023.12 | 11.17 | — |