Multi-hop Knowledge Editing on MQUAKE-T (1 edited)
97.7AccuracyMeLLo
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MeLLoBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 97.7 | 0.21 | |
| MeLLoBackbone=GPT-3.5-turbo-instruct, Model Size=Undisclosed, Prompting Style=Question decomposition2023.12 | 88.12 | 52.84 | |
| PokeMQABackbone=GPT-3.5-turbo-instruct, Model Size=Undisclosed, Prompting Style=Question decomposition2023.12 | 76.98 | 68.09 | |
| PokeMQABackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 75.43 | 60.44 | |
| PokeMQABackbone=Vicuna, Model Size=7B, Prompting Style=Question decomposition2023.12 | 74.57 | 55.19 | |
| FTBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 56.48 | 33.89 | |
| FTBackbone=LLaMa-2, Model Size=7B, Prompting Style=Chain-of-thought2023.12 | 47.32 | — | |
| MeLLoBackbone=Vicuna, Model Size=7B, Prompting Style=Question decomposition2023.12 | 42.24 | 1.12 | |
| MEMITBackbone=LLaMa-2, Model Size=7B, Prompting Style=Chain-of-thought2023.12 | 36.88 | — | |
| MEMITBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 30.89 | 23.98 | |
| ROMEBackbone=LLaMa-2, Model Size=7B, Prompting Style=Chain-of-thought2023.12 | 28.96 | — | |
| ROMEBackbone=LLaMa-2, Model Size=7B, Prompting Style=Question decomposition2023.12 | 24.89 | 17.99 |