Theory of Mind reasoning on ToMI (All)
87.8Accuracygpt-4
Evaluation Results
| Method | Links | |
|---|---|---|
| gpt-4Prompting strategy=SIMTOM2023.11 | 87.8 | |
| gpt-4Prompting strategy=0-shot CoT2023.11 | 74.4 | |
| gpt-3.5-turboPrompting strategy=SIMTOM2023.11 | 72.8 | |
| gpt-3.5-turboPrompting strategy=0-Shot2023.11 | 68.6 | |
| gpt-4Prompting strategy=0-Shot2023.11 | 66.5 | |
| gpt-3.5-turboPrompting strategy=0-shot CoT2023.11 | 64.1 | |
| Llama2-13b-chatPrompting strategy=SIMTOM2023.11 | 61.1 | |
| Llama2-13b-chatPrompting strategy=0-Shot2023.11 | 51 | |
| Llama2-7b-chatPrompting strategy=SIMTOM2023.11 | 48.1 | |
| Llama2-13b-chatPrompting strategy=0-shot CoT2023.11 | 45 | |
| Llama2-7b-chatPrompting strategy=0-Shot2023.11 | 44.5 | |
| Llama2-7b-chatPrompting strategy=0-shot CoT2023.11 | 43.7 |