Multihop Question Answering on HotpotQA (F1, EM)
62.5F1Reflexion
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ReflexionModel=GPT-4o, #Tokens=37893.02025.07 | 62.5 | 46.7 | |
| DeepSieveModel=GPT-4o, #Tokens=3926.62025.07 | 61.7 | 49.3 | |
| ReWOOModel=GPT-4o, #Tokens=1986.22025.07 | 40.1 | 30.4 | |
| ReActModel=GPT-4o, #Tokens=9795.12025.07 | 39.6 | 32.2 | |
| DirectModel=GPT-4o, #Tokens=55.52025.07 | 36.2 | 28 | |
| CoTModel=GPT-4o, #Tokens=481.92025.07 | 30.8 | 22.4 |