Question Answering on HotpotQA (Tool Use Evaluation)
42.2EMUALA-S+Oracle
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UALA-S+OracleBackbone=LLaMA2-70B2024.01 | 42.2 | 350 | |
| UALA-S+OracleBackbone=ChatGPT2024.01 | 41.4 | 403 | |
| UALA-M+BackoffBackbone=ChatGPT2024.01 | 41.3 | 1,183 | |
| UALA-M+BackoffBackbone=LLaMA2-70B2024.01 | 40.2 | 925 | |
| UALA-MBackbone=ChatGPT2024.01 | 39.8 | 1,183 | |
| Self-ConsistencyBackbone=ChatGPT2024.01 | 39.4 | 0 | |
| UALA-S+BackoffBackbone=ChatGPT2024.01 | 39.2 | 403 | |
| UALA-MBackbone=LLaMA2-70B2024.01 | 38.4 | 925 | |
| UALA-SBackbone=ChatGPT2024.01 | 38.2 | 403 | |
| Self-ConsistencyBackbone=LLaMA2-70B2024.01 | 37.4 | 0 | |
| UALA-S+BackoffBackbone=LLaMA2-70B2024.01 | 37.3 | 350 | |
| ReAct+BackoffBackbone=LLaMA2-70B2024.01 | 37 | 2,094 | |
| UALA-SBackbone=LLaMA2-70B2024.01 | 36.4 | 350 | |
| CoTBackbone=LLaMA2-70B2024.01 | 35.6 | 0 | |
| ReAct+BackoffBackbone=ChatGPT2024.01 | 35.4 | 2,114 | |
| CoTBackbone=ChatGPT2024.01 | 34.8 | 0 | |
| ReActBackbone=LLaMA2-70B2024.01 | 32.4 | 2,094 | |
| ReActBackbone=ChatGPT2024.01 | 32 | 2,114 | |
| StandardBackbone=LLaMA2-70B2024.01 | 30 | 0 | |
| StandardBackbone=ChatGPT2024.01 | 29.8 | 0 |