Question Answering on MMLU (Tool Use Evaluation)
75.8EMUALA-S+Oracle
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UALA-S+OracleBackbone=ChatGPT2024.01 | 75.8 | 662 | |
| UALA-M+BackoffBackbone=ChatGPT2024.01 | 72.2 | 641 | |
| UALA-S+BackoffBackbone=ChatGPT2024.01 | 71.4 | 662 | |
| UALA-S+OracleBackbone=LLaMA2-70B2024.01 | 70.5 | 1,354 | |
| UALA-M+BackoffBackbone=LLaMA2-70B2024.01 | 70.3 | 1,196 | |
| Self-ConsistencyBackbone=ChatGPT2024.01 | 70 | 0 | |
| UALA-SBackbone=ChatGPT2024.01 | 69.8 | 662 | |
| UALA-S+BackoffBackbone=LLaMA2-70B2024.01 | 69.8 | 1,354 | |
| StandardBackbone=ChatGPT2024.01 | 69 | 0 | |
| UALA-MBackbone=ChatGPT2024.01 | 67.9 | 641 | |
| Self-ConsistencyBackbone=LLaMA2-70B2024.01 | 67.2 | 0 | |
| StandardBackbone=LLaMA2-70B2024.01 | 64.7 | 0 | |
| ReAct+BackoffBackbone=LLaMA2-70B2024.01 | 62.8 | 2,808 | |
| ReAct+BackoffBackbone=ChatGPT2024.01 | 59.8 | 1,824 | |
| UALA-SBackbone=LLaMA2-70B2024.01 | 56.7 | 1,354 | |
| UALA-MBackbone=LLaMA2-70B2024.01 | 56.7 | 1,196 | |
| ReActBackbone=ChatGPT2024.01 | 55.8 | 1,824 | |
| CoTBackbone=ChatGPT2024.01 | 49.1 | 0 | |
| CoTBackbone=LLaMA2-70B2024.01 | 39.3 | 0 | |
| ReActBackbone=LLaMA2-70B2024.01 | 30.7 | 2,808 |