Tool-use Planning on ToolBench Average over all sets
86.54Win RateGPT4 TOPGUN
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT4 TOPGUNReference=ChatGPT REACT2024.02 | 86.54 | |
| GPT4 TOPGUNReference=T.LLAMA REACT2024.02 | 84.61 | |
| GPT4 TOPGUNReference=GPT4 ReACT2024.02 | 80.27 | |
| GPT4 TOPGUNReference=T.LLAMA DFSDT+Ret2024.02 | 79.44 | |
| GPT4 TOPGUNReference=ChatGPT DFSDT2024.02 | 78.71 | |
| GPT4 TOPGUNReference=GPT4 DFSDT2024.02 | 78.59 | |
| GPT4 TOPGUNReference=T.LLAMA DFSDT2024.02 | 78.44 | |
| GPT4 DFSDTReference=ChatGPT REACT2024.02 | 70.4 | |
| ChatGPT DFSDTReference=ChatGPT REACT2024.02 | 64.3 | |
| GPT4 ReACTReference=ChatGPT REACT2024.02 | 64 | |
| T.LLAMA DFSDT+RetReference=ChatGPT REACT2024.02 | 63.1 | |
| T.LLAMA DFSDTReference=ChatGPT REACT2024.02 | 60 | |
| T.LLAMA REACTReference=ChatGPT REACT2024.02 | 47 |