Tool Learning on StableToolBench I2-Inst.
73.4SoPRGPT-4 (Parallel)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4 (Parallel)Backbone=GPT-4, Reasoning Strategy=Parallel2025.01 | 73.4 | 85.8 | |
| GPT-4 (DFSDT)Backbone=GPT-4, Reasoning Strategy=DFSDT2025.01 | 70.8 | 73.6 | |
| DTA-LlamaBackbone=Llama-2-7B, Reasoning Strategy=Parallel, Training Protocol=Fine-tuned on DTA-Tool2025.01 | 62.1 | 70.8 | |
| Qwen2.5 (Parallel)Backbone=Qwen2.5-7B-Instruct, Reasoning Strategy=Parallel2025.01 | 60.2 | 55.6 | |
| GPT-3.5 (DFSDT)Backbone=GPT-3.5, Reasoning Strategy=DFSDT2025.01 | 57.1 | 72.6 | |
| GPT-3.5 (Parallel)Backbone=GPT-3.5, Reasoning Strategy=Parallel2025.01 | 54.9 | 55.7 | |
| GPT-4 (ReAct)Backbone=GPT-4, Reasoning Strategy=ReAct2025.01 | 50.6 | 69.8 | |
| ToolLLAMA (DFSDT)Backbone=Llama-2-7B, Reasoning Strategy=DFSDT2025.01 | 49.7 | 53.8 | |
| ToolLLAMA (ReAct)Backbone=Llama-2-7B, Reasoning Strategy=ReAct2025.01 | 39.9 | 49.1 | |
| GPT-3.5 (ReAct)Backbone=GPT-3.5, Reasoning Strategy=ReAct2025.01 | 37.6 | — | |
| LLMCompilerBackbone=Llama-2-7B, Reasoning Strategy=Parallel2025.01 | 37.5 | 45.6 | |
| ToolLLaMA† (DFSDT)Backbone=Llama-2-7B, Reasoning Strategy=DFSDT, Training Protocol=DTA-Tool*2025.01 | 36 | 47.2 | |
| ToolLLaMA† (ReAct)Backbone=Llama-2-7B, Reasoning Strategy=ReAct, Training Protocol=DTA-Tool*2025.01 | 23.1 | 32.1 |