Tool Use Accuracy on Seen Tools
100SRtChatHuman
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ChatHuman2024.05 | 100 | 97.3 | 95.1 | 96.6 | 97.4 | |
| ChatHumanBackbone=LLaVA-1.5-7B2024.05 | 100 | 97.4 | 95 | 97 | 97.5 | |
| Ours w/ GPT-4LLM Backbone=GPT-42024.05 | 95.3 | 92 | 73.2 | 75.1 | 87.5 | |
| Visual ChatGPT-4Model Version=GPT-42024.05 | 89.2 | 80.2 | 71.5 | 75.3 | 79.7 | |
| GPT4Tools-FTFine-tuned=true2024.05 | 82.5 | 71 | 68.7 | 69 | 74.1 | |
| GPT4ToolsFine-tuned=false2024.05 | 60.9 | 54.7 | 52.5 | 52 | 56.6 | |
| Visual ChatGPT-3.5Model Version=GPT-3.52024.05 | 49.8 | 31.9 | 23.7 | 25.1 | 79.1 |