Tool Calling on ToolBench generalization dataset (I2-Cat)
51.96SoPRToolGen*
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ToolGen*2026.01 | 51.96 | 37.9 | — | |
| GPT-3.5*Setting=Retrieval2026.01 | 46.51 | 54.81 | — | |
| ToolWeaver2026.01 | 46.24 | 35.48 | — | |
| ToolGen2026.01 | 45.56 | 37.9 | — | |
| ToolLlama*Setting=Retrieval2026.01 | 45.43 | 44.35 | — | |
| GPT-4o-miniSetting=Retrieval2026.01 | 39.38 | 42.74 | — | |
| ToolLlama-2Setting=Retrieval2026.01 | 19.09 | 20.16 | — | |
| Base RetrieverBase Model=Qwen3-30B, Inference Pipeline=ReAct2026.01 | — | — | 51.9 | |
| Q2DBase Model=Qwen3-30B, Inference Pipeline=ReAct2026.01 | — | — | 51.6 | |
| Q2EBase Model=Qwen3-30B, Inference Pipeline=ReAct2026.01 | — | — | 48.3 | |
| Q2PBase Model=Qwen3-30B, Inference Pipeline=ReAct2026.01 | — | — | 51.9 | |
| Re-InvokeBase Model=Qwen3-30B, Inference Pipeline=ReAct2026.01 | — | — | 57.9 | |
| TOOLQPBase Model=Qwen3-30B, Inference Pipeline=ReAct2026.01 | — | — | 60.2 |