Tool Use on Tool-use domain Subset 2
99.63Func Success RateCL from all Subsets
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CL from all SubsetsBase Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 99.63 | 88.44 | |
| Learn from Subset 0Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 99.26 | 88.81 | |
| Learn from Subset 3Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 99.26 | 88.62 | |
| CL from Subset 0 & 1Base Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 99.26 | 89.54 | |
| CL from Subset 0, 1 & 2Base Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 99.26 | 88.07 | |
| Agent-DiceBase Model=Qwen3-8B2026.01 | 99.26 | 89.36 | |
| Learn from Subset 1Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 98.89 | 89.36 | |
| Zero-ShotBase Model=Qwen3-8B, Learning Protocol=Zero-Shot2026.01 | 98.52 | 83.85 | |
| Learn from Subset 0Base Model=Llama-3.1-8B2026.01 | 98.52 | 83.67 | |
| Agent-DiceBase Model=Llama-3.1-8B2026.01 | 98.52 | 85.69 | |
| Learn from Subset 2Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 97.79 | 87.52 | |
| Learn from Subset 2Base Model=Llama-3.1-8B2026.01 | 97.05 | 74.5 | |
| Learn from Subset 3Base Model=Llama-3.1-8B2026.01 | 97.05 | 80.55 | |
| CL from Subset 0 & 1Base Model=Llama-3.1-8B2026.01 | 96.31 | 81.1 | |
| CL from all SubsetsBase Model=Llama-3.1-8B2026.01 | 95.94 | 81.1 | |
| CL from Subset 0, 1 & 2Base Model=Llama-3.1-8B2026.01 | 93.73 | 78.53 | |
| Learn from Subset 1Base Model=Llama-3.1-8B2026.01 | 92.62 | 75.05 | |
| Zero-ShotBase Model=Llama-3.1-8B2026.01 | 13.28 | 5.14 |