Tool Use on Tool-use domain Subset 0
99.64Func Success RateZero-Shot
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Zero-ShotBase Model=Qwen3-8B, Learning Protocol=Zero-Shot2026.01 | 99.64 | 81.85 | |
| Learn from Subset 3Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 99.64 | 85.79 | |
| CL from all SubsetsBase Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 99.64 | 86.13 | |
| Learn from Subset 1Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 99.29 | 86.82 | |
| CL from Subset 0 & 1Base Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 99.29 | 86.3 | |
| CL from Subset 0, 1 & 2Base Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 99.29 | 87.16 | |
| Agent-DiceBase Model=Qwen3-8B2026.01 | 99.29 | 87.33 | |
| Learn from Subset 0Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 98.93 | 85.96 | |
| Learn from Subset 2Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 98.57 | 84.59 | |
| Learn from Subset 0Base Model=Llama-3.1-8B2026.01 | 98.57 | 79.45 | |
| Agent-DiceBase Model=Llama-3.1-8B2026.01 | 97.5 | 84.25 | |
| Learn from Subset 2Base Model=Llama-3.1-8B2026.01 | 96.79 | 74.14 | |
| CL from Subset 0 & 1Base Model=Llama-3.1-8B2026.01 | 95.71 | 79.62 | |
| Learn from Subset 3Base Model=Llama-3.1-8B2026.01 | 95.36 | 78.25 | |
| CL from all SubsetsBase Model=Llama-3.1-8B2026.01 | 95 | 78.94 | |
| CL from Subset 0, 1 & 2Base Model=Llama-3.1-8B2026.01 | 93.57 | 74.14 | |
| Learn from Subset 1Base Model=Llama-3.1-8B2026.01 | 88.57 | 72.95 | |
| Zero-ShotBase Model=Llama-3.1-8B2026.01 | 13.93 | 5.82 |