Tool Use on Tool-use domain Subset 3
100Functionality ScoreLearn from Subset 0
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Learn from Subset 0Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 100 | 91.35 | |
| CL from Subset 0, 1 & 2Base Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 100 | 91.68 | |
| Agent-DiceBase Model=Qwen3-8B2026.01 | 100 | 92.18 | |
| Learn from Subset 1Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 99.64 | 90.52 | |
| Learn from Subset 3Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 99.64 | 89.85 | |
| CL from Subset 0 & 1Base Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 99.64 | 91.18 | |
| CL from all SubsetsBase Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 99.64 | 90.68 | |
| Zero-ShotBase Model=Qwen3-8B, Learning Protocol=Zero-Shot2026.01 | 99.28 | 86.36 | |
| Learn from Subset 2Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 98.57 | 90.35 | |
| Learn from Subset 0Base Model=Llama-3.1-8B2026.01 | 98.57 | 85.19 | |
| Agent-DiceBase Model=Llama-3.1-8B2026.01 | 98.21 | 87.02 | |
| CL from all SubsetsBase Model=Llama-3.1-8B2026.01 | 97.49 | 83.19 | |
| Learn from Subset 2Base Model=Llama-3.1-8B2026.01 | 96.77 | 80.37 | |
| CL from Subset 0 & 1Base Model=Llama-3.1-8B2026.01 | 96.42 | 83.19 | |
| Learn from Subset 3Base Model=Llama-3.1-8B2026.01 | 95.34 | 83.86 | |
| CL from Subset 0, 1 & 2Base Model=Llama-3.1-8B2026.01 | 93.91 | 82.2 | |
| Learn from Subset 1Base Model=Llama-3.1-8B2026.01 | 89.96 | 75.87 | |
| Zero-ShotBase Model=Llama-3.1-8B2026.01 | 10.49 | 10.32 |