Tool Use on Tool-use domain Subset 1
99.63FuncLearn from Subset 0
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Learn from Subset 0Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 99.63 | 88.83 | |
| Learn from Subset 1Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 99.63 | 87.52 | |
| Learn from Subset 2Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 99.63 | 87.71 | |
| Learn from Subset 3Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 99.63 | 88.83 | |
| CL from Subset 0 & 1Base Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 99.63 | 89.57 | |
| CL from Subset 0, 1 & 2Base Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 99.63 | 89.01 | |
| Agent-DiceBase Model=Qwen3-8B2026.01 | 99.63 | 90.69 | |
| Zero-ShotBase Model=Qwen3-8B, Learning Protocol=Zero-Shot2026.01 | 99.26 | 85.66 | |
| CL from all SubsetsBase Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 98.88 | 88.64 | |
| Learn from Subset 3Base Model=Llama-3.1-8B2026.01 | 98.88 | 83.05 | |
| Agent-DiceBase Model=Llama-3.1-8B2026.01 | 98.14 | 85.47 | |
| Learn from Subset 0Base Model=Llama-3.1-8B2026.01 | 97.77 | 82.31 | |
| CL from Subset 0 & 1Base Model=Llama-3.1-8B2026.01 | 97.4 | 83.24 | |
| Learn from Subset 2Base Model=Llama-3.1-8B2026.01 | 96.65 | 76.54 | |
| CL from all SubsetsBase Model=Llama-3.1-8B2026.01 | 94.42 | 82.5 | |
| CL from Subset 0, 1 & 2Base Model=Llama-3.1-8B2026.01 | 93.31 | 76.72 | |
| Learn from Subset 1Base Model=Llama-3.1-8B2026.01 | 91.45 | 73.37 | |
| Zero-ShotBase Model=Llama-3.1-8B2026.01 | 14.87 | 6.89 |