Tool Use on Tool-use domain Aggregate
0.79AvgZ ScoreAgent-Dice
Evaluation Results
| Method | Links | |
|---|---|---|
| Agent-DiceBase Model=Qwen3-8B2026.01 | 0.79 | |
| Agent-DiceBase Model=Llama-3.1-8B2026.01 | 0.51 | |
| CL from Subset 0, 1 & 2Base Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 0.48 | |
| Learn from Subset 0Base Model=Llama-3.1-8B2026.01 | 0.45 | |
| CL from Subset 0 & 1Base Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 0.44 | |
| CL from Subset 0 & 1Base Model=Llama-3.1-8B2026.01 | 0.4 | |
| Learn from Subset 3Base Model=Llama-3.1-8B2026.01 | 0.39 | |
| CL from all SubsetsBase Model=Llama-3.1-8B2026.01 | 0.38 | |
| Learn from Subset 2Base Model=Llama-3.1-8B2026.01 | 0.29 | |
| Learn from Subset 3Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 0.28 | |
| Learn from Subset 0Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 0.27 | |
| CL from Subset 0, 1 & 2Base Model=Llama-3.1-8B2026.01 | 0.26 | |
| Learn from Subset 1Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | 0.13 | |
| Learn from Subset 1Base Model=Llama-3.1-8B2026.01 | 0.13 | |
| CL from all SubsetsBase Model=Qwen3-8B, Learning Protocol=Continual Learning2026.01 | 0.06 | |
| Learn from Subset 2Base Model=Qwen3-8B, Learning Protocol=Single-Subset Training2026.01 | -1.02 | |
| Zero-ShotBase Model=Qwen3-8B, Learning Protocol=Zero-Shot2026.01 | -1.42 | |
| Zero-ShotBase Model=Llama-3.1-8B2026.01 | -2.81 |