Tool Misuse on Single-Agent Evaluation Set
1R@5Query+
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Query+Model=GPT-4o2026.01 | 1 | 0.78 | — | — | |
| CEM AttackModel=GPT-4o2026.01 | 1 | 0.83 | — | — | |
| Query+Model=GPT-4o-mini2026.01 | 1 | 0.78 | — | — | |
| CEM AttackModel=GPT-4o-mini2026.01 | 1 | 0.83 | — | — | |
| fusion attackModel=GPT-4o-mini2026.01 | 1 | 0.87 | — | — | |
| fusion attackModel=GPT-4o2026.01 | 0.98 | 0.87 | — | — | |
| IdealModel=GPT-4o2026.01 | — | — | 100 | 100 |