Agentic Dialogue on τ-Bench (test)
60.4Retail AccuracyGPT-4o-2024-11-20
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-4o-2024-11-202025.08 | 60.4 | 42 | 51.2 | |
| Llama3.1-70B-Inst2025.08 | 50.4 | 26 | 38.2 | |
| ToolACE-MT2025.08 | 25.2 | 16 | 20.6 | |
| ToolACE-MTAblation=Without Offline Verification2025.08 | 22.6 | 6 | 14.3 | |
| Multi-Agent Simulation2025.08 | 21.7 | 10 | 15.9 | |
| ToolACE-MTAblation=Without Iterative Refinement2025.08 | 9.5 | 6 | 7.8 | |
| Llama3.1-8B-Inst2025.08 | 6.1 | 26 | 16.1 |