Long-Horizon Tool Execution on tau2-Bench
75.2Retail Success RateGPT-5.2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5.2Model Category=Ultra-Scale2026.02 | 75.2 | 50.5 | |
| Qwen3-235B-A22B-InstructModel Category=Ultra-Scale2026.02 | 74.6 | 50 | |
| DeepSeek-V3.1-nothinkModel Category=Ultra-Scale2026.02 | 72.8 | 51.5 | |
| Qwen3-MAXModel Category=Ultra-Scale2026.02 | 71.9 | 57.5 | |
| Kimi-K2-InstructModel Category=Ultra-Scale2026.02 | 70.6 | 56.5 | |
| GLM-4.7Model Category=Ultra-Scale2026.02 | 66 | 64.5 | |
| MagicAgent-32BModel Category=MagicAgent Series2026.02 | 62 | 53 | |
| Qwen3-30B-A3B-InstructModel Category=Large-Scale2026.02 | 57 | 38 | |
| GLM-4.7-FlashModel Category=Large-Scale2026.02 | 54.2 | 55 | |
| MagicAgent-30B-A3BModel Category=MagicAgent Series2026.02 | 53.1 | 55 | |
| Qwen3-32B-nothinkModel Category=Large-Scale2026.02 | 48.8 | 24 | |
| ERNIE-4.5-21B-A3B-PTModel Category=Large-Scale2026.02 | 6.6 | 38.5 |