Agentic Performance on TAU-2 Bench
47.5Airline ScoreQwen3-235B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen3-235Bfull_name=Qwen3-235B-A22B-Instruct, setting=non-thinking, using_tools=true, eval_protocol=Avg@4, user_simulator=Kimi-K2-Instruct2026.01 | 47.5 | 37.7 | 68 | 49.7 | |
| SYNTHAGENT-14Bsetting=non-thinking, using_tools=true, eval_protocol=Avg@4, user_simulator=Kimi-K2-Instruct, training_strategy=synthetic training2026.01 | 40 | 44.7 | 58.6 | 46.3 | |
| SYNTHAGENT-8Bsetting=non-thinking, using_tools=true, eval_protocol=Avg@4, user_simulator=Kimi-K2-Instruct, training_strategy=synthetic training2026.01 | 34.5 | 38.2 | 57.2 | 42.9 | |
| Qwen3-32Bsetting=non-thinking, using_tools=true, eval_protocol=Avg@4, user_simulator=Kimi-K2-Instruct2026.01 | 22.5 | 27.6 | 44.7 | 36 | |
| Qwen3-14Bsetting=non-thinking, using_tools=true, eval_protocol=Avg@4, user_simulator=Kimi-K2-Instruct2026.01 | 22 | 25.4 | 39.5 | 30.6 | |
| ToolStar-14Bsetting=non-thinking, using_tools=true, eval_protocol=Avg@4, user_simulator=Kimi-K2-Instruct2026.01 | 18 | 30.7 | 40.4 | 35.7 | |
| ToolStar-8Bsetting=non-thinking, using_tools=true, eval_protocol=Avg@4, user_simulator=Kimi-K2-Instruct2026.01 | 13.5 | 25.9 | 39.5 | 31.7 |