Interactive Tool-Use Agent Performance on tau2-Bench (Retail, Airline, Telecom)
81.1Retail Performance ScoreGPT-5-think
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GPT-5-think2026.02 | 81.1 | 62.6 | 96.7 | 84.2 | — | |
| GPT-5-thinkingModel Source=Closed-Source Large Language Models2025.12 | 81.1 | 62.6 | 96.7 | — | — | |
| GPT-o32026.02 | 80.2 | 64.8 | 58.2 | 68.4 | — | |
| GPT-o3Model Source=Closed-Source Large Language Models2025.12 | 80.2 | 64.8 | 58.2 | — | — | |
| AgentSkillerParameters=14B, Subset=Full Set (with Cross-Domain Subset)2026.02 | 77.2 | 56 | 91.2 | 79.1 | — | |
| U-FoldModel=Claude-4.5-Sonnet2026.01 | 77.2 | 72 | 45.6 | — | — | |
| AutoForge-30B-A3BModel Source=Open-Source Large Language Models2025.12 | 74.8 | 62 | 76.3 | — | — | |
| ReActModel=Claude-4.5-Sonnet2026.01 | 74.1 | 66.5 | 44.7 | — | 2.8 | |
| Qwen3-235B-A22B-2507zero-shot=true2026.02 | 71.9 | 58.6 | 47.3 | — | — | |
| Qwen3-Thinking-235B-A22BParameters=235B2026.02 | 71.9 | 58 | 45.6 | 58.6 | — | |
| Qwen3-Thinking-235B-A22BModel Source=Open-Source Large Language Models2025.12 | 71.9 | 58 | 45.6 | — | — | |
| IterResearchModel=Claude-4.5-Sonnet2026.01 | 71.1 | 63 | 29 | — | 9.5 | |
| U-FoldModel=GPT-4.12026.01 | 70.8 | 65.5 | 44.7 | — | — | |
| Kimi-K2-0905zero-shot=true2026.02 | 70.6 | 56.5 | 65.8 | — | — | |
| Kimi-K2-1T-A32BParameters=1T2026.02 | 70.6 | 56.5 | 65.8 | 66.1 | — | |
| Kimi-K2-1T-A32BModel Source=Open-Source Large Language Models2025.12 | 70.6 | 56.5 | 65.8 | — | — | |
| ReSumModel=Claude-4.5-Sonnet2026.01 | 70.4 | 65 | 42.1 | — | 7.3 | |
| GPT-o4-mini2026.02 | 70.2 | 56 | 46.5 | 57.9 | — | |
| AgentScaler-30B-A3BParameters=30B2026.02 | 70.2 | 60 | 55.3 | 62.3 | — | |
| U-FoldModel=Qwen3-Thinking-30B-A3B2026.01 | 70.2 | 54 | 28.9 | — | — | |
| ReActModel=GPT-4.12026.01 | 70.2 | 64 | 43.9 | — | 2.5 | |
| GPT-o4-miniModel Source=Closed-Source Large Language Models2025.12 | 70.2 | 56 | 46.5 | — | — | |
| AgentScaler-30B-A3BModel Source=Open-Source Large Language Models2025.12 | 70.2 | 60 | 55.3 | — | — | |
| AgentSkillerParameters=14B, Subset=Single-Domain Subset2026.02 | 69.3 | 44 | 85.1 | 71.2 | — | |
| TopoCurate-RLModel Size=32B, Strategy=RL, Topology Modeling=Enabled2026.03 | 68.7 | 55.8 | 78.4 | — | — | |
| Seed-OSS-36Bzero-shot=true2026.02 | 68.4 | 52 | 41.2 | — | — | |
| Seed-OSS-36BParameters=36B2026.02 | 68.4 | 52 | 41.2 | 54.3 | — | |
| Seed-OSS-36BModel Source=Open-Source Large Language Models2025.12 | 68.4 | 52 | 41.2 | — | — | |
| Gemini-2.5-pro2026.02 | 67.5 | 56 | 27.2 | 48.9 | — | |
| Claude-Sonnet-42026.02 | 67.5 | 54 | 47.4 | 56.8 | — | |
| Gemini-2.5-proModel Source=Closed-Source Large Language Models2025.12 | 67.5 | 56 | 27.2 | — | — | |
| Claude-Sonnet-4Model Source=Closed-Source Large Language Models2025.12 | 67.5 | 54 | 47.4 | — | — | |
| MUA-RL-32BModel Source=Open-Source Large Language Models2025.12 | 67.3 | 45.4 | 28.3 | — | — | |
| MUA-RLModel Size=32B, Strategy=RL2026.03 | 67.3 | 45.4 | 28.3 | — | — | |
| Deepseek-V3.1-671B-A37BParameters=671B2026.02 | 64.9 | 46 | 38.5 | 50.7 | — | |
| U-FoldModel=DeepSeek-V3.2-Exp2026.01 | 64.9 | 68 | 37.7 | — | — | |
| Deepseek-V3.1-671B-A37BModel Source=Open-Source Large Language Models2025.12 | 64.9 | 46 | 38.5 | — | — | |
| TopoCurate-RL (w/o Topology)Model Size=32B, Strategy=RL, Topology Modeling=Disabled2026.03 | 64.3 | 53.1 | 72.1 | — | — | |
| ReSumModel=DeepSeek-V3.2-Exp2026.01 | 64 | 60 | 22.9 | — | 15.8 | |
| Qwen3-SE-32Bzero-shot=true2026.02 | 63.6 | 48 | 30.9 | — | — | |
| ReActModel=DeepSeek-V3.2-Exp2026.01 | 63.2 | 70 | 34.2 | — | 3.4 | |
| IterResearchModel=GPT-4.12026.01 | 62.5 | 55 | 33.3 | — | 13.9 | |
| AgentScaler-4BParameters=4B2026.02 | 62.3 | 56 | 48.2 | 55.4 | — | |
| ReActModel=Qwen3-Thinking-30B-A3B2026.01 | 62.3 | 52 | 30.7 | — | 1.5 | |
| TopoCurate-SFTModel Size=32B, Strategy=SFT, Topology Modeling=Enabled2026.03 | 62.3 | 52.6 | 53.9 | — | — | |
| xLAM-2-70B-fc-rParameters=70B2026.02 | 61.4 | 56 | 14 | 41 | — | |
| xLAM-2-70B-fc-rModel Source=Open-Source Large Language Models2025.12 | 61.4 | 56 | 14 | — | — | |
| AgentSkillerParameters=4B, Subset=Full Set (with Cross-Domain Subset)2026.02 | 60.6 | 54 | 76.6 | 66 | — | |
| Qwen3-Coder-30B-A3BParameters=30B2026.02 | 60.5 | 42 | 30.7 | 45 | — | |
| Qwen-Coder-30B-A3BModel Source=Open-Source Large Language Models2025.12 | 60.5 | 42 | 35.3 | — | — | |
| ToolMind-8BParameters=8B2026.02 | 59.7 | 48 | 31.6 | 46.1 | — | |
| ToolMind-14BParameters=14B2026.02 | 59.7 | 56 | 31.6 | 47.5 | — | |
| AgentSkillerParameters=8B, Subset=Full Set (with Cross-Domain Subset)2026.02 | 59.7 | 46 | 67 | 60.2 | — | |
| Qwen3-32Bzero-shot=true2026.02 | 59.5 | 48 | 27.2 | — | — | |
| APIGen-MT-SFTModel Size=32B, Strategy=SFT2026.03 | 59.2 | 34.7 | 20.2 | — | — | |
| TopoCurate-SFT (w/o Topology)Model Size=32B, Strategy=SFT, Topology Modeling=Disabled2026.03 | 59.1 | 48.3 | 52.1 | — | — | |
| Qwen3-Thinking-30B-A3BParameters=30B2026.02 | 58.8 | 58 | 26.3 | 45.3 | — | |
| AgentScaler-8BParameters=8B2026.02 | 58.8 | 44 | 45.4 | 50.6 | — | |
| Qwen3-Thinking-30B-A3BModel Source=Open-Source Large Language Models2025.12 | 58.8 | 58 | 26.3 | — | — | |
| MUA-SFTModel Size=32B, Strategy=SFT2026.03 | 58.2 | 31.1 | 19.3 | — | — | |
| GPT-OSS-120B-A5Bzero-shot=true2026.02 | 57 | 38 | 45.6 | — | — | |
| GPT-OSS-120B-A5BParameters=120B2026.02 | 57 | 38 | 45.6 | 48.9 | — | |
| MUA-14BParameters=14B, Training=w/ SFT2026.02 | 57 | 42 | 55.3 | 53.6 | — | |
| GPT-OSS-120B-A5BModel Source=Open-Source Large Language Models2025.12 | 57 | 38 | 45.6 | — | — | |
| Qwen3-Thinking-4BParameters=4B2026.02 | 56.1 | 52 | 28.7 | 44.1 | — | |
| xLAM-2-32B-fc-rzero-shot=true2026.02 | 55.3 | 52 | 16.7 | — | — | |
| xLAM-2-8B-fc-rParameters=8B2026.02 | 55.3 | 48 | 11.4 | 36 | — | |
| xLAM-2-32B-fc-rParameters=32B2026.02 | 55.3 | 52 | 16.7 | 38.9 | — | |
| xLAM-2-32B-fc-rModel Source=Open-Source Large Language Models2025.12 | 55.3 | 52 | 16.7 | — | — | |
| TopoCurate-RLModel Size=8B, Strategy=RL, Topology Modeling=Enabled2026.03 | 54.5 | 48.1 | 59.5 | — | — | |
| ReSumModel=GPT-4.12026.01 | 54.2 | 58.5 | 28.1 | — | 12.7 | |
| Simia-Tau-RLModel Size=8B, Strategy=RL2026.03 | 52.9 | 40.5 | 15.6 | — | — | |
| TopoCurate-SFTModel Size=8B, Strategy=SFT, Topology Modeling=Enabled2026.03 | 52.9 | 44.5 | 43.5 | — | — | |
| AgentSkillerParameters=4B, Subset=Single-Domain Subset2026.02 | 52.6 | 34 | 72.6 | 57.5 | — | |
| Qwen3-32B-ThinkingModel Size=32B, Strategy=Thinking2026.03 | 52.5 | 43.5 | 24.8 | — | — | |
| Simia-Tau-SFTModel Size=8B, Strategy=SFT2026.03 | 52.2 | 39.5 | 14.5 | — | — | |
| ReSumModel=Qwen3-Thinking-30B-A3B2026.01 | 51.8 | 48 | 33.3 | — | 6.2 | |
| TopoCurate-RL (w/o Topology)Model Size=8B, Strategy=RL, Topology Modeling=Disabled2026.03 | 51.8 | 46.7 | 53.3 | — | — | |
| AgentSkillerParameters=8B, Subset=Single-Domain Subset2026.02 | 51.3 | 42 | 61.1 | 53.6 | — | |
| Qwen3-SE-8Bzero-shot=true2026.02 | 50.9 | 37.5 | 27.2 | — | — | |
| TopoCurate-SFT (w/o Topology)Model Size=8B, Strategy=SFT, Topology Modeling=Disabled2026.03 | 50 | 43.6 | 41.8 | — | — | |
| MUA-RLModel Size=8B, Strategy=RL2026.03 | 49.8 | 19 | 21.8 | — | — | |
| EnvScaler-14BParameters=14B, Training=w/ SFT2026.02 | 49.1 | 42 | 35.7 | 42.3 | — | |
| APIGen-MT-SFTModel Size=8B, Strategy=SFT2026.03 | 49.1 | 22.9 | 12.6 | — | — | |
| Qwen3-14BParameters=14B2026.02 | 48 | 30 | 26.9 | 36.1 | — | |
| MUA-8BParameters=8B, Training=w/ SFT2026.02 | 47.4 | 40 | 23.9 | 36.4 | — | |
| EnvScaler-4BParameters=4B, Training=w/ SFT2026.02 | 46.5 | 36 | 23.7 | 35.3 | — | |
| EnvScaler-8BParameters=8B, Training=w/ SFT2026.02 | 43 | 40 | 26.3 | 35.6 | — | |
| Qwen3-8BParameters=8B2026.02 | 41.2 | 30.5 | 23.5 | 32 | — | |
| Qwen3-8B-ThinkingModel Size=8B, Strategy=Thinking2026.03 | 38.9 | 29.7 | 24.4 | — | — | |
| ToolACE-8BParameters=8B2026.02 | 38.7 | 18 | 21.2 | 27.8 | — | |
| Qwen3-8Bzero-shot=true2026.02 | 38.4 | 30.5 | 21.5 | — | — | |
| ToolACE-14BParameters=14B2026.02 | 36.8 | 24 | 29.8 | 31.6 | — | |
| IterResearchModel=Qwen3-Thinking-30B-A3B2026.01 | 34.2 | 44 | 20.2 | — | 11.3 | |
| MUA-SFTModel Size=8B, Strategy=SFT2026.03 | 31.4 | 16 | 9 | — | — | |
| U-FoldModel=Qwen3-4B2026.01 | 22.8 | 36 | 19.3 | — | — | |
| ReActModel=Qwen3-4B2026.01 | 21.9 | 34 | 19.3 | — | 1.1 | |
| ReSumModel=Qwen3-4B2026.01 | 20.2 | 30 | 18.4 | — | 3.7 | |
| IterResearchModel=Qwen3-4B2026.01 | 14.1 | 22 | 24.6 | — | 3.7 | |
| ToolACE-4BParameters=4B2026.02 | 12.3 | 24 | 20.2 | 17.6 | — |