Agent Performance on tau-bench
78.3Retail AccuracyGPT-5-think
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-5-think2026.02 | 78.3 | 44 | 67.8 | — | |
| GPT-5-thinkingModel Source=Closed-Source Large Language Models2025.12 | 78.3 | 44 | — | — | |
| Claude-Sonnet-42026.02 | 73.9 | 40 | 63.6 | — | |
| Kimi-K2-1T-A32BParameters=1T2026.02 | 73.9 | 51.2 | 67 | — | |
| Claude-Sonnet-4Model Source=Closed-Source Large Language Models2025.12 | 73.9 | 40 | — | — | |
| Kimi-K2-1T-A32BModel Source=Open-Source Large Language Models2025.12 | 73.9 | 51.2 | — | — | |
| AutoForge-30B-A3BModel Source=Open-Source Large Language Models2025.12 | 73.1 | 56.5 | — | — | |
| AgentSkillerParameters=14B, Subset=Full Set (with Cross-Domain Subset)2026.02 | 73 | 54 | 67.2 | — | |
| MUA-RL-32BModel Source=Open-Source Large Language Models2025.12 | 72.6 | 46.5 | — | — | |
| GPT-o32026.02 | 70.4 | 52 | 64.8 | — | |
| GPT-o4-mini2026.02 | 70.4 | 46 | 63 | — | |
| Seed-OSS-36BParameters=36B2026.02 | 70.4 | 46 | 63 | — | |
| AgentScaler-30B-A3BParameters=30B2026.02 | 70.4 | 54 | 65.4 | — | |
| GPT-o3Model Source=Closed-Source Large Language Models2025.12 | 70.4 | 52 | — | — | |
| GPT-o4-miniModel Source=Closed-Source Large Language Models2025.12 | 70.4 | 46 | — | — | |
| Seed-OSS-36BModel Source=Open-Source Large Language Models2025.12 | 70.4 | 46 | — | — | |
| AgentScaler-30B-A3BModel Source=Open-Source Large Language Models2025.12 | 70.4 | 54 | — | — | |
| Gemini-2.5-pro2026.02 | 68.7 | 44 | 61.2 | — | |
| Qwen3-Coder-30B-A3BParameters=30B2026.02 | 68.7 | 48 | 62.4 | — | |
| Gemini-2.5-proModel Source=Closed-Source Large Language Models2025.12 | 68.7 | 44 | — | — | |
| Qwen-Coder-30B-A3BModel Source=Open-Source Large Language Models2025.12 | 68.7 | 48 | — | — | |
| GPT-OSS-120B-A5BParameters=120B2026.02 | 67.8 | 49.2 | 62.1 | — | |
| Qwen3-Thinking-235B-A22BParameters=235B2026.02 | 67.8 | 46 | 61.2 | — | |
| Qwen3-Thinking-30B-A3BParameters=30B2026.02 | 67.8 | 48 | 61.8 | — | |
| GPT-OSS-120B-A5BModel Source=Open-Source Large Language Models2025.12 | 67.8 | 49.2 | — | — | |
| Qwen3-Thinking-235B-A22BModel Source=Open-Source Large Language Models2025.12 | 67.8 | 46 | — | — | |
| Qwen3-Thinking-30B-A3BModel Source=Open-Source Large Language Models2025.12 | 67.8 | 48 | — | — | |
| xLAM-2-70B-fc-rParameters=70B2026.02 | 67.1 | 45.2 | 60.4 | — | |
| xLAM-2-70B-fc-rModel Source=Open-Source Large Language Models2025.12 | 67.1 | 45.2 | — | — | |
| Deepseek-V3.1-671B-A37BParameters=671B2026.02 | 66.1 | 40 | 58.1 | — | |
| Deepseek-V3.1-671B-A37BModel Source=Open-Source Large Language Models2025.12 | 66.1 | 40 | — | — | |
| xLAM-2-32B-fc-rParameters=32B2026.02 | 64.3 | 45 | 58.4 | — | |
| AgentScaler-4BParameters=4B2026.02 | 64.3 | 54 | 61.2 | — | |
| xLAM-2-32B-fc-rModel Source=Open-Source Large Language Models2025.12 | 64.3 | 45 | — | — | |
| AgentSkillerParameters=4B, Subset=Full Set (with Cross-Domain Subset)2026.02 | 62.6 | 54 | 60 | — | |
| ToolMind-14BParameters=14B2026.02 | 60 | 46 | 55.7 | — | |
| Qwen3-Thinking-4BParameters=4B2026.02 | 59.1 | 52.5 | 57.1 | — | |
| AgentSkillerParameters=8B, Subset=Full Set (with Cross-Domain Subset)2026.02 | 59.1 | 36 | 52.1 | — | |
| xLAM-2-8B-fc-rParameters=8B2026.02 | 58.2 | 35.2 | 51.2 | — | |
| ToolMind-8BParameters=8B2026.02 | 57.4 | 36 | 50.9 | — | |
| EnvScaler-14BParameters=14B, Training=w/ SFT2026.02 | 55.7 | 26 | 46.6 | — | |
| AgentSkillerParameters=8B, Subset=Single-Domain Subset2026.02 | 53.9 | 32 | 47.2 | — | |
| AgentSkillerParameters=14B, Subset=Single-Domain Subset2026.02 | 53 | 28 | 45.4 | — | |
| AgentScaler-8BParameters=8B2026.02 | 50.4 | 42 | 47.8 | — | |
| EnvScaler-8BParameters=8B, Training=w/ SFT2026.02 | 48.7 | 34 | 44.2 | — | |
| MUA-14BParameters=14B, Training=w/ SFT2026.02 | 48.7 | 36 | 44.8 | — | |
| AgentSkillerParameters=4B, Subset=Single-Domain Subset2026.02 | 47 | 24 | 40 | — | |
| Qwen3-14BParameters=14B2026.02 | 45.7 | 31 | 41.2 | — | |
| Qwen3-8BParameters=8B2026.02 | 45.2 | 25 | 39 | — | |
| EnvScaler-4BParameters=4B, Training=w/ SFT2026.02 | 44.4 | 40 | 43.1 | — | |
| MUA-8BParameters=8B, Training=w/ SFT2026.02 | 43.5 | 26 | 38.2 | — | |
| ToolACE-14BParameters=14B2026.02 | 37.4 | 22 | 32.7 | — | |
| ToolACE-8BParameters=8B2026.02 | 27 | 10 | 21.8 | — | |
| MUA-4BParameters=4B, Training=w/ SFT2026.02 | 14.8 | 18 | 15.8 | — | |
| ToolACE-4BParameters=4B2026.02 | 13 | 14 | 13.3 | — | |
| Claude Sonnet 4.5Variant=Sonnet 4.52026.01 | — | — | — | 84.7 | |
| DeepSeek-V3.2 ThinkingThinking Mode=true2026.01 | — | — | — | 80.3 | |
| Gemini-3.0 ProVariant=Pro2026.01 | — | — | — | 85.4 | |
| GPT-5 HighVariant=High2026.01 | — | — | — | 80.2 | |
| Kimi-K2 ThinkingThinking Mode=true2026.01 | — | — | — | 74.3 | |
| MiMo-V2-FlashVariant=Flash2026.01 | — | — | — | 80.3 |