Language Agent Interaction on AgentWorldBench main results rubric mean
70.1MCP ScoreGPT-5.4
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4Model Category=Frontier2026.06 | 70.1 | 37.26 | 53.69 | 66.29 | 60 | 51.8 | 68.58 | 58.25 | |
| Claude Sonnet 4.6Model Category=Frontier2026.06 | 70 | 28.79 | 56.98 | 64.52 | 58.03 | 50.78 | 63.17 | 56.04 | |
| Claude Opus 4.6Model Category=Frontier2026.06 | 69.9 | 29.3 | 57.51 | 64.55 | 61.74 | 51.42 | 70.2 | 57.8 | |
| Qwen3.5-397B-A17BModel Category=Ours2026.06 | 68.31 | 30.81 | 55.3 | 64.44 | 54.9 | 48.55 | 60.85 | 54.74 | |
| Qwen-AgentWorld-397B-A17BModel Category=Ours2026.06 | 68.24 | 37.82 | 57.73 | 68.49 | 60.2 | 50.98 | 67.89 | 58.71 | |
| GLM-5.1Model Category=Open-weight2026.06 | 67.6 | 22.46 | 47.32 | 52.07 | 59.1 | 51.5 | 59.13 | 51.31 | |
| Qwen3.6-Max-PreviewModel Category=Qwen2026.06 | 67.01 | 24.71 | 50.86 | 57.11 | 57.74 | 48.58 | 60.95 | 52.42 | |
| Kimi K2.6Model Category=Open-weight2026.06 | 65.23 | 27.48 | 52.54 | 58.77 | 58.93 | 50.2 | 60.8 | 53.42 | |
| Qwen-AgentWorld-35B-A3BModel Category=Ours2026.06 | 64.79 | 36.69 | 53.96 | 65.63 | 58.17 | 49.55 | 65.92 | 56.39 | |
| DeepSeek-V4-ProModel Category=Open-weight2026.06 | 63.27 | 27.61 | 51.26 | 59.44 | 55.17 | 50.32 | 63.7 | 52.97 | |
| Gemini 3.1 ProModel Category=Frontier2026.06 | 59.07 | 30.21 | 52.47 | 59.07 | 61.4 | 52.83 | 66.92 | 54.57 | |
| Qwen3.5-35B-A3BModel Category=Ours2026.06 | 57.87 | 25.98 | 46.13 | 47.58 | 53.18 | 47.1 | 56.27 | 47.73 | |
| MiniMax-M2.7Model Category=Open-weight2026.06 | 55.82 | 27.3 | 41.62 | 37.44 | 52.4 | 50.52 | 57.73 | 46.12 | |
| Qwen3.6-PlusModel Category=Qwen2026.06 | 55.28 | 21.94 | 50.58 | 59.08 | 57.65 | 50.78 | 60.33 | 50.81 | |
| Claude Opus 4.8Model Category=Frontier2026.06 | 54.93 | 35.14 | 59.18 | 64.1 | 61.5 | 54.66 | 66.62 | 56.59 | |
| Qwen3.6-35B-A3BModel Category=Qwen2026.06 | 42.96 | 18.78 | 43.81 | 40.71 | 51.88 | 46.53 | 55.48 | 42.88 |