General Task (Agentic Coding) on tau2-Bench Telecom
98.2ScoreGLM-5
Evaluation Results
| Method | Links | |
|---|---|---|
| GLM-5Source=artificialanalysis.ai2026.03 | 98.2 | |
| Gemini 3.1 ProSource=artificialanalysis.ai2026.03 | 95.6 | |
| KAT-Coder-V2Evaluation Environment=KwaiEnv2026.03 | 93.9 | |
| Claude Opus 4.6Source=artificialanalysis.ai2026.03 | 92.1 | |
| GPT-5.4Source=artificialanalysis.ai2026.03 | 91.5 | |
| MiniMax M2.7Source=artificialanalysis.ai2026.03 | 84.8 |