Function Calling on Tau-bench (τ²)
88.74Average AccuracyGLM-5.1
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GLM-5.12026.06 | 88.74 | 85.09 | 82 | 99.12 | |
| Claude Opus-4.62026.06 | 87.73 | 81.8 | 82.5 | 99.3 | |
| Claude Opus-4.72026.06 | 85.93 | 81.8 | 88.5 | 87.5 | |
| Gemini 3.1-Pro2026.06 | 84.42 | 83.77 | 76.5 | 99.3 | |
| Kimi-K2.62026.06 | 84.28 | 72.15 | 82 | 98.68 | |
| Ring-2.6-1Tvariant=high2026.06 | 84.26 | 78.07 | 78 | 96.71 | |
| OpenAI GPT-5.42026.06 | 83.63 | 74.34 | 80.5 | 96.05 | |
| Ring-2.6-1Tvariant=xhigh2026.06 | 83.44 | 77.85 | 77.5 | 94.96 |